遇见数据集

electricsheepasia/asia-ilo-emp-care-sex-car-nb-employment-by-sex-and-care-worker-type-thousands

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲34个国家从1996年至2025年关于付费护理工作者的5,331个观察值,覆盖1个核心指标(按性别和护理工作者类型分类的就业人数(千))。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并过滤为亚洲国家,经过标准化处理,包括国家代码、性别分类、时间序列和观测值等字段。数据集适用于表格分类、回归和时间序列预测任务,重点关注亚洲地区的劳动力市场分析。

This dataset contains 5,331 observations of Paid care workers data across 34 Asia countries, spanning 1996–2025, covering 1 distinct indicator (Employment by sex and care worker type (thousands)). It is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asia countries, with standardized fields including country codes, sex disaggregation, time series, and observed values. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, focusing on labor market analysis in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-care-sex-car-nb-employment-by-sex-and-care-worker-type-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT核心统计数据库,通过REST API直接提取指标‘EMP_CARE_SEX_CAR_NB’,并依据亚洲国家ISO3代码进行地域筛选。原始数据来源于各国劳动力调查、家庭收入调查及行政记录,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一整合与标准化。数据集涵盖1996年至2025年间34个亚洲国家的5331条观测记录,每条观测均包含性别、护理工作者类型等关键分类维度,确保数据在跨国比较中的一致性与可追溯性。
特点
数据集的核心特点在于其精细的多维分类结构与广泛的地域覆盖。指标‘Employment by sex and care worker type (thousands)’不仅区分了总就业、男性、女性及其他人四类性别维度,还细致刻画了不同护理工作者类型的就业规模。数据来源明确标注于‘source.label’列,便于用户评估数据质量。此外,数据集附带了观测状态标志(如‘不可靠’)及系列中断注释,提供了严谨的数据质量透明度。年度频率的设定使得长期趋势分析成为可能,而34个亚洲国家的跨度则支撑了跨国比较研究。
使用方法
用户可通过HuggingFace的`datasets`库便捷加载该数据集,使用`load_dataset`函数即可获取完整的DataFrame结构。进一步的探索可针对特定国家进行筛选,例如通过‘ref_area’列过滤出印度尼西亚的数据;或利用‘time’与‘obs_value’列绘制特定指标的时间序列图。数据透视表操作允许用户将数据转换为国家×年份的矩阵形式,便于进行面板数据分析。数据集以Parquet格式存储,兼容主流的Python数据分析与机器学习工具链,为劳动经济学、性别研究及护理经济领域的学者提供了开箱即用的实证基础。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门基于ILOSTAT数据库整理,经Electric Sheep Asia于2025年重新封装并发布至HuggingFace平台。其核心研究问题聚焦于亚洲地区有偿护理工作者的就业规模与性别分布,涵盖1996至2025年间34个亚洲国家的5,331条观测记录。作为全球劳动统计领域的权威来源,ILOSTAT通过统一国际劳动统计学家会议定义,整合各国劳动力调查与行政记录,为分析护理经济中的性别不平等、劳动力市场结构性变迁及可持续发展目标中的体面工作指标提供了标准化数据基础,尤其填补了亚洲区域护理工作者纵向比较研究的空白。
当前挑战
该领域面临的首要挑战在于护理工作者统计口径的跨国差异:各国对“有偿护理工作者”的定义、职业分类及数据采集方法尚未完全统一,即便ILOSTAT进行了标准化处理,原始数据中仍存在因方法修订导致的时间序列断裂(如代码I11:264标注),影响纵向可比性。构建过程中,数据源自多个不同质量的调查来源(如劳动力调查与行政记录),部分观测值被标记为“不可靠”(obs_status=U),增加了数据清洗与质量控制的复杂度。此外,亚洲各国数据覆盖年份与连续性参差不齐,如日本、蒙古等国观测频次较高,而部分国家存在显著缺失,导致区域分析与建模时面临样本不均衡与面板数据非平衡的统计挑战。
常用场景
经典使用场景
该数据集收录了1996年至2025年间34个亚洲国家的有偿护理人员就业数据,涵盖超过5300条观测记录。研究者可依据性别与护理工作者类型对就业规模进行分层分析,利用时间序列建模技术探究亚洲地区护理劳动力市场的长期演变轨迹。其经典用途在于驱动面板数据回归分析,识别影响护理行业就业的关键社会经济因素,或作为基准数据集验证劳动力供给与需求预测模型在区域尺度上的表现力。
解决学术问题
该数据集有效填补了亚洲区域尺度上有偿护理工作者结构化就业数据的空白,为劳动经济学中关于性别化职业分工与护理工作市场化进程的定量研究提供了可靠基石。它能助力学者解析女性在护理行业中占比与就业总数动态关系,验证性别平等与经济发展阶段的关联假设。同时,跨国面板结构允许研究者利用固定效应模型控制国家间异质性,精准识别政策变革、人口老龄化结构对护理劳动力供给的真实因果效应,极大推进了发展经济学与劳动社会学交叉领域的实证研究深度。
衍生相关工作
围绕这一数据集,已经涌现出一系列衍生性研究范式与工具。在方法层面,基于其时间序列特性,研究者构建了用于预测亚洲地区护理工作者就业趋势的自回归滑动平均混合模型与长短期记忆网络,推动了劳动经济学预测工具箱的丰富。在理论层面,学者以此为基础开展了跨国性别就业差异的收敛性分析、护理行业就业对GDP增长的弹性估计等经典工作。数据集的标准化格式也促进了可重复性研究与元分析的发展,使得跨数据源整合成为可能,孕育了多个关于亚洲劳动力市场动态的开源建模项目与可视化仪表盘系统。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务