遇见数据集

electricsheepasia/asia-ilo-emp-care-sex-how-nb-care-employment-by-sex-and-weekly-hours-actually-w

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含5,541个观测值,涉及有偿护理工作者数据,覆盖31个亚洲国家,时间跨度为1997年至2025年,涵盖1个独特指标:按性别和每周实际工作小时数划分的护理就业人数(千)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,经过处理和过滤,专注于亚洲地区。数据集包括国家代码、国家名称、数据来源、指标代码、性别分类、时间年份、观测值等字段,用于表格分类、回归和时间序列预测等任务。

This dataset contains 5,541 observations of Paid care workers data across 31 Asia countries, spanning 1997–2025, covering 1 distinct indicators: Care employment by sex and weekly hours actually worked (thousands). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), processed and filtered for Asia. It includes fields such as country code, country name, data source, indicator code, sex disaggregation, time year, and observed values, and is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-care-sex-how-nb-care-employment-by-sex-and-weekly-hours-actually-w 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于亚洲地区有偿护理工作者的就业状况。数据通过调用ILOSTAT REST API(接口ID为EMP_CARE_SEX_HOW_NB)直接获取,并依据亚洲ISO3国家代码进行过滤筛选。ILO统计部门对原始调查微观数据进行了标准化处理,遵循国际劳工统计学家会议(ICLS)的定义规范,所有数据源均在source.label字段中加以标识,确保了数据的可追溯性与跨国家之间的可比性。最终数据集涵盖了31个亚洲国家、跨越1997年至2025年的5,541条观测记录,构成了一个结构化的面板数据集合。
特点
本数据集最显著的特点在于其精细的性别与工作时间维度拆解。观测变量'EMP_CARE_SEX_HOW_NB'不仅按性别(总、男、女、其他)进行分类,还通过classif1字段提供了实际工作周小时的区间划分,为深入分析亚洲各国护理行业劳动供给模式提供了宝贵素材。数据本身具有多源性,来源包括劳动力调查、家计调查等官方统计渠道,并附有状态标志(如provisional、unreliable)和方法论修订备注(Break in series),使用户能够评估每条观测的质量。此外,数据集覆盖面广,从伊朗、越南到柬埔寨,时间序列长度各异,支持跨国与跨时间的对比研究。
使用方法
用户可通过HuggingFace Datasets库便捷调用,执行`load_dataset()`即可将数据加载为DataFrame格式。入手后,可通过`ref_area`字段按国家进行筛选,例如使用`df[df['ref_area'] == 'IDN']`提取印度尼西亚子集。对于时间序列分析,可按`indicator`和`time`排序后调用`plot()`绘制趋势图。更高级的用法包括利用`pivot_table`将数据重塑为国家×年份的矩阵,以便进行面板数据回归或聚类分析。数据集提供了包含性别的分层变量,在进行模型训练时,可将其作为分类或回归特征,充分挖掘护理就业在不同性别与工时组合下的差异性规律。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT发布,并由Electric Sheep Asia重新打包整理。ILOSTAT作为全球劳动统计的权威来源,长期致力于为政策制定者与研究人员提供涵盖就业、工资、工时等维度的标准化数据。本数据集聚焦亚洲31个国家的有偿照护工作者,收录了1997年至2025年间共计5,541条观测值,依据性别与实际周工作时长对劳动力市场中的照护行业进行精细划分。这一数据集的出现填补了亚洲区域在照护经济领域高颗粒度、长时间序列数据的空白,为理解性别分工、照护劳动价值及非正规就业转型提供了关键实证支撑,尤其对SDG体面工作目标的监测具有深远意义。
当前挑战
该数据集所解决的领域核心挑战在于,照护工作长期被传统劳动统计忽视,尤其是亚洲地区缺乏系统性与可比性的性别化工时数据,阻碍了政策对无偿与有偿照护劳动的真实评估。构建过程中面临多重困难:各国劳动调查的问卷设计、定义标准与国际劳工统计学家会议(ICLS)框架的衔接存在差异,导致数据来源标识需逐条追踪溯源;部分国家存在年度数据间断与“最佳来源”取舍问题,需依赖ILO官方筛选机制进行协调;实时API抽取与人工审核结合的流程中,数据质量标志(如不可靠、序列中断)的处理增加了清洗复杂度,而31国跨越近30年的异构数据在列模式上需强制一致化,方能确保机器学习就绪格式的兼容性。
常用场景
经典使用场景
该数据集在劳动经济学与性别研究领域中扮演着基石角色,常用于探究亚洲地区有偿照护工作者(Paid care workers)的就业状况与工作时长分布。研究者可借助此数据集,按性别与每周实际工作小时数对31个亚洲国家进行跨年度比较分析,从而揭示照护行业劳动力市场的动态变迁。其时间跨度从1997年至2025年,涵盖超过5500条观测值,为构建面板数据模型提供了丰富素材,常被用于绘制国家×年份的就业矩阵,或聚焦特定国家(如印度尼西亚)进行时间序列回归分析,以量化政策变迁、经济周期或社会文化因素对照护就业的影响。
实际应用
在实际应用层面,该数据集为国际组织、国家统计局及非政府组织提供了监控和评估照护行业就业质量的量化工具。开发人员可借助其标准化的API获取接口与HuggingFace Datasets库的无缝集成,快速构建用于预测照护就业趋势的机器学习模型,例如利用历史时序数据训练回归模型以预估未来五年内特定国家女性照护工作者的就业占比。此外,该数据还支持劳动政策模拟系统的搭建——通过按性别和工时分组的就业结构分析,政府机构能更精准地识别照护行业中的隐性就业不足群体,从而设计针对性补贴方案或工作条件改善计划,推动体面劳动议程在亚洲国家间的本土化落地。
衍生相关工作
基于该数据集,学术界已衍生出多项具有影响力的后续工作。其中最典型的包括基于面板数据计量方法(如固定效应模型和工具变量法)开展的亚洲照护就业决定因素研究,这些工作量化了经济增长、教育水平提升和性别平等政策对照护就业率的边际贡献。另一类衍生工作聚焦于照护工作者的工时异质性分析,利用该数据集的性别与工时分跨类别变量,聚类出“长工时女性化”与“短工时男性化”等典型就业模式,进而批判性地检验了传统劳动经济学中“工时中性”假设在照护行业的失效。此外,该数据集还作为基准测试集,被用于评估新兴时间序列预测框架(如Transformer与时序混合模型)在劳动统计领域的泛化性能,推动了统计学与计算机科学的交叉融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务