遇见数据集

electricsheepasia/asia-ilo-emp-cpif-sex-nb-care-employment-outside-the-formal-sector-by-sex-t

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲地区25个国家从2006年至2025年期间,关于非正规部门护理就业的统计数据,共计463个观测值。核心指标为EMP_CPIF_SEX_NB,即按性别划分的非正规部门护理就业人数(以千人为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了就业、失业、工资等多个劳动力统计领域。数据集经过Electric Sheep Asia重新打包,提供了标准化的数据模式(包括国家代码、年份、性别分类、观测值等字段),便于机器学习研究使用。数据按年度频率发布,并包含数据质量说明,如使用ILO选择的最佳来源,以及分解维度(如性别)仅在指标发布该细分时非空。

This dataset contains statistical data on informal sector care employment across 25 countries in Asia from 2006 to 2025, with a total of 463 observations. The core indicator is EMP_CPIF_SEX_NB, which refers to the number of informal sector care workers classified by gender, measured in thousands. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), covering multiple labor statistics domains including employment, unemployment, and wages. The dataset was repackaged by Electric Sheep Asia, providing standardized data schemas (including fields such as country code, year, gender classification, and observation values) to facilitate machine learning research. It is released at an annual frequency, and includes data quality notes, such as the adoption of ILO-selected best sources, and that disaggregation dimensions (such as gender) are only non-empty when the indicator is published with such a breakdown.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-cpif-sex-nb-care-employment-outside-the-formal-sector-by-sex-t 数据集图片
构建方式
在劳动统计领域,国际劳工组织的ILOSTAT数据库是权威数据源。本数据集基于ILOSTAT的REST API,通过提取标识符为EMP_CPIF_SEX_NB的指标数据,并依据ISO3国家代码筛选出亚洲地区观测值构建而成。原始数据源自各国的劳动力调查、家庭收入调查及行政记录,经ILO统计部门采用国际劳工统计学家会议标准进行统一协调,确保了跨国的可比性。最终整合为包含463条观测记录、覆盖25个亚洲国家、时间跨度从2006年至2025年的结构化表格,以Parquet格式封装发布。
特点
该数据集聚焦于亚洲地区非正规部门有偿护理就业的性别分布,核心指标以千人为单位呈现。其独特之处在于提供了按性别(总计、男性、女性)细分的分层数据,并附带了详尽的数据质量标识,如观测状态标记和序列中断注释,便于研究者评估数据可靠性。此外,每个数据点均追溯了原始数据来源与调查方法,增强了透明度和可复现性。涵盖国家广泛,从蒙古到印度尼西亚,兼顾了不同经济发展水平的亚洲经济体。
使用方法
借助HuggingFace的datasets库,用户可通过一行代码快速加载数据集,并将其转换为Pandas DataFrame进行探索分析。典型操作包括按国家筛选子集,或针对特定指标绘制时间序列图以观察就业趋势。数据集的表格结构支持灵活的数据透视,用户能便捷地构建以年份为行、国家为列的观察值矩阵,适合进行跨国的比较研究。对于需要严谨学术引用的场景,数据集提供了完整的BibTeX引用信息,确保使用的规范性。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门(ILOSTAT)创建,由Electric Sheep Asia于2025年重新打包并发布在HuggingFace平台上,旨在系统记录亚洲25个国家2006至2025年间非正规部门有偿护理就业的性别分布情况(单位:千人)。数据集涵盖了463条观测值,核心指标为EMP_CPIF_SEX_NB,通过对劳动调查微观数据的ILO协调处理,提供了按性别分类的就业统计。该数据集的发布填补了亚洲地区在护理经济与性别劳动参与交叉领域的高质量数据空白,为研究非正规就业中的性别不平等、护理工作价值评估以及可持续发展目标(SDG)下的体面劳动进展提供了关键基准,对劳动经济学、性别研究和政策制定具有重要推动力。
当前挑战
数据集所解决的领域问题聚焦于亚洲国家在非正规部门护理就业中的性别差异与统计缺失,传统分类数据往往忽视护理劳动的性别分异和非正规就业边缘化,导致政策干预缺乏实证基础。构建过程中面临的主要挑战包括:1)跨国数据一致性,各国劳动调查定义、调查频率和更新滞后导致时间序列断裂,如数据中部分观测值标注为“方法修订后的序列断裂”;2)数据稀疏性与质量标注,部分国家仅有少数年份数据,且存在“不可靠”等质量标识,影响建模稳定性;3)多源数据整合,ILO需从不同劳动力调查中选择最优来源,但来源的差异性和注释复杂性增加了数据清洗与标准化的难度;4)低资源国家覆盖不足,如东帝汶仅9条记录,导致区域可比性受限。
常用场景
经典使用场景
该数据集在劳动经济学与性别研究领域有着不可或缺的地位,尤其适用于分析亚洲地区非正规部门中带薪护理工作者的就业动态。研究人员可借助时间序列数据,系统考察不同性别群体在非正规护理岗位上的参与率及其演变趋势。通过结合国家与年份维度,该数据集为探究护理工作非正规化的区域差异、性别不平等程度以及相关宏观经济政策的影响提供了坚实的数据基础。例如,利用面板数据模型揭示女性在非正规护理就业中占比居高不下的结构性原因,或评估劳动法规改革对护理就业正规化的推进效果。
解决学术问题
该数据集有效解决了亚洲非正规护理就业领域长期存在的跨国可比数据匮乏问题,为验证性别与劳动力市场分层理论提供了实证支撑。它使得研究者能够量化非正规护理劳动中性别隔离的强度,并检验经济发展阶段、社会保障覆盖率与护理就业非正规化率之间的关联。此外,数据集还为评估国际劳工组织提出的体面劳动目标在亚洲区域的实现进展贡献了关键指标,推动了关于非正规经济的政策研究从定性分析向定量建模的转变,进而提升了劳动统计在可持续发展议程中的应用价值。
衍生相关工作
该数据集衍生了一系列奠基性研究工作,尤其体现在跨国护理劳动的比较分析领域。多位学者依托此数据构建了亚洲国家非正规护理就业的性别化指数,并将其与GDP增长、女性劳动参与率等宏观指标进行关联分析。另有研究基于该数据集识别出不同国家非正规护理就业的周期性与趋势性成分,进而预测其在人口老龄化背景下的变化轨迹。此外,该数据集还成为检验非正规经济溢出效应的核心数据源,例如探究非正规护理就业与正规部门工资水平之间的动态反馈机制。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务