遇见数据集

electricsheepasia/asia-ilo-emp-cnif-sex-nb-informal-care-employment-by-sex-thousands

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为Informal care employment by sex (thousands) | Asia (ILOSTAT),中文可译为按性别分列的非正规护理就业数据(千)| 亚洲(ILOSTAT)。数据集包含465个观测值,覆盖25个亚洲国家,时间跨度为2006年至2025年,重点关注1个指标:EMP_CNIF_SEX_NB(即按性别分列的非正规护理就业人数,以千人为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,这是一个全球劳动统计的核心来源,整合了就业、失业、工资等多个领域的指标。数据集经过重新打包,由Electric Sheep Asia发布,旨在为亚洲地区提供机器学习就绪的数据层。数据包括国家代码、国家名称、数据来源、指标、性别分类(总计、男性、女性)、年份、观测值、观测状态等信息,并提供了数据质量说明和使用示例,如如何加载数据、按国家筛选或进行时间序列分析。数据集遵循cc-by-4.0许可协议,使用时需引用原始来源和重新打包方。

This dataset is titled Informal care employment by sex (thousands) | Asia (ILOSTAT) and contains 465 observations across 25 Asian countries, spanning the years 2006 to 2025. It focuses on one key indicator: EMP_CNIF_SEX_NB, which represents informal care employment disaggregated by sex, measured in thousands. The data is sourced from ILOSTAT, the International Labour Organizations central statistics database, which harmonizes labor statistics from national surveys and administrative records. Repackaged by Electric Sheep Asia, the dataset is designed as a machine-learning-ready data layer for Asia, providing a normalized schema in Parquet format. It includes columns such as country codes, country names, data sources, indicators, sex disaggregation (total, male, female), observation years, values, and status flags. The dataset comes with usage examples for loading, filtering, and analysis, and is released under the cc-by-4.0 license, requiring citation of both the original ILO source and the repackaging effort.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-cnif-sex-nb-informal-care-employment-by-sex-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT中央统计数据库,通过其REST API接口直接采集`EMP_CNIF_SEX_NB`指标数据,并依据ISO 3166-1 alpha-3国家代码筛选出亚洲地区的25个经济体。Electric Sheep Asia团队对原始数据进行规范化处理,整合为统一模式的Parquet文件,最终以HuggingFace Datasets格式重新封装。数据涵盖了2006年至2025年期间的年度观测值,共计465条记录,每条记录均包含国家、年份、性别细分、观测值及其来源标注等字段,确保了数据来源的可追溯性。
特点
该数据集聚焦于亚洲地区有偿护理工作者的非正式就业情况,按性别(总、男性、女性)进行细分,呈现了25个国家近二十年的年度时间序列数据。数据质量严格遵循ILO统计学家国际会议(ICLS)定义标准,并通过ILO精选的'最佳来源'确保每个国家-年份组合的单一性。数据集不仅提供了核心的观测值,还附带了数据状态标志(如临时、中断)和详细的注释信息(如方法论修订),为研究者评估数据可靠性提供了透明依据。
使用方法
用户可通过HuggingFace的`datasets`库轻松加载该数据集,调用`load_dataset("electricsheepasia/asia-ilo-emp-cnif-sex-nb-informal-care-employment-by-sex-thousands")`即可获取一个包含所有观测值的表格数据集。随后可借助Pandas库进行灵活的数据探索,如按国家代码筛选特定经济体的数据、按时间排序绘制指定指标的趋势图,或利用数据透视表构建国家×年份的矩阵,以进行跨国的比较分析。数据集结构清晰,字段命名规范,适合直接进行回归分析或时间序列预测建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT发布,并经Electric Sheep Asia重封装,聚焦亚洲25个国家2006至2025年间有偿护理工作者的非正式护理就业数据(以千人为单位)。在全球人口老龄化加速与护理需求激增的背景下,该数据集为解析亚洲地区性别化的护理劳动分工提供了关键定量依据。其对465条观测值的系统整理,有助于揭示性别、国家与时间维度上的就业结构异质性,尤其支持对非正式护理领域就业质量的跨国比较研究。作为ILO标准统计体系的重要延伸,该数据集填补了传统劳动统计中护理劳动细粒度数据的空白,为可持续生计与体面劳动目标的相关实证分析奠定了坚实基础。
当前挑战
数据集面临的核心挑战在于,非正式护理就业的统计口径高度依赖国家间差异化的调查问卷设计与ILO国际劳工统计学家会议(ICLS)定义的统一化程度,跨时期与跨国的数据可比性易受方法论调整的影响。构建过程中,从ILOSTAT API抽取原始数据时需处理多个来源冲突、断代序列标记以及按性别分组的稀疏性——例如,部分国家仅有总计值而无分性别的子集,导致性别维度的计量模型难以直接应用。此外,数据仅覆盖年度频率,缺失月度或季度波动信息,限制了微观经济周期分析的精度。对研究者而言,如何严格处理‘最佳来源’选择策略导致的样本偏差,并在缺失值插补中保持非正式就业的异质性特征,仍是方法论上的突出难题。
常用场景
经典使用场景
在劳动经济学与性别研究领域,该数据集广泛应用于分析亚太地区非正式照护就业的性别分化格局。研究者可依托其覆盖25国、跨度2006至2025年的年度观测数据,构建面板数据模型或时间序列模型,探究各国照护工作女性化趋势、非正规就业的演变路径及其与经济增长的关联。数据集中 'sex' 维度的细粒度划分(总、男、女)为检验性别工资差距、劳动参与率差异等经典假设提供了关键支撑,模型可复现性得益于ILOSTAT统一的数据采集与处理标准。
实际应用
在实际场景中,该数据集为国际劳工组织(ILO)、亚洲开发银行等机构制定区域就业战略提供了决策依据。政策制定者可利用其时间序列特征预测不同性别群体的照护就业弹性,优化养老护理补贴与产假制度的资源配置。非政府组织借助性别与来源国交叉分析,识别高风险群体并设计针对性职业培训计划。金融投资领域则将照护就业指标纳入ESG评估体系,辅助筛选在性别包容性方面表现优异的企业或公共项目。
衍生相关工作
该数据集催生了一系列延伸性学术工作,包括开发基于随机森林与LSTM的照护就业预测模型,以及构建亚洲照护经济卫星账户核算框架。部分研究将其与家庭收支调查数据关联,揭示非正式照护对女性职业流动的长期抑制效应。受其启发,学者进一步拓展出 '照护工作脆弱性指数',综合考量就业稳定性、社会保障覆盖与劳动条件三个维度。在方法论层面,该数据推动了可解释机器学习(SHAP值分析)在劳动力市场性别分析中的应用,使政策建议更具透明度与针对性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务