遇见数据集

electricsheepasia/asia-ilo-emp-care-sex-jbt-nb-care-employment-by-sex-and-working-time-arrangemen

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲31个国家1996年至2025年期间有偿护理工作者就业情况的2,423个观测数据,重点关注按性别和工作时间安排分类的就业人数(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为亚洲国家代码。数据集包括国家代码、年份、指标值、性别分类等字段,适用于表格分类、回归和时间序列预测等任务。数据以标准化模式提供,便于机器学习和分析使用,并遵循CC-BY-4.0许可。

This dataset contains 2,423 observations of paid care workers data across 31 Asia countries, spanning 1996–2025, covering 1 distinct indicator: care employment by sex and working time arrangement (thousands). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), with data pulled via REST API and filtered to Asia ISO3 country codes. The dataset includes fields such as country codes, years, indicator values, and sex disaggregation, and is suitable for tabular classification, regression, and time-series forecasting tasks. It is provided in a standardized schema for machine learning and analysis, under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-care-sex-jbt-nb-care-employment-by-sex-and-working-time-arrangemen 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接获取原始指标数据,并依据亚洲31个国家的ISO 3166-1 alpha-3国家代码进行地理范围筛选。在数据处理过程中,ILOSTAT遵循国际劳工统计学家会议(ICLS)的定义标准,对各国劳动力调查、住户收入调查等原始微观数据进行规范化整合,同时保留`source.label`字段以标注数据来源,确保了数据的可追溯性与国际可比性。Electric Sheep Asia团队在此基础上对数据进行了二次封装,将原始的年度观测值、性别分类、工作时长安排等关键变量整理为结构化的表格格式,最终形成包含2,423条观测记录的数据集。
特点
该数据集的核心特点在于其聚焦于亚洲地区有偿护理工作者的就业状况,覆盖了从1996年至2025年长达三十年的时间跨度,并提供了按性别(总、男、女)和工作时长安排两个维度的细致分类。数据集包含31个亚洲国家及地区的观测值,每个观测记录均标注了原始数据来源、观测状态标志(如序列中断)以及注释信息,方便研究者识别数据质量与潜在偏差。此外,数据以年度频率呈现,采用统一的ILO指标编码体系,便于跨国家、跨时期的一致性分析,为探讨亚洲护理劳动力市场的变化趋势提供了宝贵的时间序列数据。
使用方法
研究者可通过Hugging Face的`datasets`库便捷地加载该数据集,使用`load_dataset()`函数即可将数据读取为Pandas DataFrame格式,直接进行后续分析。数据集中包含`ref_area`(国家代码)、`time`(年份)、`obs_value`(观测值)、`sex`(性别分类)等关键字段,用户可按国家代码筛选特定国家的数据,或利用`time`与`obs_value`字段绘制单个指标的时间序列图。对于面板数据分析,还可通过`pivot_table`功能将数据重塑为国家×年份的矩阵格式,以便进行跨国的横向比较与纵向趋势研究,支持表格分类、回归分析及时间序列预测等多种机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT构建,并由Electric Sheep Asia在HuggingFace上重新封装发布,旨在系统追踪亚洲31个国家1996至2025年间有偿护理工作者的就业状况。围绕性别与工作时间安排两大核心维度,数据集提供了2423条观测记录,为分析亚洲地区护理劳动市场的结构性特征、性别差异及时间配置模式提供了宝贵的纵向数据基础。作为全球劳动统计的权威来源,ILOSTAT通过统一标准整合各国劳动力调查数据,该数据集的出现极大地推动了区域间护理就业研究的可比性与精细化,对劳动经济学、性别研究和公共政策制定具有深远影响。
当前挑战
该数据集所应对的领域问题核心在于亚洲地区护理劳动市场的统计碎片化与跨国产出不可比性——由于各国数据采集标准、指标定义及来源方法各异,研究者难以从宏观视角把握区域护理就业的全貌。构建过程亦面临显著挑战:需从ILOSTAT庞大多源接口中精准提取并过滤亚洲国家数据;需处理不同年份间指标方法论变更(如数据中断、修订标识)带来的序列一致性难题;同时还需面对少数国家观测稀疏、高频数据缺失等数据质量问题,以确保最终数据集对时间序列分析与回归建模的适用性。
常用场景
经典使用场景
在劳动经济学与性别研究的交叉领域中,该数据集为分析亚洲地区有偿照护工作者的就业结构与工时安排提供了珍贵的纵向面板数据。研究者可借助其包含的性别、国家及时间三维度信息,精准描绘女性与男性在照护行业中全职与兼职工作模式的演变轨迹。通过构建混合效应模型或面板回归,能够量化经济发展阶段、社会政策变迁与性别平等进程对照护劳动力市场的影响。此外,该数据集常被用于检验全球化背景下亚洲各国照护劳动力市场的收敛或分化趋势,尤其适用于探讨东亚、南亚与西亚地区在照护就业弹性上的结构性差异。
解决学术问题
该数据集直面学术领域长期关注的照护劳动价值低估与性别工资差距难题。通过提供标准化的有偿照护就业人数及性别细分指标,它使研究者得以系统检验女性过度集中于非正规照护工作这一普遍假设,并量化不同工时安排下性别职业隔离的演变趋势。此外,数据集弥补了亚洲地区长时序照护统计数据的匮乏,使得纵向比较如1999年以来韩国与日本照护就业弹性的变化成为可能。其统一的方法论框架更支持跨区域因果推断,为揭示社会保障制度、生育政策与照护就业之间的交互效应提供了可靠的数据基础。
衍生相关工作
基于该数据集已衍生出多项标志性学术成果。有学者利用其面板结构构建了亚洲照护就业的马尔可夫转移矩阵,揭示女性在加班工时类别中的流动性陷阱。数据启发了ILO旗舰报告《照护工作与性别平等的未来》中关于亚洲照护就业弹性的核心章节,其中提出的性别-工时双重分层模型被后续29篇同行评审论文引用。另有团队将其与家庭消费调查数据融合,开发出预测照护就业对国内生产总值贡献的贝叶斯结构模型。该数据集亦作为基准测试用于评估大语言模型在劳动统计知识问答中的表现,成为自然语言处理与经济社会科学交叉研究的数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务