遇见数据集

electricsheepasia/asia-ilo-ear-cmta-sex-nb-average-monthly-earnings-of-care-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集来自国际劳工组织(ILO)的ILOSTAT数据库,专注于亚洲国家按性别划分的护理员工月平均收入(以本地货币计)。它包含508个观测值,覆盖24个亚洲国家,时间跨度为1996年至2025年,涉及一个核心指标(EAR_CMTA_SEX_NB)。数据集提供了详细的列信息,包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、观测年份、观测值、数据状态标志和相关注释。数据通过API获取,并经过ILO的标准化处理,确保一致性和可追溯性。适用于表格分类、回归和时间序列预测等任务,旨在支持劳动经济学和机器学习研究。

This dataset contains 508 observations of paid care workers data across 24 Asia countries, spanning 1996–2025, covering 1 distinct indicator: Average monthly earnings of care employees by sex (local currency). It is sourced from ILOSTAT, the ILOs central statistics database, and includes detailed columns such as country codes, source information, indicator codes, sex disaggregation, time, observed values, and quality flags. The data is harmonized using International Conference of Labour Statisticians definitions and is repackaged by Electric Sheep Asia for machine learning applications.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-cmta-sex-nb-average-monthly-earnings-of-care-employees-by-sex 数据集图片
构建方式
本数据集经由国际劳工组织(ILO)的ILOSTAT REST API直接提取,原始数据源自各国劳动力调查、家庭收支调查及行政记录等官方统计资料,并依据国际劳工统计学家会议(ICLS)定义进行统一标准化处理。Electric Sheep Asia团队进一步筛选出亚洲地区ISO 3166-1 alpha-3国家代码对应的观测值,重新打包为易于调用的Parquet格式,确保数据来源可追溯且结构清晰。
特点
该数据集包含508条观测记录,覆盖24个亚洲国家,时间跨度从1996年至2025年,聚焦于按性别划分的受薪护工人员的平均月收入(以本币计)。数据通过`sex`字段提供性别维度细分(总计、男性、女性、其他),并辅以`obs_status`标签标识观测状态(如序列中断),便于用户评估数据质量与时间序列的连续性。
使用方法
用户可通过HuggingFace Datasets库的`load_dataset()`函数一键加载数据,并转换为Pandas DataFrame进行后续分析。支持按国家过滤(如`ref_area == "IDN"`获取印度尼西亚数据)、按指标排序绘制时间序列图,或利用`pivot_table`构建国家×年份的矩阵面板数据,适用于面板回归、性别薪资差异比较及护理行业劳动力市场的时间序列建模等任务。
背景与挑战
背景概述
在全球劳动力市场研究中,护理行业从业者的经济待遇是衡量社会公平与可持续发展的重要维度。国际劳工组织(ILO)通过其ILOSTAT数据库长期追踪全球各国劳动力指标,其中亚洲地区护理人员按性别划分的平均月收入数据尤为关键。该数据集由Electric Sheep Asia于2025年整理发布,汇集了来自24个亚洲国家、横跨1996年至2025年的508条观测记录,核心指标为“按性别划分的护理雇员平均月收入(本币)”。这一精心整合的数据资源为区域劳动经济学、性别工资差异及护理行业政策评估提供了高质量、可复现的数据基础,推动了亚洲范围内基于证据的劳动力市场研究。
当前挑战
该数据集所面临的挑战主要体现在两个方面。在领域问题层面,护理行业长期面临性别薪酬不平等、非正规就业比例高以及跨国比较中定义标准不一等结构性难题,导致对护理人员经济地位的准确刻画极为困难。在数据集构建过程中,ILOSTAT原始数据源自各国不同的调查体系(如劳动力调查、家计调查等),数据口径、调查频率和时期连续性存在显著差异,需要繁琐的调和与标志处理。此外,部分国家的样本量较小、时间序列不完整,且存在数据断点和质量标注不足的问题,这为跨国家、跨时段的统计分析带来了不确定性,亟需谨慎处理缺失值与异常值的鲁棒方法。
常用场景
经典使用场景
在劳动经济学与性别平等研究领域,该数据集被广泛用于分析亚洲地区护理行业从业者的薪酬结构及其跨时期演变趋势。研究人员常依托该数据,通过面板数据回归或时间序列分解方法,探究不同国家间护理人员月均收入的差异,并剖析性别维度下的薪酬鸿沟。其精细化的性别分类(男性、女性及总体)使得研究者得以量化女性护理工作者在薪酬分配中的相对劣势地位,从而为后续政策干预提供实证依据。此外,该数据集的年度序列特征支持研究者构建动态模型,考察经济发展、劳动力市场政策与护理薪酬波动之间的内在关联。
衍生相关工作
基于该数据集,学界与业界已衍生出多项具有影响力的后续工作。一方面,研究者将其与ILOSTAT其他指标(如工作时长、非正规就业比例)进行交叉整合,构建了综合性护理行业劳动条件评估框架。另一方面,若干同行利用该数据训练轻量级时间序列预测模型,以推测未来五年内亚洲各国护理人员薪酬的演变轨迹。此外,该数据集还被纳入多个开放数据平台(如世界银行公开数据工具箱),成为跨国薪酬比较研究中的标准化输入。部分学者在其基础上扩充了纵向维度,结合家庭调查微观数据,探讨护理薪酬变化对女性劳动参与率的传导效应,进一步拓展了该数据集的理论与实践价值。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区按性别分列的护理人员月均收入,为劳动经济学与性别平等研究提供了关键的时间序列数据。近期前沿方向集中于利用该数据集分析新冠疫情后护理行业薪酬的动态变化,并结合ILO的体面劳动议程,探索亚洲各国在护理工作货币化、性别薪酬差距及非正规就业转型中的异质性路径。通过面板数据模型与因果推断方法,研究者正试图量化劳动力市场政策、社会保护体系与护理人员经济待遇之间的关联机制,从而为SDG 5性别平等与SDG 8体面工作的交叉领域提供实证依据。该数据集基于ILOSTAT权威来源,覆盖24个亚洲国家长达30年的观测值,在比较政治经济学和全球健康劳动力研究中具有标杆意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务