遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-cbr-nb-average-monthly-earnings-of-employees-by-sex-and-p

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的按性别和出生地划分的雇员月平均收入(本地货币)数据,专门针对亚洲地区。数据涵盖21个亚洲国家,时间跨度为1999年至2024年,共包含860个观察值。核心指标为EAR_EMTA_SEX_CBR_NB,表示按性别(总计、男性、女性)和出生地(总计)分类的雇员月平均收入,以本地货币为单位。数据集提供了详细的元数据,包括国家代码、来源信息、观测值、时间年份、数据质量标志(如不可靠数据标记)以及货币单位注释。数据以表格形式呈现,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Asia重新打包,旨在为亚洲地区提供统一的、适用于机器学习的数据层。

This dataset contains Average monthly earnings of employees by sex and place of birth (local currency) data from the International Labour Organization (ILO) ILOSTAT database, specifically focused on Asia. It covers 21 Asian countries from 1999 to 2024, with 860 observations. The core indicator is EAR_EMTA_SEX_CBR_NB, representing average monthly earnings of employees disaggregated by sex (total, male, female) and place of birth (total), in local currency. The dataset includes detailed metadata such as country codes, source information, observed values, time years, data quality flags (e.g., unreliable data markers), and currency notes. Presented in tabular format, it is suitable for tasks like tabular classification, regression, and time-series forecasting. Repackaged by Electric Sheep Asia, the dataset aims to provide a unified, machine learning-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-cbr-nb-average-monthly-earnings-of-employees-by-sex-and-p 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API从官方端点(https://rplumber.ilo.org/data/indicator?id=EAR_EMTA_SEX_CBR_NB)直接拉取原始数据,并依据ISO3国家代码筛选出21个亚洲国家的观测记录。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据源在source.label列中予以标注,确保了数据的可追溯性与一致性。随后由Electric Sheep Asia团队进行再封装,将数据标准化为Parquet格式,并发布至HuggingFace平台,以便研究者能够通过几行代码便捷调用。
特点
该数据集包含860条观测记录,时间跨度覆盖1999年至2024年,涵盖21个亚洲国家,专注于“按性别和出生地划分的雇员平均月薪(本币)”这一核心指标。数据结构清晰,包含ref_area、sex、classif1等多维分类变量,支持按性别(总、男、女)和出生地(总)进行细致分组。数据来源于各国劳动力调查、家庭收入调查等官方统计,经ILO优选最佳来源后整合,且附有观测状态标志(如不可靠、临时性),便于用户评估数据质量。所有缺失值与非适用维度均以空值表示,确保数据结构整洁。
使用方法
用户可通过HuggingFace的datasets库直接加载数据集,仅需一行代码`load_dataset("electricsheepasia/asia-ilo-ear-emta-sex-cbr-nb-average-monthly-earnings-of-employees-by-sex-and-p")`即可获取训练集并转换为Pandas DataFrame。支持灵活的筛选操作,如按国家代码过滤至单一国家(如印度尼西亚),或按指标列排序后绘制时间序列图。亦可利用pivot_table将数据重塑为国家×年份矩阵,便于面板数据分析。该数据集适用于表格分类、回归以及时间序列预测等任务,为研究亚洲劳动力市场的性别与出生地薪资差异提供了即用型数据基础。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT于2024年发布,由Electric Sheep Asia在HuggingFace平台上重新整理。数据集聚焦于亚洲地区21个国家1999至2024年间按性别和出生地划分的雇员平均月薪(本地货币),包含860条观测值。其核心研究问题在于揭示亚洲劳动力市场中薪资差异与移民背景之间的关联,为劳动经济学、移民研究及可持续发展目标的监测提供高颗粒度的时空数据。作为ILOSTAT旗舰指标之一,该数据集对全球劳动力市场分析、政策制定及学术研究具有重要支撑作用,尤其弥补了亚洲地区系统性、跨国家薪资比较数据的不足。
当前挑战
该数据集面临的首要挑战是领域问题中的薪资统计可比性难题:各国在货币单位、通货膨胀、购买力平价及数据采集周期上的差异使得跨国家薪资比较异常复杂,且不同国家劳动力调查的样本覆盖范围(如仅涵盖正规部门)可能导致薪资数据系统性偏差。构建过程中的挑战则体现于数据整合的异质性——21个国家的原始数据来源于不同的劳动力调查、家庭收支调查及行政记录,其调查方法、问卷设计、分类标准(如出生地定义)的差异需要严格的ILO国际劳工统计学家会议(ICLS)定义对齐;此外,部分国家数据存在观测状态标记为“不可靠”(如U标志)或时间序列不连续(如约旦仅覆盖1999-2013年),在机器学习建模前需进行复杂的缺失值插补与质量过滤。
常用场景
经典使用场景
该数据集收录了1999年至2024年间亚洲21个国家的雇员平均月收入观测值,按性别与出生地(本地货币单位)进行分层统计,共计860条记录。研究者常将其作为面板数据或时间序列分析的基础素材,用于探究亚洲劳动力市场中薪酬水平的时空演变规律。借助该数据,学者可构建固定效应或随机效应模型,剖析国家间收入差异的形成机制,亦可结合宏观经济指标,评估全球化与区域一体化对劳工报酬的潜在影响。
衍生相关工作
该数据集的发布催生了多项衍生性研究工作。一方面,数据经清理与整合后,被用于构建亚洲劳动市场的宏观计量模型,预测经济波动对就业者收入的影响路径。另一方面,结合ILOSTAT平台上其他相关指标(如失业率、劳动参与率),研究者开发了综合性的区域劳动市场健康状况评估框架。此外,基于该时间序列数据训练的机器学习模型,已在薪酬预测和多因素回归分析中展现出良好性能,成为后续因果推断研究的基准对照资源。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲21个国家1999至2024年间按性别与出生地划分的雇员平均月薪统计,为国际劳工组织(ILO)的权威劳动调查数据。当前前沿方向之一是利用该时序数据构建薪资差异的动态面板模型,以量化分析性别工资鸿沟(gender wage gap)在亚洲跨国间的演变趋势,并结合移民身份(出生地)交叉维度,探索劳动力市场中本地与外来劳动者的薪酬分化机制。另一个热点研究领域是将其与ILOSTAT其他指标(如失业率、非正规就业比例)整合,评估亚洲各国在后疫情时代推进体面劳动(Decent Work)可持续发展目标(SDG 8)的进展与挑战。该数据集的高频粒度与国家覆盖性,为跨文化比较与政策模拟提供了关键实证基础,尤其在南亚与东南亚新兴经济体转型研究中具有显著价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务