遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-nb-average-monthly-earnings-of-employees-by-sex-local

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲30个国家从1996年至2025年的868个观测值,专注于按性别划分的员工平均月收入(本地货币)指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过处理和标准化,以支持表格分类、回归和时间序列预测等任务。数据集包括国家代码、性别、年份、观测值等列,并提供了详细的数据来源和质量说明。

This dataset contains 868 observations across 30 Asian countries from 1996 to 2025, focusing on the average monthly earnings of employees by sex in local currency. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), processed and normalized to support tasks such as tabular classification, regression, and time-series forecasting. It includes columns for country codes, sex, year, observed values, and provides detailed information on data sources and quality.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-nb-average-monthly-earnings-of-employees-by-sex-local 数据集图片
构建方式
该数据集由Electric Sheep Asia团队从国际劳工组织(ILO)的ILOSTAT REST API中直接抽取,原始数据源自各国劳动力调查、家庭收入调查、企业调查及行政记录等权威来源。API请求指标代码为EAR_EMTA_SEX_NB,筛选出亚洲地区ISO3国家代码对应的数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理,将原始调查微观数据整合为统一格式。数据中保留了source.label列以标记每个观测值的来源,确保数据可追溯。最终收录了30个亚洲国家1996至2025年间共计868条观测记录,以Parquet格式存储于HuggingFace Datasets平台上。
特点
该数据集的核心特点在于其聚焦于亚洲地区员工平均月收入(以当地货币计价)的性别分列指标,提供Sex_T(总计)、Sex_M(男性)、Sex_F(女性)及Sex_O(其他)四个性别维度,支持细粒度的收入性别差异分析。数据时间跨度近三十年,涵盖印尼、菲律宾、柬埔寨、印度等30个亚洲国家,观测频次为年度,且当同一国家年份存在多个数据源时仅采用ILO选定的“最佳来源”。数据集中包含ref_area、source、indicator、sex、time、obs_value等结构化字段,以及用于说明数据连续性或注释的obs_status与note_indicator等元数据,便于用户进行数据质量评估。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集,命令为load_dataset('electricsheepasia/asia-ilo-ear-emta-sex-nb-average-monthly-earnings-of-employees-by-sex-local'),加载后即可将训练集转换为pandas DataFrame进行后续分析。具体使用上,用户可按国家代码(ref_area)过滤特定国家的数据,例如提取印尼(IDN)的观测值;亦可针对单一指标按时间排序并绘制时间序列图,观察收入变化趋势;还能利用pivot_table功能将数据透视成以年份为行、国家为列的矩阵形式,便于跨国家比较。该数据集设计为ML-ready格式,无需额外预处理即可快速接入建模流程。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库创建,并由Electric Sheep Asia团队重新打包发布在HuggingFace平台。数据集聚焦于亚洲30个国家1996年至2025年间按性别划分的雇员平均月收入(本地货币)这一核心劳动经济学指标。ILOSTAT作为全球劳动统计的权威来源,基于各国劳动力调查、行政记录等多源数据,采用国际劳工统计学家会议(ICLS)定义进行标准化处理,为研究亚洲地区性别工资差异、收入不平等及劳动力市场动态提供了宝贵的纵向数据。该数据集因其精细的国别、时间与性别维度分解,在劳动经济学、发展经济学及公共政策评估领域具有重要参考价值,有助于推动对亚洲新兴经济体劳动力市场结构性特征的深入理解。
当前挑战
该数据集面临的核心挑战首先在于亚洲各国数据采集标准与质量的高度异质性,不同来源(如劳动力调查与行政记录)的统计口径差异可能导致跨国比较的可靠性降低。其次,性别分类的细化程度有限(仅区分总、男、女),难以捕捉非二元性别群体的收入状况。在构建过程中,数据整合面临多源数据冲突与时间序列不连续问题,例如部分国家存在年份缺失或“序列中断”标记,需要依赖ILO的“最佳来源”选择机制进行协调。此外,数据集仅提供年度频率,无法反映月度或季度波动,限制了短期经济冲击分析的应用潜力。最后,本地货币单位的使用虽便于国内分析,但汇率波动与通胀差异为跨国工资水平的真实对比带来了额外复杂性。
常用场景
经典使用场景
在劳动经济学与区域发展研究领域,该数据集为分析亚洲30个国家近三十年间雇员平均月收入的变化轨迹提供了宝贵的时间序列资料。研究者可凭借按性别划分的收入指标,构建面板数据模型,追踪各国收入水平的长期演进趋势,或运用时间序列分析方法,揭示收入波动与宏观经济周期之间的内在关联。其标准化的ILOSTAT数据架构,使得跨国比较与异质性分析变得便捷可行,为探究亚洲劳动力市场的结构性变迁奠定了数据基础。
衍生相关工作
围绕该数据集所揭示的收入动态,学界已衍生出一系列富有影响力的经典研究。从基于跨国面板数据的性别收入差距收敛性分析,到结合教育、职业等协变量探究收入决定因素的多层次模型,再到运用因果推断方法评估贸易自由化或制度变革对女性收入的外生冲击,该数据均扮演了不可或缺的角色。此外,研究者常将此数据与其他社会经济指标融合,构建综合性的亚洲劳动力市场画像,推动了劳动经济学与性别研究领域的交叉创新。
数据集最近研究
最新研究方向
当前,基于亚洲地区性别维度的收入不平等研究正借助精细化时序数据向纵深推进。该数据集汇集了ILOSTAT框架下30个亚洲国家1996至2025年的员工月均收入观测值,并首次以本地货币为单位、按性别(总、男、女、其他)进行交叉分解,为追踪亚洲劳动力市场中女性薪酬差距的演变轨迹提供了弥足珍贵的结构化解构。随着国际劳工组织“体面劳动”框架与联合国可持续发展目标(SDG 8.5)的全球量化评估进入攻坚阶段,该数据在揭示经济转型期性别收入鸿沟、评估同工同酬政策实效、以及识别非正规就业与收入波动的性别异质性等前沿议题中扮演着不可替代的角色。其对来源机构与断点标记的透明附注,更增强了跨时期可比性,为计量经济学建模、时序回归预测乃至基于性别公平的决策支持系统提供了可靠的数据底座。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务