遇见数据集

electricsheepasia/asia-ilo-ear-emtm-sex-mts-cur-nb-median-monthly-earnings-of-employees-by-sex-marita

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲地区雇员月收入中位数统计数据,涵盖27个亚洲国家从1996年至2025年的7,476个观测值。核心指标为EAR_EMTM_SEX_MTS_CUR_NB,即按性别、婚姻状况和货币分类的雇员月收入中位数。数据通过ILOSTAT REST API获取,并过滤至亚洲国家代码,经过ILO基于国际劳工统计学家会议(ICLS)定义的标准化处理。数据集包含结构化字段,如国家代码、数据来源、指标代码、性别分类(总计、男性、女性等)、婚姻状况分类、货币类型、观测年份和数值等,适用于表格分类、回归分析和时间序列预测任务。数据以CC-BY-4.0许可证发布,由Electric Sheep Asia重新打包为机器学习就绪格式。

This dataset contains median monthly earnings statistics for employees in Asia from the International Labour Organization (ILO) ILOSTAT database, covering 7,476 observations across 27 Asian countries from 1996 to 2025. The core indicator is EAR_EMTM_SEX_MTS_CUR_NB, representing median monthly earnings of employees disaggregated by sex, marital status, and currency. Data is sourced directly from the ILOSTAT REST API and filtered to Asia ISO3 country codes, harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes structured fields such as country codes, data sources, indicator codes, sex classification (total, male, female, etc.), marital status classification, currency type, observation year, and values, suitable for tabular classification, regression, and time-series forecasting tasks. It is released under the CC-BY-4.0 license and repackaged by Electric Sheep Asia into a machine learning-ready format.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtm-sex-mts-cur-nb-median-monthly-earnings-of-employees-by-sex-marita 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API接口直接提取亚州地区27个国家的月度收入中位数数据。原始数据基于各国劳动力调查、家庭收入调查等微观数据,经ILO依据国际劳工统计学家会议(ICLS)定义进行标准化处理。Electric Sheep Asia团队负责数据的再封装与清洗,过滤出亚州ISO3国家代码范围内的观测值,并保留了源标签以追踪数据出处,最终形成包含7,476条观测值的时间序列数据集,时间跨度覆盖1996年至2025年。
特点
本数据集聚焦于亚州地区雇员按性别和婚姻状况分组的月收入中位数指标,提供单一核心指标(EAR_EMTM_SEX_MTS_CUR_NB)的精细分层观测。数据特色在于多维度的分类设计,包含性别细分(总、男、女、其他)、婚姻状态分类以及货币类型标注,同时附带详细的元数据如数据来源标识、观测状态标志和注释信息。数据集的时空覆盖广泛,囊括了从菲律宾到印度等27个亚州国家的近三十年动态变化,为研究亚州劳动力市场收入不平等、性别工资差距及婚姻状况对收入影响提供了可靠的时间序列基础。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset()函数便捷加载数据,快速转换为Pandas DataFrame进行探索分析。典型应用包括按国家筛选子集(如印度尼西亚)、针对特定指标绘制时间序列趋势图,或构建国家×年份的透视矩阵以进行横向比较。数据采用CC-BY-4.0许可证发布,使用时需同时标注原始数据来源(国际劳工组织)与再封装方(Electric Sheep Asia),适合从事劳动力经济学、社会分层与时间序列预测研究的学者及数据科学家直接调用分析。
背景与挑战
背景概述
在劳动经济学与社会政策研究中,性别与婚姻状况对收入差异的影响是长期备受关注的议题。国际劳工组织(ILO)作为全球劳动统计的权威机构,通过其ILOSTAT数据库系统性地收集并提供了跨国家、跨时间序列的劳动力市场指标。该数据集由Electric Sheep Asia于2025年重新封装并发布,聚焦于亚洲27个国家1996年至2025年间按性别与婚姻状态分组的雇员月收入中位数数据,共计7,476条观测记录。这些数据源自各国劳动力调查、家庭收入调查等行政记录,经ILO按照国际劳动统计学家会议定义进行统一协调,确保了跨国可比性。该数据集的发布填补了亚洲区域在高频、细粒度收入结构数据方面的空白,为研究性别收入差距、婚姻溢价、劳动力市场区域异质性等关键问题提供了宝贵的时间序列素材,并对推动亚洲发展中国家的体面劳动与性别平等政策评估具有重要参考价值。
当前挑战
该数据集所应对的领域挑战主要在于:第一,劳动收入数据普遍存在国家间定义差异大、统计口径不一的问题,阻碍了跨国比较研究的可信度;第二,性别与婚姻状态等细分维度的收入数据在多数低收入亚洲国家长期缺失或样本量不足,使得对劳动市场不平等根源的量化分析面临数据瓶颈。数据构建过程本身亦遭遇多重挑战:首先,各来源数据的原始调查方法(如问卷设计、调查周期)存在差异,需ILO运用复杂的统计调和技术以保持序列一致性;其次,部分国家在某些年份的数据存在断裂或标记为不可靠(如观测状态标识中的“Break in series”),且多来源数据情况下需遵循ILO的“最佳来源”选择机制,增加了数据清洗与决策的复杂性;最后,时间跨度长达三十年的数据需妥善处理因通货变化导致的货币单位调整问题,以保障观测值的可比性。
常用场景
经典使用场景
该数据集收录了1996年至2025年间27个亚洲国家雇员的月收入中位数数据,按性别、婚姻状况及货币类型进行精细划分,共计7,476条观测记录。在劳动经济学与社会科学研究中,这一数据集常被用于构建面板数据模型,以剖析亚洲地区劳动力市场中的性别收入差距随时间演变的趋势。通过引入婚姻状态这一维度,研究者能够更细致地探讨婚姻如何调节收入性别差异,并结合各国宏观经济指标进行多层级回归分析。数据的时间跨度覆盖近三十年,为追踪收入分配格局的动态变迁提供了宝贵素材。
解决学术问题
在学术研究中,该数据集有效回应了亚洲地区劳动力市场长期存在的若干关键议题,例如性别工资差距的量化测度、婚姻溢价或惩罚的跨国家验证,以及不同货币体系下收入水平的可比性分析。由于ILOSTAT遵循国际劳工统计学家会议的统一定义,数据在跨国比较中具备高度一致性与权威性。该数据集使学者得以突破单一国家研究的局限,在控制国家异质性的基础上,系统揭示亚洲区域内部性别与婚姻状态对收入作用的普适性规律,从而为公平劳动政策的制定提供实证支撑。
衍生相关工作
基于该数据集的丰富纵向信息,研究者已衍生出一系列经典工作,包括构建亚洲国家性别收入差距的贝叶斯分层模型、开发融合婚姻状态协变量的收入预测算法,以及设计用于跨国公平薪酬评估的交互式可视化仪表盘。部分工作进一步将数据与教育、职业结构等辅助数据集联立,以更全面地解析收入差异的成因。这些衍生研究不仅验证了ILOSTAT数据在劳动经济学领域的核心价值,也推动了面向亚洲市场的机器学习基准测试任务的建立,促进了可复制、可扩展的计算社会科学研究范式的形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务