遇见数据集

electricsheepasia/asia-ilo-ear-emtm-sex-mts-nb-median-monthly-earnings-of-employees-by-sex-and-ma

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲地区员工月收入中位数数据,按性别和婚姻状况划分,以本地货币计。数据集涵盖27个亚洲国家,时间跨度为1996年至2025年,共包含6,854个观测值,涉及1个核心指标:EAR_EMTM_SEX_MTS_NB,即员工按性别和婚姻状况划分的月收入中位数(本地货币)。数据来源于ILO harmonised的官方统计,包括劳动力调查等,经过Electric Sheep Asia repackaged,以表格形式提供,适用于表格分类、回归和时间序列预测等任务。

This dataset contains median monthly earnings data for employees in Asia, disaggregated by sex and marital status, in local currency, sourced from the International Labour Organization (ILO) ILOSTAT database. It includes 6,854 observations across 27 Asia countries, spanning the years 1996 to 2025, with one key indicator: EAR_EMTM_SEX_MTS_NB (Median monthly earnings of employees by sex and marital status in local currency). The data is derived from ILO-harmonized official statistics, such as labour force surveys, and has been repackaged by Electric Sheep Asia in tabular format, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtm-sex-mts-nb-median-monthly-earnings-of-employees-by-sex-and-ma 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API接口获取指标代码为EAR_EMTM_SEX_MTS_NB的原始数据,并依据亚洲ISO3国家代码进行地域筛选。ILOSTAT基于国际劳工统计学家会议(ICLS)的定义,对各国劳动力调查、家庭收入调查及行政记录等微观数据进行标准化处理,最终整合为包含6,854条观测记录的时序数据集。数据覆盖27个亚洲国家,时间跨度为1996年至2025年,每条记录均标注了来源追踪标志以保证可溯源性。
特点
该数据集的核心特点在于其细颗粒度的多维分类结构,提供了按性别(男性、女性、总计及其他)和婚姻状况双重维度划分的员工月收入中位数(以当地货币计)数据。每个观测值均附有完整的时间戳、来源编码、观测状态标志及注释信息,便于用户进行数据质量评估。此外,数据集采用ILO精选的‘最佳来源’策略处理同一国家与年份的多源冲突,确保了数据的一致性。其年度频率与连续性特征,使其成为分析亚太地区劳动力市场收入不平等与性别差异的理想时序资料。
使用方法
用户可通过HuggingFace Datasets库以一行代码加载该数据集,并直接转换为Pandas DataFrame进行探索性分析。示例操作包括:按国家代码过滤特定区域数据(如印尼),针对单一指标绘制时间序列折线图以观察收入变化趋势,以及利用数据透视表构建以年份为行、国家为列的矩阵视图,便于跨地区横向比较。该数据集支持分类、回归及时序预测等机器学习任务,其标准化的模式设计使得研究者能够快速聚焦于经济与劳动力领域的收入结构分析,无需处理底层数据清洗工作。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司创建,并由Electric Sheep Asia于2025年重新打包发布,聚焦于亚洲27个国家1996至2025年间按性别与婚姻状况划分的雇员月收入中位数(以当地货币计)。源自ILOSTAT这一全球劳动统计权威数据库,数据集通过统一ILO框架下的劳动力调查、家庭收支调查及行政记录等多元来源,系统整合了亚洲地区跨越近三十年的收入分布信息。它不仅为劳动经济学中的性别工资差异、婚姻状况对收入的影响提供了关键实证基础,还极大便利了跨国比较研究与时间序列分析,成为解析亚洲劳动力市场不平等动态的重要数据枢纽。
当前挑战
该数据集核心挑战首先在于解决劳动经济学中的经典问题——准确量化性别与婚姻状况对收入的联合效应,并克服跨国数据可比性不足的障碍,如各国调查口径、货币单位及分类标准不一致。构建过程中,数据来源多样导致拼接与清洗复杂,ILO虽采用国际劳工统计学家会议定义进行协调,但仍需处理系列中断标记与数据质量标识。此外,婚姻状况分类的细粒度有限(仅四种),且部分国家年份观测稀疏,限制了多层次模型的应用,时间频次为年度数据,无法捕捉月季节波动,进一步削弱了对短期收入变动的研究能力。
常用场景
经典使用场景
该数据集汇聚了亚洲27个国家自1996年至2025年间雇员中位数月收入的翔实记录,并按照性别与婚姻状况进行了精细划分。其最经典的用途在于构建面板数据模型,以剖析劳动者收入在时间维度上的演变规律,以及不同社会人口群体间的收入差异。研究者可借此开展跨国比较分析,探究经济发展、劳动力市场政策与性别工资差距之间的内在联系。
解决学术问题
该数据集为劳动经济学中关于收入不平等与性别歧视的经典议题提供了关键实证支撑。通过利用其跨年度、跨国家的结构化数据,学术界得以系统性地量化婚姻状况对男女工资水平的不同影响效应,并检验“婚姻溢价”与“母职惩罚”等假说在亚洲不同文化背景下的适用性。此外,它还有助于揭示经济发展阶段、产业结构变迁与性别工资收敛速度之间的复杂互动关系。
衍生相关工作
围绕该数据集,已有大量衍生研究聚焦于亚洲各国的特定国情分析,例如利用印度尼西亚或菲律宾的长时间序列数据探讨女性劳动参与率与收入水平的关系。在方法论上,学者们常以此为基础,发展出考虑性别与婚姻状态交互作用的固定效应模型,并将其与ILOSTAT其他指标(如失业率、就业人口比)结合,构建更为综合的劳动力市场福祉评估框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务