遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-mts-nb-average-hourly-earnings-of-employees-by-sex-and-ma

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲地区员工平均小时收入统计数据,具体指标为按性别和婚姻状况划分的员工平均小时收入(本地货币)。数据集涵盖25个亚洲国家,时间跨度为1996年至2025年,共包含5,424个观测值。数据通过ILOSTAT REST API获取,并过滤为亚洲国家代码。数据集提供了详细的元数据,包括国家代码、数据来源、指标、性别和婚姻状况分类、观测年份、观测值及其状态标志等。数据以年频率提供,并经过ILO的标准化处理,使用国际劳工统计学家会议(ICLS)的定义。数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究人员和开发者提供机器学习就绪的亚洲劳动力市场数据。

This dataset contains statistics on average hourly earnings of employees in Asia from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator Average hourly earnings of employees by sex and marital status (local currency). It covers 25 Asian countries from 1996 to 2025, with 5,424 observations. Data is pulled from the ILOSTAT REST API and filtered to Asia ISO3 country codes. The dataset includes detailed metadata such as country codes, data sources, indicators, sex and marital status classifications, observation years, observed values, and status flags. Data is provided at annual frequency and harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions. It is suitable for tasks like tabular classification, regression, and time-series forecasting, aiming to provide machine learning-ready labor market data for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-mts-nb-average-hourly-earnings-of-employees-by-sex-and-ma 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API直接提取指标代码为EAR_EHRA_SEX_MTS_NB的数据,并依据亚洲ISO3国家代码进行地理范围筛选。ILOSTAT本身对各国原始调查微观数据依据国际劳工统计学家会议(ICLS)定义进行统一协调,数据来源在source.label列中予以标记,确保了跨国的可比性与数据溯源能力。整个数据集由Electric Sheep Asia进行重新打包,以标准化的Parquet格式发布,便于机器学习工作流的直接使用。
特点
数据集包含5,424条观测记录,覆盖1996年至2025年间25个亚洲国家的平均小时工资数据,并按照性别与婚姻状况进行细致的维度划分。其核心变量为本地货币计价的雇员平均小时工资,同时提供sex与classif1等多个分组列,支持按性别(男性、女性、总计等)和婚姻状况(总计等)进行深度剖析。数据标注了观测状态标识与中断注释,为研究者提供了数据质量的明确线索,是一份兼具时空广度与社会结构维度的劳动经济学宝贵资源。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数便捷加载数据,并一键转换为Pandas DataFrame进行分析。典型操作包括按国家代码筛选子集,例如提取印度尼西亚的数据;或利用时间列对特定指标进行时序分析与可视化。此外,使用pivot_table可轻松将长格式数据重塑为国家×年份的矩阵,便于面板数据回归或分类建模任务。该数据集的标准化Schema设计使其适用于表格分类、回归以及时间序列预测等多种监督学习场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Asia团队重新封装,聚焦亚洲地区按性别与婚姻状况划分的员工平均时薪(以当地货币计)。源自ILOSTAT数据库——全球劳动统计的权威来源,涵盖1996年至2025年间25个亚洲国家的5,424条观测值。核心研究问题在于揭示亚洲劳动力市场中性别与婚姻状态对薪酬差异的影响,为劳动经济学、性别平等及可持续发展目标(SDG)中的体面工作议题提供量化依据。其影响力体现在为跨国的薪酬比较、政策制定及机器学习模型(如时间序列预测)提供标准化、可复现的高质量数据,填补了亚洲区域精细化劳动统计数据的空白。
当前挑战
该数据集所解决的领域挑战主要聚焦于劳动经济学中的薪酬不平等度量问题:亚洲各国在性别与婚姻状况维度上的薪酬数据长期呈现碎片化、口径不一甚至缺失的状态,阻碍了跨国比较与因果推断。构建过程中面临的挑战包括:多源数据(劳动力调查、行政记录等)的异构性导致需按ICLS定义进行严格协调;部分国家数据频次不一(年度与月度/季度并存),需统一为年度频率并筛选最佳来源;性别与婚姻状况的分类(如未婚、已婚、其他)在不同文化背景下定义迥异,需通过标准化代码(如SEX_T、MTS_AGGREGATE_TOTAL)实现一致性;此外,数据中存在的序列中断(Break in series)及观测状态标记(如provisional)要求使用者在建模时谨慎处理缺失值及噪声,以确保时间序列分析的稳健性。
常用场景
经典使用场景
在国际劳动经济学与性别平等研究中,该数据集被广泛用于探究亚洲地区不同性别与婚姻状况下劳动者的薪酬分布格局。借助其超过五千条覆盖二十五国、横跨近三十年的观测记录,研究者能够构建时间序列模型,分析女性、男性及未婚与已婚群体的平均小时工资差异及其演变趋势。该数据集的经典应用在于支持面板数据回归,以控制国别和年份固定效应,量化性别工资差距在婚姻状态维度上的具体表现。此外,它亦常被用于机器学习中的回归与分类任务,预测不同社会人口特征组合下的收入水平,从而揭示劳动力市场中结构性不平等的深层次规律。这种标准化的跨国产出结构也为比较制度分析提供了坚实基础。
衍生相关工作
基于该数据集衍生了诸多富有影响力的学术与政策研究工作。在国际比较的脉络下,学者们将其与ILOSTAT其他劳动统计指标(如失业率、劳动参与率)联合分析,构建了亚洲地区劳动市场健康状况的综合评估体系。部分经典工作聚焦于婚姻状态对性别工资差距的调节效应,利用该数据验证了“婚姻惩罚”或“婚姻溢价”在不同国家间的显著异质性。另一些研究则将其作为输入特征,结合机器学习方法预测经济发展水平或劳动保护强度,开辟了运用传统统计数据反哺政策评估的新路径。该数据集还催生了一组专注于数据溯源与统筹的高质量论文,推动了劳动经济学中开放数据与可复现研究文化的进一步发展。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区按性别与婚姻状况划分的雇员平均时薪动态,反映了国际劳工组织在劳动力市场不平等与体面劳动议题上的前沿探索。结合全球对性别薪酬差距与婚姻状况对职业发展影响的持续关注,该数据集为剖析亚洲25国1996至2025年间薪酬结构的演变提供了坚实的历时性基石。其多维度分类变量与高分辨率的时间序列,正被用于量化分析社会经济转型中性别与婚姻因素如何交互塑造劳动力价值,为制定包容性就业政策与推动可持续发展目标中的体面劳动提供了关键实证支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务