遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-mts-cur-nb-average-hourly-earnings-of-employees-by-sex-marita

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别、婚姻状况和货币划分的雇员平均小时收入 | 亚洲(ILOSTAT),是一个表格型数据集,专注于亚洲地区的劳动统计。它包含5,946个观察值,覆盖25个亚洲国家(如菲律宾、印度尼西亚、土耳其等),时间跨度为1996年至2025年。数据集的核心指标是平均小时收入,具体指标代码为EAR_EHRA_SEX_MTS_CUR_NB,用于分析按性别(总计、男性、女性等)、婚姻状况和货币分类的雇员收入情况。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并经过过滤处理,确保了数据的权威性和一致性。数据集采用结构化模式,包括国家代码、来源标签、指标标签、分类变量、观察年份、观察值等列,支持表格分类、回归和时间序列预测等任务。数据质量方面,为年度频率,ILO选择最佳来源处理多源数据,分类列仅在指标发布细分数据时非空。该数据集适用于经济研究、劳动力市场分析、机器学习建模等场景,由Electric Sheep Asia重新打包发布,遵循CC-BY-4.0许可证。

The dataset is titled Average hourly earnings of employees by sex, marital status and currency | Asia (ILOSTAT) and is a tabular dataset focused on labor statistics in Asia. It contains 5,946 observations across 25 Asian countries (e.g., Philippines, Indonesia, Turkey), spanning the years 1996 to 2025. The core indicator is average hourly earnings, with the specific indicator code EAR_EHRA_SEX_MTS_CUR_NB, used to analyze employee earnings disaggregated by sex (total, male, female, etc.), marital status, and currency. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered for Asian countries, ensuring authority and consistency. The dataset follows a structured schema including columns such as country code, source label, indicator label, classification variables, observation year, and observed value, supporting tasks like tabular classification, regression, and time-series forecasting. In terms of data quality, it is annual frequency, with ILO selecting the best source for multiple sources per country-year, and disaggregation columns are non-null only when the indicator publishes breakdowns. It is suitable for economic research, labor market analysis, machine learning modeling, and is repackaged by Electric Sheep Asia, released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-mts-cur-nb-average-hourly-earnings-of-employees-by-sex-marita 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT统计数据库,经由Electric Sheep Asia团队从ILOSTAT REST API直接获取并重新打包而成。原始数据依据国际劳工统计学家会议(ICLS)定义进行统一化处理,并筛选出亚洲地区25个国家的ISO3国家代码,最终形成包含5,946条观测记录的清洁数据集。数据涵盖1996年至2025年间的年度频率,观测指标为‘按性别、婚姻状况和货币划分的员工平均时薪’。每个观测条目均附有来源标签,以确保数据来源的可追溯性与透明度。
特点
该数据集的核心特点在于其精细的多维度分组结构,涵盖性别(男、女、总计及其他)、婚姻状况以及货币类型,为用户提供高度细化的薪酬分析视角。数据集覆盖了包括菲律宾、印度尼西亚、土耳其等在内的25个亚洲经济体,时间跨度近三十年,具备良好的地理与时间广度。此外,所有数据均来自ILO选取的‘最佳来源’,并保留了观测状态标识(如序列中断等),便于用户评估数据质量。作为已清洗的结构化表格数据,它可直接加载至Python等分析环境,无需额外复杂预处理。
使用方法
使用该数据集极为便捷,用户可通过HuggingFace Datasets库的load_dataset函数一行代码完成加载,并直接转换为Pandas DataFrame进行后续分析。典型应用包括按国家筛选子集进行纵向趋势分析,例如选取印度尼西亚数据研究其薪酬变化;亦可通过透视表操作将数据重构为年份×国家的矩阵形式,便于进行跨国比较或面板数据建模。对于需要追踪特定指标时间序列的研究者,可按指标代码筛选并排序时间后绘图,快速洞察亚洲劳动力市场薪酬的演变规律。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT构建,经Electric Sheep Asia重新打包并发布在HuggingFace平台,聚焦于亚洲25个国家1996年至2025年间按性别、婚姻状况和货币分类的雇员平均小时工资。ILOSTAT作为全球劳动统计的权威来源,整合了来自劳动力调查、企业记录等多源数据,遵循国际劳工统计学家会议(ICLS)定义进行协调统一。该数据集的核心研究问题在于揭示亚洲地区工资结构的性别与婚姻状况差异,为劳动经济学、性别平等研究和跨国劳动力市场比较提供精细化的纵向数据。其对相关领域的影响力体现在:填补了亚洲区域高粒度工资数据的空白,使研究者能够追踪长期工资趋势、评估政策干预效果,并支持基于时间序列的回归分析与预测建模,特别是在宏观经济与劳工权益交叉领域具有重要价值。
当前挑战
该数据集所解决的领域问题主要在于系统性量化亚洲地区工资的性别和婚姻差异,克服了传统数据集要么缺乏足够的时间跨度、要么仅涵盖少数发达国家的局限。在构建过程中,数据集面临多重挑战:首先,ILOSTAT的数据来源于不同国家、不同年份的劳动力调查和行政记录,数据质量、采集频率和定义标准存在差异,需通过“最佳来源”选择和协调流程确保一致性;其次,工资数据可能受通胀、汇率波动和统计口径变更影响,数据表中存在“序列中断”标记以警示可用性波动;再者,亚洲多国数据稀疏性突出,如阿富汗仅有9条记录,孟加拉国亦缺乏早期年份,这在时序建模中可能引入样本选择和插补偏差,要求研究者谨慎处理不完整区域的时间序列分析。
常用场景
经典使用场景
在劳动经济学与区域比较研究领域,该数据集为分析亚洲25国跨越三十年(1996-2025年)的雇员平均时薪动态提供了核心定量素材。研究者可基于性别与婚姻状况的交叉分类维度,构建面板数据模型以探究亚洲劳动力市场的结构性演变。其经典应用聚焦于通过年度观测值进行多国间薪资水平的横向对比与纵向趋势拟合,尤其适用于估算婚姻溢价或性别薪资差距在亚洲不同经济体中的异质性表现。借助ILOSTAT标准化的分类体系,该数据亦支持针对特定国家或特定年份子集的精细时序分析。
解决学术问题
该数据集着力解决了亚洲区域薪资研究中长期存在的跨国可比性难题与分类粒度不足的困境。学术上,它使研究者得以超越单一国家案例的局限,系统考察性别与婚姻状态如何交织作用于薪资分配,填补了亚洲劳动市场微观结构实证的空白。通过提供权威来源的时序列化数据,它促进了关于经济结构调整、人力资本回报以及社会政策对薪资平等影响机制的因果推断研究。其意义在于为验证或挑战劳动经济学中关于性别隔离、选择效应及婚姻专业化分工的传统理论提供了可检验的经验基础。
衍生相关工作
基于此数据集衍生出的经典工作包括:利用多源数据融合方法构建亚洲劳动力市场一体化指数,将本数据与其他雇佣指标(如失业率、行业分布)耦合以生成综合评估模型。其次,研究者发展了基于时间序列分解的性别薪资差距归因框架,通过贝叶斯分层模型量化国家层面特征(如教育投资、产业政策)对观察到的薪资差异的解释力度。另一方面,该数据催生了针对婚姻状态转换的准自然实验研究设计,工作论文中常采用匹配或差分法,剥离个人特征后估计婚姻对薪资的因果效应。这些工作进一步推动了亚洲劳动统计数据的开放科学与可复现分析范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务