遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-eco-cur-nb-median-hourly-earnings-of-employees-by-sex-economi

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲25个国家1996年至2025年间的54,975个观察值,专注于员工按性别、经济活动和货币分类的中位小时收入指标。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,涵盖就业、工资等劳动统计领域。数据集提供了按性别(总计、男性、女性、其他)、经济活动和货币类型等维度细分的收入数据,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 54,975 observations from 25 Asian countries between 1996 and 2025, focusing on the median hourly earnings of employees categorized by gender, economic activity and currency. The data is sourced from the ILOSTAT statistical database of the International Labour Organization (ILO), covering labor statistics areas such as employment and wages. The dataset provides earnings data disaggregated by dimensions including gender (total, male, female, other), economic activity and currency type, which is applicable to tasks such as tabular classification, regression and time series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-eco-cur-nb-median-hourly-earnings-of-employees-by-sex-economi 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API直接获取指标代码为EAR_EHRM_SEX_ECO_CUR_NB的原始数据,并依据亚洲ISO3国家代码进行地域过滤。数据集整合了来自各国劳动力调查、家庭收入调查及行政记录等多源微观数据,经ILO统计部门依据国际劳动统计学家会议(ICLS)定义进行统一协调与清洗,最终形成包含54,975条观测记录的表格化数据,覆盖1996至2025年间25个亚洲国家的劳动者时薪中位数信息。
特点
该数据集具有多维交叉分类的显著特点,核心指标为按性别、经济活动部门及货币类型划分的雇员时薪中位数。数据包含性别(男性、女性、总计、其他)、经济活动分类(如总部门)及货币类型(本地货币等)等多重维度,支持从国家、年份、性别等角度进行细粒度分析。此外,数据来源标识清晰,每条记录均标注了原始调查来源代码与标签,便于追溯数据源头,其时间跨度长达三十年,为亚洲劳动力市场的长期趋势研究提供了宝贵的量化基础。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载该数据集,返回的Dataset对象可便捷地转换为Pandas DataFrame进行后续分析。用法示例包括按国家代码筛选特定国家的子集、对指定指标进行时间序列可视化,以及利用透视表功能将数据重构为国家与年份的矩阵格式。数据集已按清洁、统一的Parquet格式进行打包,研究者无需额外处理即可立即进行回归分析、分类任务或时间序列预测等机器学习和统计建模工作。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年通过ILOSTAT数据库整理发布,并由Electric Sheep Asia团队重新封装为机器学习友好的格式,聚焦于亚洲地区雇员按性别、经济活动与货币划分的中位数小时工资。ILOSTAT作为全球劳动力统计的权威来源,整合了来自200多个经济体的劳动力调查、家庭收入调查及行政记录数据,旨在为亚太地区25个国家提供从1996年至2025年跨近三十年的薪酬观测值,共计约5.5万条记录。这一数据集的核心研究问题在于揭示亚洲不同国家间性别薪酬差距的演变趋势、经济部门对工资分布的影响,以及本地货币计价下薪酬的实际购买力变化,为发展经济学、劳动经济学及性别平等研究提供了高粒度的面板数据基础。其对相关领域的影响力体现在:一方面弥补了发展中国家薪酬时序数据空缺的短板,另一方面通过标准化接口降低了跨国家比较研究的门槛,推动了从描述性分析向因果推断与政策评估的模型化研究转型。
当前挑战
该数据集解决的领域问题是亚洲劳动力市场中系统性薪酬数据的碎片化与不兼容挑战。首先,不同国家因调查方法、统计口径(如是否包含非正规就业)、货币汇率波动以及行业分类标准(如ISIC修订版次)的差异,导致原始数据无法直接比较,干扰了跨国性别薪酬差距的精确测算。其次,构建过程中面临多重技术障碍:多个国家(如阿富汗、缅甸)的数据存在年度断裂或观测状态标记为“暂定”的不可靠记录,需手动清洗并优先采用ILO认定的‘最佳来源’;此外,经济活动的二级分类(如broad sector与detailed activity之间的映射)在部分国家出现缺失,可能引入归因偏差。最后,时间序列的非平衡性——尤其老挝、东帝汶等国家早期年份数据稀疏——导致面板回归模型估计效率下降,需借助插值或贝叶斯分层方法弥补空缺,同时避免外推带来的统计误差。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中亚洲25个国家自1996年至2025年间雇员每小时收入中位数的面板数据,涵盖性别、经济活动部门及货币类型等多维度细分。研究者常将其作为劳动经济学领域的基础资源,用于构建薪资水平的时空对比模型、评估性别收入差距的动态演变,或是分析不同经济部门在全球化浪潮下的薪酬分化趋势。其时间跨度之长与地域覆盖之广,为跨国面板回归、固定效应模型以及贝叶斯层次模型等计量方法提供了坚实的数据支撑。
衍生相关工作
基于这一数据集,已衍生出多项聚焦亚太劳动市场的经典研究,例如利用分性别的时间序列数据构建了亚洲新兴经济体女性劳动参与率与收入收敛的预测模型。有工作将ILOSTAT数据与家庭调查微观数据结合,揭示了非正规就业与性别收入惩罚之间的内在关联。此外,数据仓库的标准化架构启发了其他区域(如非洲与拉美)构建类似的跨国劳动统计数据集,促进了全球范围内关于最低工资溢价效应与技能回报率变化的比较研究。
数据集最近研究
最新研究方向
该数据集汇聚了国际劳工组织ILOSTAT数据库中亚洲25国1996至2025年间雇员性别、经济活动与货币维度下的时薪中位数观测值,为区域劳动经济学与不平等研究提供了横跨近三十年的高质量时间序列。在前沿方向中,该数据正被嵌入基于机器学习的亚洲劳动力市场动态建模,特别是结合性别薪酬差距分解、经济结构调整与汇率波动传导效应等热点议题,支持研究者从微观劳动力调查与宏观统计衔接处挖掘隐性模式。此外,借助数据的高颗粒度分类变量,学者可追溯不同经济部门在全球化与后疫情复苏期间的薪酬演变,并为国际劳工标准监测与SDG体面工作目标的量化评估提供坚实依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务