遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-eco-nb-average-hourly-earnings-of-employees-by-sex-and-ec

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲25个国家从1997年至2025年的19,442个观测值,聚焦于按性别和经济活动划分的员工平均小时收入(本地货币)这一指标。数据源自国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲地区,涵盖国家代码、来源、指标、性别分类、时间、观测值等列,适用于表格分类、回归和时间序列预测任务。数据集为年度频率,经过ILO的标准化处理,并包含数据质量说明和使用示例。

This dataset contains 19,442 observations of average hourly earnings of employees by sex and economic activity (local currency) across 25 Asia countries, spanning from 1997 to 2025. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via REST API and filtered for Asia. The data includes columns such as country code, source, indicator, sex disaggregation, time, and observed value, suitable for tabular classification, regression, and time-series forecasting tasks. It features annual frequency, harmonized by ILO definitions, with data quality caveats and usage examples provided.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-eco-nb-average-hourly-earnings-of-employees-by-sex-and-ec 数据集图片
构建方式
该数据集由Electric Sheep Asia团队通过调用ILOSTAT官方REST API直接获取,原始数据来源于国际劳工组织(ILO)基于国际劳工统计学家会议(ICLS)定义进行统一处理的劳动力调查微观数据。数据经过筛选,仅保留亚洲地区ISO3国家代码对应的观测记录,并整合为涵盖25个亚洲国家、时间跨度从1997年至2025年的面板数据。数据集包含19,442条观测,每条记录均标注了数据来源,确保可追溯性。最终以Parquet格式打包,并通过HuggingFace Datasets库提供标准化接口。
特点
该数据集聚焦于亚洲地区雇员按性别和经济活动分类的平均小时工资(以当地货币计),呈现三大显著特点。其一,地理覆盖范围精准,涵盖土耳其、印度尼西亚、柬埔寨等25个亚洲经济体,样本量分布不均但具有代表性。其二,时间维度跨越近三十年,为长期工资趋势分析提供了宝贵素材。其三,数据经过ILO的标准化处理,包含性别(总、男性、女性)、经济活动分类等细分维度,且每条观测附有观测状态标识(如序列中断),有助于研究者进行数据质量控制与异常值识别。
使用方法
用户可通过HuggingFace Datasets库以load_dataset函数一键加载数据,并转换为Pandas DataFrame进行后续分析。推荐的操作包括:按国家代码筛选特定经济体的子集;针对单一指标按年份排序以绘制时间序列图;或通过数据透视表构建国家×年份的面板矩阵,便于进行跨国比较与回归建模。此外,数据集中包含的观测状态标识可用于过滤不可靠或中断的序列,提升分析精度。原始数据版权归ILO所有,使用时需注明出处及Electric Sheep Asia的再加工版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT整理,经Electric Sheep Asia于2025年重新打包并发布于HuggingFace平台。其核心研究问题聚焦于亚洲地区雇员按性别与经济活动划分的平均时薪(以当地货币计),旨在揭示劳动力市场中性别收入差异与产业分布不均等关键议题。数据集涵盖25个亚洲国家,观测时间跨度从1997年至2025年,共计19,442条记录,为区域劳动经济学、性别平等研究以及可持续就业政策制定提供了宝贵的时序数据基础。作为ILO全球劳动统计体系的一部分,该数据集凭借其权威来源和标准化整合,在推动亚洲劳工问题实证分析与跨国比较研究方面具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于量化刻画亚洲地区劳动报酬的性别差异与行业结构性特征,为评估消除性别工资差距、促进体面劳动等可持续发展目标提供数据支撑。在构建过程中,面临多重技术性挑战:不同国家数据采集频率(以年度为主,部分指标包含更高频率序列)与分类法依据存在差异,ILO通过优先采用‘最佳来源’及国际劳工统计学家会议(ICLS)定义进行统一;此外,原始调查数据来源多样,涵盖劳动力调查、行政记录等,需在清洗、整合与标签标注中保持一致性,同时确保对性别、经济活动分类等细分维度的非空字段合规性,以维护数据集在跨国时间序列分析中的可靠性与可比性。
常用场景
经典使用场景
该数据集汇聚了ILOSTAT提供的亚洲25个国家1997年至2025年间按性别和经济活动划分的雇员平均小时工资数据,共计19,442条观测记录。经典应用场景聚焦于跨国劳动经济学的时间序列与面板数据分析,研究者可借助性别(sex)与经济活动(classif1)等关键维度,构建固定效应或随机效应模型,深入探究亚洲各国工资水平的演变趋势、性别收入差距的时空差异,以及经济结构转型对劳动力报酬的潜在影响。
衍生相关工作
该数据集衍生了一系列关于亚洲劳动力市场的计量与数据科学工作。经典方向包括基于面板数据回归的性别工资差异分解研究,以及利用时间序列工具对工资收敛假说的检验。在数据科学领域,研究者开发了面向缺失值插补的统计模型,并通过聚类分析识别亚洲不同经济体在工资结构上的异质性模式。此外,有工作将其与教育、就业率等多源数据融合,建立综合性的劳动市场预测框架,推动了跨学科交叉研究的发展。
数据集最近研究
最新研究方向
该数据集依托国际劳工组织ILOSTAT权威统计框架,聚焦亚太地区25个国家长达近三十年的性别与经济部门维度下的平均小时工资演变,为劳动经济学中的性别薪酬差距、劳动力市场分层与包容性增长等前沿议题提供了精细化的时序面板数据支撑。结合全球范围内对体面工作(SDG 8)与性别平等(SDG 5)目标的持续关注,研究者可借助这一资源深入剖析亚洲新兴经济体在产业结构转型、最低工资政策冲击以及新冠疫情后就业恢复过程中的工资动态,并基于其高频观测值与多级分类标签,开展跨国比较、因果推断与机器学习驱动的经济预测建模,从而有力推动区域劳动力市场政策的循证决策与理论创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务