遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-eco-nb-median-hourly-earnings-of-employees-by-sex-and-eco

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)的ILOSTAT数据库的亚洲国家员工时薪中位数数据,按性别和经济活动(本地货币)划分。数据集涵盖25个亚洲国家,时间跨度为1997年至2025年,共包含19,442个观测值,涉及一个核心指标:EAR_EHRM_SEX_ECO_NB,即员工时薪中位数。数据通过ILOSTAT REST API获取,并经过协调处理,使用国际劳工统计学家会议(ICLS)的定义。数据集以表格形式呈现,包括国家代码、来源、指标、性别分类、时间年份、观测值等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains median hourly earnings of employees by sex and economic activity (in local currency) for Asian countries, sourced from the ILOSTAT database of the International Labour Organization (ILO). It covers 25 Asian countries from 1997 to 2025, with 19,442 observations and one key indicator: EAR_EHRM_SEX_ECO_NB. The data is pulled from the ILOSTAT REST API, harmonized using International Conference of Labour Statisticians (ICLS) definitions, and presented in tabular format with columns such as country code, source, indicator, sex disaggregation, time year, and observed value. It is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-eco-nb-median-hourly-earnings-of-employees-by-sex-and-eco 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,经由Electric Sheep Asia团队重新封装,以提供面向亚洲区域的机器学习就绪数据。构建过程中,数据通过ILOSTAT REST API直接抽取,筛选出ISO 3166-1 alpha-3编码对应亚洲25个国家的观测值,并依据国际劳动统计学家会议(ICLS)定义对原始调查微观数据进行协调统一。最终形成包含19,442条观测记录、覆盖1997年至2025年时间跨度的规范化表格,每条记录均附有来源标签以确保可追溯性。
特点
该数据集的核心特色在于其精细的多维分解结构,围绕“按性别和经济活动划分的雇员小时工资中位数”这一关键指标展开。除核心观测值外,数据提供性别(总、男性、女性等)、经济活动分类以及详尽的来源与注释信息,支持多维度交叉分析。数据时间序列跨度长、覆盖国家广,且经由ILO统一标准化处理,消除了不同国家调查体系间的异质性,为跨国比较与劳动力市场研究提供了坚实、一致的数据基础。
使用方法
数据集以HuggingFace Datasets库的标准格式发布,用户可通过`load_dataset()`函数一键加载,并直接转换为Pandas DataFrame进行后续分析。适用场景包括单一国家时序分析、多国跨截面比较,以及按指标、性别或经济活动分类的聚合与透视。示例操作包括按国家代码筛选、针对特定指标绘制时间序列图,以及构建国家-年份观测值矩阵,极大降低了亚洲区域劳动力经济研究的工程门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建并维护,经Electric Sheep Asia于2025年整合至HuggingFace平台,旨在提供亚洲地区按性别和经济活动划分的雇员小时工资中位数(以当地货币计)的长期观测数据。作为ILOSTAT这一全球劳动统计权威数据库的子集,它聚焦25个亚洲国家1997至2025年间19,442条记录,服务于劳动经济学、性别工资差距、区域劳动力市场演化等核心研究议题。该数据集凭借统一的国际劳工统计会议(ICLS)定义及多源调查数据整合,为跨国家、跨时期的工资比较提供了标准化基础,对亚洲发展经济学和社会政策研究具有重要支撑价值。
当前挑战
该数据集首先致力于应对劳动经济领域中跨国家工资可比性不足的挑战,通过ILOSTAT的协调机制解决了因各国调查方法、货币单位、行业分类标准差异导致的数据异构性问题。其次,构建过程面临多重困难:不同国家的劳动力调查(LFS)与行政记录在频率、样本设计和编码规则上不一致,需对原始微观数据进行清洗与对齐;部分地区历史数据稀疏或存在序列断裂(如标记为'B'的断点),对时间序列分析造成干扰;同时,数据集仅保留年频观测,排除了更高时间分辨率的月度或季度序列,限制了短期波动研究的能力;此外,部分国家的性别分类或行业维度存在缺失,影响了细粒度分解分析的完整性。
常用场景
经典使用场景
该数据集收录了1997年至2025年间亚洲25个国家基于性别和经济活动分类的雇员中位数时薪数据,涵盖19,442条观测记录。其经典使用场景在于支持劳动经济学领域的时间序列分析与面板数据建模,研究者可借助该数据集纵向追踪特定国家或地区薪资水平的长期演变趋势,亦可横向比较不同国家在同一时点上的薪资结构差异。通过结合性别维度,学者能够系统评估亚洲各国在缩小性别薪酬差距方面的进展,并识别影响工资决定的经济活动部门因素。数据的高时间分辨率与多国覆盖特性,使其成为构建薪资预测模型、检验库兹涅茨曲线或刘易斯转折点等经典经济理论的理想素材。
衍生相关工作
基于该数据集,已衍生出一系列聚焦亚洲劳动经济的研究成果。在文献层面,有学者利用其长时序特征构建了亚洲25个国家的性别工资差距收敛模型,发现制造业与服务业在促进性别平等上表现出截然不同的动力机制。另有工作将该数据与ILOSTAT中的失业率、劳动参与率等指标交叉分析,揭示了工资水平与劳动力市场弹性之间的非线性关系。在工具层面,Electric Sheep Asia团队将该数据重新打包为Parquet格式并通过HuggingFace发布,极大便捷了机器学习领域的复现实验与基准测试。此外,该数据集也被整合进若干跨国面板数据分析工具包中,成为检验制度环境(如工会密度、最低工资立法)对工资决定机制影响的通用数据源。
数据集最近研究
最新研究方向
基于ILOSTAT亚太地区小时收入中位数数据集,当前前沿研究方向聚焦于性别薪酬差距的纵向追踪与区域比较分析,结合经济活动的细分维度,揭示劳动力市场中结构性不平等的变化轨迹。该数据集衔接了ILO提出的体面劳动与可持续发展目标(SDG 8),为评估各国1997至2025年间性别平等政策成效提供了量化基石。热点研究涵盖东南亚制造业女性劳动价值评估、西亚地区非正规就业对薪酬分布的影响,以及通过面板数据建模探索经济增长与性别收入收敛的动态关联。其分性别、分经济活动的粒度,使得跨时空对比成为可能,助力学者和政策制定者识别改革瓶颈,推动包容性增长战略的实证依据构建,对亚洲劳动经济学乃至全球体面劳动议程具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务