遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-geo-cur-nb-median-hourly-earnings-of-employees-by-sex-rural-u

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于亚洲国家员工按性别、城乡地区和货币划分的中位小时收入的数据集。数据源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,包含5,100个观测值,覆盖23个亚洲国家,时间跨度为1996年至2025年。主要指标为“EAR_EHRM_SEX_GEO_CUR_NB”,即员工的中位小时收入,按性别、城乡地区和货币进行细分。数据集通过ILOSTAT REST API获取,并过滤为亚洲国家代码,经过国际劳工统计学家会议(ICLS)定义的统一处理,确保数据可比性和可追溯性。数据集以表格形式呈现,包含国家代码、国家名称、数据来源、指标代码、性别分类、城乡分类、货币分类、观测年份、观测值、观测状态等列,适用于表格分类、表格回归和时间序列预测等任务。

This dataset contains median hourly earnings of employees in Asia, disaggregated by sex, rural/urban areas, and currency. It is sourced from the International Labour Organizations (ILO) ILOSTAT central statistics database, comprising 5,100 observations across 23 Asian countries, spanning the years 1996 to 2025. The primary indicator is EAR_EHRM_SEX_GEO_CUR_NB, which measures median hourly earnings with breakdowns by sex, geographic area type, and currency. Data is obtained via the ILOSTAT REST API, filtered to Asian ISO3 country codes, and harmonized using International Conference of Labour Statisticians (ICLS) definitions for consistency and traceability. The dataset is structured in tabular format with columns such as country code, country name, data source, indicator code, sex classification, area classification, currency classification, observation year, observed value, and observation status, suitable for tasks like tabular classification, tabular regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-geo-cur-nb-median-hourly-earnings-of-employees-by-sex-rural-u 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,聚焦于亚洲地区雇员的性别、城乡区域及货币维度下的中位数时薪数据。数据通过ILOSTAT REST API直接采集,并依据亚洲ISO3国家代码进行地理过滤,最终整合了来自23个亚洲国家、时间跨度自1996年至2025年的5100条观测记录。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,同时保留数据来源标签以确保可追溯性。
使用方法
可通过HuggingFace的datasets库直接加载,使用`load_dataset`函数即可获取训练集,并转换为Pandas DataFrame进行后续分析。用户可依据`ref_area`字段筛选特定国家的时间序列数据,或按`indicator`字段聚焦单一指标进行时序可视化。通过数据透视功能,还可方便地将数据重塑为以年份为行、国家为列的矩阵形式,便于跨国家的横向比较与面板数据分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年整理发布,并经Electric Sheep Asia重新包装于HuggingFace平台,旨在系统性地提供亚洲23个国家1996年至2025年间按性别、城乡与货币分组的雇员小时工资中位数信息。作为ILOSTAT数据库的核心组成部分,该数据集依托ILO在劳动统计领域的权威地位,整合自各国劳动力调查、家庭收支调查及行政记录,填补了亚洲区域在工资收入精细维度上的数据空白。其发布有力支撑了可持续发展目标(SDGs)中体面工作与经济增长指标的监测,为比较亚洲各国劳动力市场的性别工资差距、城乡收入分化及货币购买力差异提供了标准化、可复用的基础数据资源。
当前挑战
该数据集面临的核心挑战首先在于亚洲各国劳动统计体系的高度异质性,包括调查方法、工资定义、货币换算及时序断点(如标注为'Break in series')的多样性,导致跨国家、跨时期比较时需审慎处理数据一致性问题。其次,构建过程中需协调ILOSTAT多源数据的整合,尤其在处理同一国家同一年份存在多个调查来源时,仅采用ILO选定的'最佳来源',可能引入选择偏差。此外,数据集中存在大量缺失值,例如性别与城乡分类维度在某些年份或国家未齐备,限制了分层分析的完整性。最后,年频数据排除了月度或季度序列,难以捕捉工资波动的短期动态,对高频政策评估形成制约。
常用场景
经典使用场景
在劳动经济学与区域发展研究领域,该数据集是剖析亚洲各国性别薪酬差异与城乡收入鸿沟的基准资源。研究者可借此构建面板数据模型,系统评估按性别与城乡划分的雇员小时工资中位数,揭示经济发展阶段、劳动力市场制度与文化规范如何交织塑造薪酬结构。其时间跨度覆盖1996至2025年,涵盖23个亚洲经济体,为跨国比较提供了独特视角。通过整合ILOSTAT统一分类标准下的微观调查数据,该数据集支持经典的最小二乘回归与固定效应分析,尤其在探究女性劳动参与率提升是否伴随薪酬趋同、抑或城乡二元结构下收入差距固化等议题时,展现出不可替代的实证价值。
解决学术问题
该数据集精准回应了劳动经济学中关于薪酬决定因素与不平等动态的学术追问。传统研究常受制于国别数据分散、指标定义不一与时间序列断裂等困境,而此数据集通过ILO标准化程序,消弭了不同国家劳动力调查之间的口径差异,使跨时期、跨地域的薪酬比较成为可能。学术上,它助力解答性别工资差距是否存在收敛趋势、城镇化进程如何调节城乡收入分化、以及制度因素如最低工资政策对薪酬中位数的实际效应等核心问题。其深远意义在于,为开发更公平的劳动力市场评估框架提供了数据根基,推动了从描述性分析向因果推断的转型,使政策评估与理论验证拥有更坚实的实证支撑。
实际应用
在实际应用中,该数据集成为国际组织、各国劳动部门与社会研究机构制定薪酬平等政策的决策依据。政策制定者可利用其精细的分层维度——性别、城乡区域与货币类型——定期监测劳动力市场的薪酬变动,识别特定群体(如农村女性劳动者)是否面临系统性收入低估。非政府组织可基于这些数据设计精准的干预项目,推动同工同酬倡议落地。企业界与社会责任评级机构亦能借鉴此数据评估区域用工成本与性别包容性表现,优化投资与运营策略。此外,数据集的时间序列特性支持动态预警,帮助识别经济危机或政策调整期间薪酬脆弱性的加剧,从而促成及时的社会保护响应。
数据集最近研究
最新研究方向
在劳动经济学与可持续发展目标的交叉领域,该数据集为揭示亚洲地区薪酬性别差异的时空演化规律提供了关键数据支撑。当前研究前沿聚焦于利用该数据集的性别与城乡双重细分维度,结合时间序列分析方法,量化分析23个亚洲经济体在1996至2025年间,女性与男性员工小时工资中位数的动态差距及其城乡差异模式。特别是在后疫情时代全球劳动力市场重构的背景下,该数据可服务于追踪各地最低工资政策调整、非正规就业转化及性别平等立法对薪酬结构的实际影响,为联合国可持续发展目标8(体面工作)与目标5(性别平等)的进展评估提供可信的实证基础。其跨时30年、覆盖多元发展水平国家的特征,使人能够进行跨国比较与长周期趋势研究,从而识别出有效缩小性别薪酬鸿沟的制度性因素与社会经济杠杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务