遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-edu-cur-nb-average-hourly-earnings-of-employees-by-sex-educat

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的统计数据,主题为亚洲国家员工按性别、教育和货币分类的平均小时收入。数据集涵盖25个亚洲国家,时间跨度为1996年至2025年,包含22,960个观测值。核心指标为EAR_EHRA_SEX_EDU_CUR_NB,即按性别、教育和货币分类的员工平均小时收入。数据通过ILOSTAT REST API获取,并经过标准化处理,以表格形式提供,包括国家代码、来源、指标、性别分类、教育分类、货币分类、年份、观测值等列。数据集适用于表格分类、回归和时间序列预测等任务,旨在支持劳动经济学研究和机器学习应用。

This dataset contains statistical data from the International Labour Organization (ILO) ILOSTAT database, focusing on the average hourly earnings of employees in Asia, disaggregated by sex, education, and currency. It covers 25 Asian countries, spanning from 1996 to 2025, with 22,960 observations. The core indicator is EAR_EHRA_SEX_EDU_CUR_NB, which represents Average hourly earnings of employees by sex, education and currency. Data is sourced via the ILOSTAT REST API and harmonized, provided in tabular format with columns including country code, source, indicator, sex classification, education classification, currency classification, year, observed value, etc. The dataset is suitable for tasks such as tabular classification, regression, and time-series forecasting, aiming to support labor economics research and machine learning applications.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-edu-cur-nb-average-hourly-earnings-of-employees-by-sex-educat 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT核心统计数据库,经由Electric Sheep Asia团队重新打包整理而成。数据通过ILOSTAT REST API接口直接获取,筛选出亚洲25个国家及地区的相关记录,并依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一规范化处理。最终整合为包含22,960条观测值的表格型数据集,涵盖1996年至2025年间亚洲雇员按性别、教育程度及货币分类的平均小时工资信息,并以Parquet格式发布以提升机器学习领域的可用性。
特点
该数据集的核心特色在于其跨国家、跨时间维度的丰富分层结构。它不仅覆盖印尼、柬埔寨、越南等25个亚洲经济体,还通过性别(总/男/女)、教育程度(聚合级别)及货币(本地货币)等分类变量提供精细化的数据剖分。每个观测值均附有详细的数据来源标签与观测状态注释,增强了数据的可追溯性与质量透明度。同时,数据集遵循CC-BY-4.0许可协议,便于学术界与工业界在尊重原始数据来源的前提下自由使用。
使用方法
研究人员可通过HuggingFace Datasets库中的`load_dataset`函数一键加载数据,并将其转换为Pandas DataFrame进行后续分析。使用时应关注数据为年度频率,且部分国家存在多年数据缺失情况。推荐先按国家代码(`ref_area`)筛选以聚焦特定区域,再结合时间轴(`time`)绘制时序图观察工资演变趋势。亦可利用透视表功能构建以年份为索引、国家为列的面板数据矩阵,便于比较不同国家间的性别教育工资差异。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年整理发布,并经Electric Sheep Asia团队重新封装为机器学习友好格式,聚焦于亚洲地区按性别、教育程度和货币划分的雇员平均时薪。数据集涵盖25个亚洲国家、1996年至2025年间的22,960条观测记录,源自ILOSTAT这一全球劳动统计权威数据库。ILO通过统一采纳国际劳工统计学家会议(ICLS)定义,对各国劳动力调查、家庭收入调查及行政记录等原始数据进行标准化处理,为研究亚洲劳动力市场中的收入不平等、性别薪资差距以及教育回报率等核心议题提供了高颗粒度的跨时空比较基础。该数据集已被广泛应用于发展经济学、劳动经济学及公共政策评估领域,成为分析亚洲新兴经济体与低收入国家就业质量的关键实证来源。
当前挑战
数据集面临的核心挑战在于跨境比较的异质性问题:亚洲各国在数据采集方法、货币换算、教育分类标准及调查周期上存在显著差异,不同来源的“最佳来源”选择机制虽提升了数据权威性,但也可能引入偏倚,例如同一国家不同年份因调查方法变更导致的序列断裂(如`obs_status`字段标记的“Break in series”)。构建过程中,ILO需对25国混杂的国家统计体系进行协调,处理缺失、不一致的分类维度(如性别、教育聚合层级),并应对月度和季度高频数据未纳入造成的时效性局限。此外,本地货币计值的时薪数据(`classif2`中的`CUR_TYPE_LCU`)在通货膨胀和汇率波动下难以直接比较,而教育分类(`EDU_AGGREGATE_TOTAL`)的非标准表述(如`note_classif`字段显示的`Nonstandard education level`)进一步增加了跨文化分析的复杂性。
常用场景
经典使用场景
在劳动经济学与教育经济学的交叉研究中,该数据集作为亚洲地区首个涵盖性别、教育水平和货币类型的平均时薪标准化时序数据,被广泛应用于面板数据分析与跨国比较研究。研究者常借助其丰富的分类维度(如性别、教育程度)构建固定效应模型或随机效应模型,以剖析人力资本回报率在亚洲不同经济体间的异质性特征,探讨教育投资对劳动力市场收入的差异化影响。
衍生相关工作
该数据集的衍生机理催生了若干具有影响力的学术方向。围绕ILOSTAT数据源,研究者开发了自动化数据清洗与插补流程,形成了用于跨国劳动市场动态预测的时序基础模型。近年来,以此为核心数据支撑的研究包括:利用贝叶斯分层模型估测亚洲教育回报率的时空演变,以及结合联合国可持续发展目标评估亚洲国家体面劳动进展的指标体系构建,极大推动了区域劳动经济学的实证研究。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区雇员平均时薪在性别与教育维度上的跨国比较分析,为劳动经济学中薪酬平等与人力资本溢价的前沿研究提供了关键支撑。近期,随着ILOSTAT统计框架对亚洲新兴经济体(如印尼、柬埔寨)样本的深化覆盖,研究者得以更精确地刻画1996至2025年间教育回报率的动态演化,并量化性别工资差距在不同教育层次间的异质性。该数据对于评估可持续发展目标中体面劳动指标的进展、监测各国最低工资政策与技能鸿沟的交互效应具有重要实证意义,尤其在后疫情时代非正规就业结构变迁的背景下,为区域劳动力市场韧性研究奠定了量化基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务