遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-edu-cur-nb-median-hourly-earnings-of-employees-by-sex-educati

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含22,960个观测值,涉及25个亚洲国家从1996年到2025年的收入数据,覆盖1个独立指标。具体而言,数据集聚焦于“员工中位小时收入,按性别、教育和货币分类”这一指标(代码为EAR_EHRM_SEX_EDU_CUR_NB),数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至亚洲国家。数据集以表格形式呈现,包括国家代码、来源、指标、性别分类、教育分类、货币分类、年份、观测值等列,适用于表格分类、回归和时间序列预测等任务。数据经过ILO的标准化处理,并标注了数据质量和注意事项,如年度频率、最佳来源选择等。

This dataset contains 22,960 observations of Earnings data across 25 Asia countries, spanning 1996–2025, covering 1 distinct indicator. Specifically, it focuses on the indicator Median hourly earnings of employees by sex, education and currency (code EAR_EHRM_SEX_EDU_CUR_NB), sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asian countries. The data is presented in tabular format, including columns such as country code, source, indicator, sex disaggregation, education classification, currency classification, year, observed value, etc., and is suitable for tasks like tabular classification, regression, and time-series forecasting. The data has been harmonized by ILO and includes notes on data quality and caveats, such as annual frequency and best source selection.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-edu-cur-nb-median-hourly-earnings-of-employees-by-sex-educati 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT核心统计数据库构建而成,原始数据经由其REST API接口批量获取,并依据ISO3国家代码精准筛选出亚洲区域内的25个经济体。在数据整合过程中,严格遵循国际劳工统计学家会议(ICLS)所确立的定义框架,对各国劳动力调查、住户收入调查等微观数据进行标准化处理,确保跨国家、跨年度的指标口径统一。最终,数据集以HuggingFace Datasets格式重新封装,保留了source.label字段用于追溯每个观测值的原始调查来源,实现了从原始采集到结构化存储的完整数据链路。
特点
本数据集收录了1996年至2025年间亚洲25个国家的22,960条观测记录,核心指标为按性别与教育水平细分的雇员每小时工资中位数。其独特之处在于多维度的分层结构——不仅提供了性别(总、男、女、其他)与教育聚合等级的交叉分类,还包含了本地货币与美元等多种计价单位的选择,使得研究者能够灵活构建不同维度的比较分析。此外,数据质量标志(如序列中断、临时估计等)的完整保留,为识别统计口径变化和异常值提供了关键线索,增强了时间序列分析的严谨性。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset()函数一键加载至Python环境,随后利用to_pandas()方法转换为DataFrame进行深度分析。典型应用范式包括:按ref_area字段过滤特定国家的子集以考察局部劳动力市场;针对单一指标按时间排序绘制趋势曲线,直观呈现薪资水平的演变轨迹;亦可借助pivot_table方法构建以年份为行、国家为列的透视矩阵,便于开展跨国面板数据分析。数据集的性别与教育分类变量可直接作为分组依据,配合obs_status标志对观测值进行质量控制,适合从事劳动经济学、发展经济学及国际比较研究的学者使用。
背景与挑战
背景概述
在劳动经济学与可持续发展目标(SDGs)的交叉领域,薪酬收入的性别与教育异质性一直是衡量体面劳动与经济增长(SDG 8)及性别平等(SDG 5)的核心观测维度。由国际劳工组织(ILO)统计司主导维护的ILOSTAT数据库,作为全球劳工统计的权威基石,通过整合各国劳动力调查、家庭收支调查及行政记录,为跨国产出比较提供了标准化框架。在此背景下,Asia-ILO-EAR-EHRM-SEX-EDU-CUR-NB数据集应运而生,由Electric Sheep Asia于2025年重新封装发布,聚焦25个亚洲国家1996至2025年间约22,960条按性别与教育程度划分的雇员小时收入中位数观测值。该数据集将ILOSTAT经过国际劳工统计学家会议(ICLS)定义协调后的微观数据,通过REST API提取并限定至亚洲区域,形成了首个面向机器学习社区的统一化、时间序列完整的亚洲薪酬面板,为剖析亚洲劳动力市场中教育与性别的收入回报差异、追踪后疫情时代不平等演化轨迹提供了可靠的数据基础设施。
当前挑战
该数据集所应对的核心领域挑战在于:亚洲地区因各国统计能力差异、调查工具不统一以及货币与购买力平价波动,导致长期以来缺乏可跨国家、跨时段比较的性别-教育细分薪酬数据,使得对亚洲劳动力市场歧视与人力资本回报率的实证研究常受限于碎片化信息。在构建过程中,主要挑战体现为三方面:其一,多源数据融合与标准化——原始数据来自25国不同版本的劳动力调查(如LFS、HIES),需通过ILO统一映射至ICLS分类框架,并通过“source.label”字段标记数据溯源以保证可追溯性;其二,数据稀疏性与时变断裂问题——部分国家存在年度缺失(如AFG仅有少量年份数据)且标注了“Break in series”状态码,需通过注释字段如实反映观测质量;其三,细分维度的非完备性——性别与教育分类列仅在特定指标发布时存在,且教育分类采用非标准等级(如“Nonstandard education level: Including…”),导致用户在跨表合并或机器学习建模时需处理复杂的分类对齐与缺失值处理策略。
常用场景
经典使用场景
在劳动经济学与教育经济学研究中,该数据集常用于分析亚洲地区不同性别与教育水平员工的时薪中位数分布格局。研究者可借助其涵盖25国、近三十年跨度的面板结构,构建时间序列模型或固定效应回归,揭示教育回报率在不同性别群体间的演变趋势,以及经济发展水平与工资溢价之间的内在关联。
实际应用
在实际应用中,该数据被国际组织、国家统计部门及政策智库用于监测可持续发展目标中体面工作指标的进展,尤其是女性与低技能群体的收入保障状况。劳动力市场研究人员可据此绘制亚洲各国工资阶梯图谱,为制定最低工资调整、职业培训资源配置及性别平等政策提供量化依据,助力缩小收入鸿沟。
衍生相关工作
围绕该数据集,衍生出多项富有影响力的工作,包括构建亚洲工资不平等数据库、开发基于机器学习的工资预测模型,以及融合教育分类与汇率信息的跨国工资购买力平价分析。此外,部分研究者将其与家庭调查数据匹配,扩展为包含职业流动性与工作条件在内的多维劳工权益评估框架,推动了劳动统计学与数据科学的交叉创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务