遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-ind-nb-average-hourly-earnings-of-employees-by-ilo-sector

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲国家员工平均小时收入数据,以当地货币计。数据集涵盖22个亚洲国家,时间跨度为2005年至2025年,共包含10,449个观测值。核心指标为“EAR_EHRA_SEX_IND_NB”,表示按ILO部门和性别划分的员工平均小时收入。数据通过ILOSTAT REST API获取,并经过ILO harmonization处理,以确保统计一致性。数据集提供详细的分类维度,如性别(总计、男性、女性等)和部门分类,并包含数据来源、观测状态和注释等信息。适用于表格分类、回归和时间序列预测等任务,旨在为机器学习研究提供标准化的亚洲劳动力市场数据。

This dataset contains average hourly earnings of employees in Asia, measured in local currency, disaggregated by ILO sector and sex. It includes 10,449 observations across 22 Asia countries, spanning from 2005 to 2025, with one key indicator: EAR_EHRA_SEX_IND_NB. The data is sourced from ILOSTAT, the ILOs central statistics database, and is harmonized using International Conference of Labour Statisticians (ICLS) definitions. It provides detailed disaggregation dimensions such as sex and sector classification, along with metadata on source, observation status, and notes. The dataset is designed for tabular classification, regression, and time-series forecasting tasks, offering a machine-learning-ready format for labor market analysis in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-ind-nb-average-hourly-earnings-of-employees-by-ilo-sector 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT统计数据库,借助其REST API接口,直接提取了编号为EAR_EHRA_SEX_IND_NB的指标数据。原始数据基于各国劳动力调查、家庭收入普查等权威来源,经ILO依照国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理。随后,数据被精准过滤至22个亚洲国家的范围,并由Electric Sheep Asia团队重新封装为结构化的Parquet格式,最终以HuggingFace数据集的形式发布,确保研究者能够便捷地获取与使用。
特点
数据集囊括了2005年至2025年间、覆盖22个亚洲国家的10,449条观测记录,核心指标为按ILO行业和性别分列的雇员平均小时收入(以当地货币计)。其特色在于提供了精细的分层维度,包括性别(总、男、女)与行业分类,并附带了数据来源标签、观测状态标志及详细注释,便于用户追溯数据质量与源信息。数据以年度频率呈现,采用ILO官方精选的‘最佳来源’,为跨国时间序列分析提供了可靠且标准化的基础。
使用方法
通过HuggingFace的`datasets`库,用户仅需调用`load_dataset()`函数即可一键加载该数据集,并可直接转换为Pandas DataFrame进行后续分析。典型的应用场景包括筛选特定国家的数据以绘制时间序列趋势,或利用数据透视表构建国家-年份矩阵,实现跨区域的横向对比。数据集支持分类、回归与时间序列预测等多种任务,为研究亚洲劳动力市场薪资动态的学者和数据分析师提供了灵活且强大的工具接口。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,并经Electric Sheep Asia平台重新封装,聚焦于亚洲22个国家2005至2025年间按行业与性别划分的雇员平均小时工资(以当地货币计),共计10,449条观测记录。ILO作为全球劳动统计的权威机构,其ILOSTAT数据库整合了各国劳动力调查、家庭收支调查等多元来源,为跨国比较提供了标准化基础。此数据集的核心价值在于弥合亚洲地区劳动力市场精细化数据的缺失,为研究工资不平等、性别收入差距及行业间薪酬分化等议题提供了高粒度、长跨度的实证支撑,对发展经济学、劳动经济学及政策制定领域具有显著影响力。
当前挑战
该数据集所面临的领域挑战主要体现在两方面:其一,亚洲各国劳动力市场结构差异悬殊,包括非正规就业比例、统计口径及数据采集频率不一,导致跨国可比性受限,尤其需警惕观测状态标志(如“不可靠”)对分析结论的潜在干扰。其二,在构建过程中,ILO虽采用国际劳工统计学家会议(ICLS)定义进行数据标准化,但多源数据整合仍面临缺失值填补、最佳来源选取逻辑(如同一国家—年份存在多个来源时)及分类维度(如性别、行业)的稀疏性问题。此外,部分国家早期数据缺失或频率不统一(如部分指标仅提供年度均值而非月度/季度序列),进一步增加了时间序列建模与因果推断的复杂度。
常用场景
经典使用场景
在劳动经济学与区域发展研究领域,该数据集为分析亚洲22国2005至2025年间不同产业部门及性别维度下的平均小时工资提供了标准化的横截面与时间序列混合面板数据。研究者常利用其精细的分产业(ILO sector)与分性别(sex)分类特征,构建多元回归模型或固定效应模型,以探究产业结构变迁、性别工资差异及经济发展阶段对劳动力报酬的影响机制。数据集含逾万条观测记录,覆盖土耳其、越南、柬埔寨等代表性经济体,其丰富的分类标签(如源数据标识、观测状态旗标)确保了科研复现的可靠性与比较分析的严谨性。
解决学术问题
该数据集直接回应了国际劳动统计中亚洲区域数据碎片化与可比性不足的长期困扰。通过统一采用ILOSTAT官方协调定义和本地货币计价口径,它使得跨国产出-工资弹性估算、性别工资差距的跨国比较、以及最低工资政策效果的准自然实验研究得以在更可信的实证框架下开展。尤其对于亚洲新兴经济体,该数据补全了中等收入阶段劳动力成本动态演变的关键证据链,支撑了关于“刘易斯转折点”到来时机和全球价值链中亚洲劳动力竞争优势定量衰减的学术辩论。
衍生相关工作
围绕该数据集已衍生出多项旨在深化亚洲劳动市场理解的二次研究成果。代表性工作包括基于该面板数据构建的亚洲性别工资差距分解研究,它利用Oaxaca-Blinder方法量化了产业隔离与歧视成分的贡献。亦有学者借助其长时序特征,采用因果森林或合成控制法评估了近年来亚洲多国最低工资制度改革的就业与收入效应。此外,数据集的标准化格式推动了自动化数据管道的发展,Electric Sheep Asia团队已基于该源开发出面向机器学习任务的Asia Labour ML系列,包含适用于工资预测的时间序列特征工程库与可解释性分析工具包。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务