遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-geo-nb-average-hourly-earnings-of-employees-by-sex-and-ru

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲23个国家从1996年至2025年的员工平均小时收入数据,按性别(总计、男性、女性)和城乡地区(全国范围)细分,使用本地货币计价。数据集共包含1,809个观测值,来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过标准化处理。数据以表格形式组织,包括国家代码、年份、指标值、数据来源、性别分类等列,适用于表格分类、回归和时间序列预测等机器学习任务。数据集还提供了数据质量说明和使用示例,如按国家筛选或时间序列分析。

This dataset contains average hourly earnings of employees in 23 Asian countries from 1996 to 2025, disaggregated by sex (total, male, female) and rural/urban areas (national level), in local currency. It comprises 1,809 observations sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and harmonized. The data is tabular, with columns including country codes, year, indicator values, data sources, sex classifications, and more, suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting. The dataset also includes data quality notes and usage examples, such as filtering by country or time-series analysis.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-geo-nb-average-hourly-earnings-of-employees-by-sex-and-ru 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT统计数据库,是亚太地区劳动力市场研究中不可或缺的数据资源。数据通过ILOSTAT提供的REST API接口,直接抽取指标代码为EAR_EHRA_SEX_GEO_NB的观测值,并依据ISO 3166-1 alpha-3标准,筛选出亚洲23个国家的地理覆盖范围。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义,对各国原始调查微观数据进行统一协调处理,并在source.label字段中标注数据来源类型,如劳动力调查(LFS),以保证数据溯源清晰。最终由Electric Sheep Asia进行规范化重制,形成包含1809条观测记录的结构化数据集。
特点
该数据集聚焦于亚洲地区雇员平均小时工资的性别与城乡差异,时间跨度覆盖1996年至2025年,共涵盖23个亚洲国家,包含1个核心指标。数据集以年度频率记录,提供了按性别(总、男、女、其他)及城乡区域划分的细致分类维度,同时标注了观测状态标志(如序列中断)和来源注释,便于用户识别数据质量与连续性。数据属性以标准的ILOSTAT编码体系呈现,包括国家代码、指标名称、分类变量等字段,结构统一,便于进行跨国别、跨时间的比较分析与时间序列建模。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据集,并将其转换为Pandas DataFrame进行后续操作。支持按国家代码(如IDN)过滤子集,或对核心指标按时间排序后绘制时间序列图以观察趋势。亦可利用透视表功能,将数据重塑为以年份为行、国家为列的矩阵形式,便于横向比较各国工资水平的动态演变。该数据集可直接应用于表格分类、回归分析及时间序列预测等任务,为研究亚洲劳动力市场的性别工资差距、城乡收入差异等问题提供了便捷、高质量的数据支持。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT构建,并经Electric Sheep Asia重新打包发布,聚焦于亚洲23个国家在1996至2025年间雇员平均时薪的性别与城乡分布状况。数据集共包含1809条观测记录,核心研究问题在于揭示亚洲劳动力市场中工资结构的性别与地域差异,为劳动经济学、性别平等及区域发展政策提供量化依据。作为ILOSTAT劳动统计体系的重要分支,该数据集整合了各国劳动力调查、住户收入调查及行政记录等多源数据,采用国际劳工统计学家会议(ICLS)标准进行统一处理,显著提升了跨国比较的可比性与可靠性。其在亚洲劳动经济学研究中具有重要影响力,为后续时间序列预测、分类与回归分析提供了基准数据,尤其适用于评估联合国可持续发展目标(SDGs)中体面工作与经济增长指标的进展。
当前挑战
该数据集所解决的领域挑战主要在于亚洲地区劳动市场中工资数据的碎片化与不可比性。研究人员和政策制定者长期面临因各国统计口径不一、调查方法迥异以及数据缺失导致的跨国比较困境。亚洲经济体兼具发达与新兴特征,城乡二元结构突出,性别工资差距受文化、制度与经济因素多重影响,传统数据集难以同时涵盖性别与城乡维度的精细化时序信息。在构建过程中,ILO面临的关键挑战包括:从各国异构调查体系中提取一致性的工资定义(如区分小时工资与实际劳动时间),处理由于调查方法变更(如“断点”标识)带来的序列中断问题,以及确保来自乡村与城市区域的样本代表性。此外,数据稀疏性表现为部分国家年份断裂或观测不足,需通过标注最佳来源与状态标识(如暂定值、不可靠值)来维持元数据透明度,从而为后续的统计建模和缺失值填补提供支撑。
常用场景
经典使用场景
该数据集收录了1996年至2025年间亚洲23个国家按性别与城乡地域划分的雇员平均时薪数据,共计1809条观测记录。其核心应用场景在于劳动经济学领域的时间序列分析与面板数据建模,研究者可借此追踪特定国家或地区薪资水平的长期演变趋势,或通过构建固定效应模型与差分模型,识别性别薪酬差距、城乡收入分化等结构性问题的动态特征。数据集中包含标准化源编码与观测状态标记,便于在跨国家比较中控制数据质量差异,从而为区域劳动市场均衡性研究提供稳健的经验基础。
衍生相关工作
围绕该数据集可衍生出一系列具有学术影响力的经典工作。基于其面板结构,研究者有望构建亚洲多国性别薪酬差距的分解模型,揭示人力资本、行业隔离与制度因素在其中扮演的角色;也可利用时间序列方法预测后疫情时代收入恢复的非均衡模式。更前沿的方向包括运用因果推断框架评估贸易自由化、教育改革或社会保障扩张对城乡薪资收敛的效果。这些工作不仅能够填补亚洲区域劳动市场实证研究的空白,还可通过与ILOSTAT其他模块(如就业率、工作时长)的关联分析,催生关于体面劳动与可持续经济增长的跨学科研究议程。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区按性别及城乡划分的员工平均时薪动态,为劳动经济学中的性别薪酬差距、城乡收入分化等前沿议题提供了宝贵的时间序列证据。在可持续发展目标(SDGs)框架下,尤其是目标8(体面工作和经济增长)与目标5(性别平等)的监测中,该数据可支撑关于亚洲新兴经济体劳动力市场结构性变迁的量化分析。结合近年来亚太地区非正规就业扩张与数字化转型对薪酬体系的影响,研究者得以利用此数据集构建面板计量模型,深入探究政策干预(如最低工资调整、性别平等立法)与宏观经济波动如何交互作用于薪酬差异,从而为区域包容性增长战略提供数据驱动的洞见。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务