遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-geo-cur-nb-average-hourly-earnings-of-employees-by-sex-rural

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的员工按性别、城乡地区和货币划分的平均小时收入数据,涵盖23个亚洲国家,时间跨度为1996年至2025年,共有5,100个观察值。数据集聚焦于一个具体指标:EAR_EHRA_SEX_GEO_CUR_NB,即员工按性别、城乡地区和货币划分的平均小时收入。数据通过ILOSTAT REST API获取,并经过亚洲国家ISO3代码过滤,经过ILO的统计方法协调,以确保数据一致性和可追溯性。数据集以表格形式提供,包含国家代码、年份、性别分类、地区类型、货币类型、观测值及其状态等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 5,100 observations of Average hourly earnings of employees by sex, rural / urban areas and currency data from the ILOSTAT database of the International Labour Organization (ILO), covering 23 Asia countries from 1996 to 2025. It focuses on one distinct indicator: EAR_EHRA_SEX_GEO_CUR_NB, which represents average hourly earnings of employees disaggregated by sex, rural/urban areas, and currency. Data is pulled directly from the ILOSTAT REST API and filtered to Asia ISO3 country codes, harmonized using ILO statistical methods for consistency and traceability. The dataset is provided in tabular format with columns such as country code, year, sex classification, area type, currency type, observed value, and status flags, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-geo-cur-nb-average-hourly-earnings-of-employees-by-sex-rural 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API直接抓取指标为EAR_EHRA_SEX_GEO_CUR_NB的原始数据,并依据ILO基于国际劳工统计学家会议(ICLS)定义对调查微观数据进行协调处理。随后,数据被过滤至亚洲23个国家的ISO3代码范围内,并经Electric Sheep Asia重新打包为Parquet格式,以确保机器学习就绪的标准化结构。最终形成一个包含5100条观测、覆盖1996至2025年时间跨度的精选时序数据集。
特点
数据集以亚洲区域为核心,涵盖了印度尼西亚、柬埔寨、菲律宾等23个国家的雇员平均小时工资信息,并提供了按性别、城乡地域及货币类型进行细分的多维分解维度。数据质量方面,采用ILO选定的‘最佳来源’处理同国家同年的多源冲突,且每条观测均带有来源标注与观测状态标识,便于溯源与可信度评估。该数据集兼具跨国的区域广度与多年的时间深度,为劳动经济学与区域发展研究提供了颗粒度精细的珍贵材料。
使用方法
用户可通过HuggingFace的datasets库轻松调用,使用`load_dataset`命令一键加载,并转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码过滤以聚焦特定区域,或针对单一指标进行时间序列的可视化探索。此外,利用数据透视表功能,可将原始长格式数据重塑为国家×年份的矩阵形式,便于面板数据建模或横向对比分析。数据集以cc-by-4.0许可发布,学术使用时需同时引用ILO原始来源及Electric Sheep Asia的二次整理版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门编制,通过Electric Sheep Asia于2025年重新打包发布,聚焦亚洲23个国家1996至2025年间按性别、城乡和货币划分的雇员平均小时工资。作为ILOSTAT核心统计数据的重要组成部分,该数据集旨在系统性地刻画亚洲地区劳动力市场中工资收入的动态变化与结构性差异,为经济学、劳动社会学及公共政策研究提供可比较、可复现的多维时间序列数据。其影响力体现在为全球可持续发展目标(SDG)中体面工作指标的监测提供了关键数据支撑,填补了亚洲地区精细化工资数据长期稀缺的空白。
当前挑战
数据集所解决的领域问题在于,亚洲各国工资统计口径不统一、城乡二元分割显著且性别收入差距复杂,传统收入调查难以实现跨国、跨时间的高频可比分析。构建过程中,挑战主要来自三方面:其一,需对ILOSTAT原始调查微数据进行标准化清洗,协调各国因调查方法(如劳动力调查、企业调查)不同带来的定义偏差;其二,需处理因国家数据质量差异导致的缺失值与序列断点问题,例如部分国家仅提供年度数据而缺失月季度细分;其三,分类维度(如性别、城乡)在部分年份或国家取值高度不完整,增加了多维分析时数据对齐的难度。
常用场景
经典使用场景
该数据集聚焦于亚洲23个国家1996至2025年间按性别与城乡地域划分的雇员平均小时收入,包含5100条观测记录。其最为经典的应用场景在于构建面板数据模型,用以揭示亚洲劳动力市场中性别工资差异的时空演变规律。研究人员常利用该数据中的obs_value作为因变量,结合sex与classif1等分类维度进行分位数回归或固定效应分析,从而量化城市化进程、性别政策变迁对收入分配格局的长期影响。
实际应用
在实际应用层面,该数据集为政府间组织与政策制定者动态监测亚洲各国最低工资标准的实施效果提供了可靠性支撑。国际机构可借助obs_status字段中的连续性标识,快速识别数据质量波动区间,并基于不同货币单位调整后的收入中位数,制定更具区域适应性的薪酬政策。跨国企业的人力资源部门亦能通过对比各国分性别小时收入水平,优化其亚洲供应链中的公平劳动实践评估框架。
衍生相关工作
该数据集衍生了若干具有影响力的研究工作,包括基于ILO统计标准对亚洲劳动调查微观数据的再分析,以及利用机器学习方法对缺省源进行插补的技术报告。部分学者以其为基准构建了亚洲城市-乡村工资差距的预测模型,另有团队将其与ILOSTAT中的就业率、社会保护覆盖指标联接,生成了多维度的体面劳动评价指数。这些衍生工作进一步巩固了该数据集作为亚洲劳动经济研究核心参照基准的地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务