遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-ocu-cur-nb-average-hourly-earnings-of-employees-by-sex-occupa

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的“按性别、职业和货币划分的员工平均小时收入”数据,专门针对亚洲地区。数据集涵盖31个亚洲国家,时间跨度为1997年至2025年,共包含30,895个观察值。核心指标为“EAR_EHRA_SEX_OCU_CUR_NB”,即按性别、职业和货币划分的员工平均小时收入。数据通过ILOSTAT REST API提取,并过滤为亚洲国家代码,ILOSTAT使用国际劳工统计学家会议(ICLS)定义对原始调查微数据进行标准化。数据集提供了详细的模式,包括国家代码、来源、指标、性别分类、职业分类、货币分类、年份、观测值及其状态等列。数据质量方面,数据为年度频率,ILO选择“最佳来源”处理多源情况,且分类列仅在指标发布细分数据时非空。数据集适用于表格分类、回归和时间序列预测等任务,可用于分析亚洲地区劳动力市场收入趋势。

This dataset contains Average hourly earnings of employees by sex, occupation and currency data from the International Labour Organization (ILO) ILOSTAT database, specifically focused on Asia. It covers 31 Asian countries, spans from 1997 to 2025, and includes 30,895 observations. The core indicator is EAR_EHRA_SEX_OCU_CUR_NB, representing average hourly earnings disaggregated by sex, occupation, and currency. Data is extracted via the ILOSTAT REST API and filtered to Asia ISO3 country codes, with ILOSTAT harmonizing raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions. The dataset provides a detailed schema including columns for country code, source, indicator, sex classification, occupation classification, currency classification, year, observed value, and status flags. In terms of data quality, the data is annual frequency, the ILO-selected best source is used for multiple sources, and disaggregation columns are non-null only when the indicator publishes breakdowns. It is suitable for tasks such as tabular classification, regression, and time-series forecasting, enabling analysis of labor market earnings trends in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-ocu-cur-nb-average-hourly-earnings-of-employees-by-sex-occupa 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API接口直接提取亚洲地区员工按性别、职业及货币分类的平均小时收入数据。原始数据来源于各国劳动力调查、家庭收入调查及行政记录,经ILO依据国际劳动统计学家会议(ICLS)定义进行统一协调与标准化处理。经过筛选,仅保留亚洲31个国家的ISO代码对应数据,最终整合为包含30,895条观测记录的结构化数据集,涵盖1997年至2025年的年度时间序列,每条记录均附有来源标识以确保可追溯性。
特点
数据集聚焦于单一核心指标——平均小时收入,但通过多维分类变量实现丰富的数据分解。其细分维度涵盖性别(男、女、总计及其他)、职业技能水平(基于OCU标准)以及货币类型(本地货币等),使用户能够从多个角度剖析薪酬差异。数据覆盖亚洲31个国家,时间跨度近三十年,其中柬埔寨、菲律宾、越南等国观测值最为密集,为跨区域、跨时期的比较分析提供了坚实的数据基础。数据集采用Parquet格式存储,并附带标准化模式,确保与机器学习工作流的良好兼容性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载数据集至内存,并利用to_pandas()方法转换为Pandas DataFrame进行后续操作。典型应用包括:按国家筛选数据框以进行单一国家的工资趋势分析;对特定指标按时间排序后绘制时间序列图,直观观察薪资演变;以及通过数据透视表将长格式数据重塑为国家与年份的矩阵格式,便于面板数据分析。数据集的列注释清晰,分类变量均附有对应的英文标签,降低了数据探索与预处理的复杂度。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Asia于2025年重新整理并发布在HuggingFace平台上,聚焦于亚洲地区按性别、职业和货币分类的员工平均时薪数据。核心研究问题在于揭示亚洲31个国家在1997年至2025年间劳动报酬的结构性差异,为劳动力经济学、性别薪酬平等及区域发展研究提供标准化、可比较的微观数据基础。作为ILOSTAT数据库的重要子集,该数据集弥补了亚洲地区高粒度薪酬时序数据的稀缺性,尤其为跨国面板分析、时间序列预测及社会分层研究提供了可靠的数据源。其在劳工统计领域的影响力体现在促进对亚洲劳动力市场收入动态的系统性理解,并支撑可持续发展目标(SDGs)中体面工作指标的量化评估。
当前挑战
该数据集所解决的领域核心挑战在于亚洲各国薪酬统计口径不一致、分类标准差异显著以及数据稀疏性问题。ILOSTAT通过采用国际劳工统计学家会议(ICLS)定义进行数据协调,但面临不同国家调查类型(如劳动力调查、家庭收支调查)与行政记录之间的衔接难题,导致部分国家年度数据存在断裂标志(如'Break in series')和观察状态不确定性。构建过程中,数据整合面临三大具体挑战:一是多来源数据在性别、职业等分类维度上的非完整覆盖,例如部分年份缺乏按技能水平细分的信息;二是跨货币单位(本地货币与统一货币)的换算与可比性处理;三是长时序中各国调查方法变更、指标定义更新带来的统计口径波动。此外,数据清洗需处理约30895条观测中的缺失值、异常标志及注释信息(如非标准职业分类代码),以确保机器学习或时序建模的输入质量。
常用场景
经典使用场景
在全球劳动经济学与收入不平等研究领域,该数据集凭借其对亚洲31个国家、跨越近三十年(1997–2025)的雇员平均小时工资的精细记录,成为剖析劳动力市场动态的基石。研究者可依据性别、职业技能等级及货币类型等维度进行多层级交叉分析,从而揭示亚洲不同经济体内部及之间的薪酬结构差异。尤为关键的是,数据集中包含的性别细分变量(SEX_T、SEX_M、SEX_F)为量化职场性别收入鸿沟提供了无可替代的实证基础,使得基于时间序列的纵向比较与基于国家横截面的横向对比成为可能。
实际应用
在实际应用层面,该数据集为国际发展机构、政府智库及跨国企业的决策提供了量化支撑。例如,世界银行或亚洲开发银行可借此监测成员国体面劳动目标的实现进程;各国劳动部门能通过同区域相邻经济体的工资对比,校准本国的最低工资标准与产业薪酬指导线。此外,跨国企业在制定亚洲区域人力资源战略时,可依据不同职业与性别组合的薪酬分布数据,优化薪酬公平性审计与市场竞争力定位。数据以Parquet格式打包并提供Python的load_dataset接口,极大降低了非学术机构的技术使用门槛。
衍生相关工作
基于该数据集的丰富结构,一系列经典后续工作得以蓬勃发展。研究者常以其为核心,结合ILOSTAT中其他如失业率、劳动生产率等指标,构建亚洲经济体劳动力市场综合指数的面板数据集。亦有学者将其与世界经济论坛的全球性别差距报告数据融合,开展计量经济学回归分析以探索教育投入、法律框架与工资收敛之间的因果关系。在机器学习领域,该数据集的时间序列特性被用于训练针对性的预测模型,例如利用LSTM网络预测特定职业在东南亚国家联盟(ASEAN)内部的未来工资走势,开辟了劳动经济学与深度学习的交叉前沿。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务