遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-eco-cur-nb-average-hourly-earnings-of-employees-by-sex-econom

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲25个国家从1996年至2025年的54,975个观测值,专注于按性别、经济活动和货币划分的员工平均小时收入指标(EAR_EHRA_SEX_ECO_CUR_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API获取并过滤为亚洲国家。数据集涵盖表格分类、回归和时间序列预测任务,提供结构化列如国家代码、指标、性别分类、时间年份和观测值等,支持劳动经济学研究和机器学习应用。数据以年度频率发布,并包含数据来源和质量注释,适用于分析亚洲地区收入趋势和性别差异。

This dataset contains 54,975 observations across 25 Asian countries from 1996 to 2025, focusing on the Average hourly earnings of employees by sex, economic activity and currency indicator (EAR_EHRA_SEX_ECO_CUR_NB). Sourced from the International Labour Organization (ILO)s ILOSTAT database, it is retrieved via REST API and filtered for Asian countries. Designed for tabular classification, regression, and time-series forecasting tasks, it includes structured columns such as country codes, indicators, sex disaggregation, time years, and observed values, supporting labor economics research and machine learning applications. Data is published at annual frequency with source and quality annotations, suitable for analyzing income trends and gender disparities in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-eco-cur-nb-average-hourly-earnings-of-employees-by-sex-econom 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API接口直接提取指标EAR_EHRA_SEX_ECO_CUR_NB的原始观测数据,并依据亚洲ISO3国家代码进行地理过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查及行政记录等来源的微观数据进行协调与标准化处理。Electric Sheep Asia团队对原始数据进行了二次封装,统一转化为Parquet格式,确保数据的机器学习就绪性。最终数据集包含54,975条观测记录,覆盖25个亚洲国家,时间跨度从1996年至2025年,每条记录均保留了来源标注字段以保障可追溯性。
特点
该数据集聚焦于亚洲地区雇员按性别、经济活动与货币划分的平均小时工资指标,核心特点在于其精细的维度划分与多颗粒度聚合能力。数据包含性别维度(总计、男性、女性、其他)、经济活动分类及货币类型,支持跨群体、跨行业与跨币种的对比分析。作为年度面板数据,其覆盖范围广泛,时间序列长,且仅采用ILO筛选的最佳来源数据,规避了多源冲突带来的噪声。此外,数据集中包含观测状态标志与注释字段,便于研究者评估数据质量与序列断点,适合用于劳动经济学中的工资差异研究、性别不平等分析及时间序列预测建模。
使用方法
该数据集可通过HuggingFace Datasets库直接加载,调用load_dataset函数即可将数据导入为Pandas DataFrame,便于后续分析与可视化。使用方法灵活多样:研究者可依据国家代码(如ref_area字段)筛选特定国家的子集以进行国别研究;亦可基于指示代码对单一时序变量进行观测值排序与绘图,直观呈现工资随时间的变化趋势。对于需要跨区域横向比较的研究,可通过数据透视功能将数据重组为国家×年份的矩阵格式,从而高效构建面板数据结构。数据集兼容分类、回归及时序预测等机器学习任务,为劳动经济学领域的实证分析提供了即用型数据基础设施。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年经Electric Sheep Asia重新整理并发布,聚焦亚洲25个国家在1996至2025年间按性别、经济活动与货币分类的员工平均时薪数据。其核心研究问题在于揭示亚洲地区劳动力薪酬的结构性差异与演变趋势,为劳动经济学、性别薪酬平等及区域发展研究提供可靠的数据基础。作为ILOSTAT数据库的一部分,该数据集整合了各国劳动力调查、家庭收入调查等官方统计资料,经ILO统一协调后形成标准化指标,对推动亚洲乃至全球劳动统计的规范化与可比性具有重要价值,尤其为评估体面劳动目标(SDG 8)提供了实证支撑。
当前挑战
该领域面临的核心挑战在于劳动统计数据的异质性与缺失问题。亚洲各国在数据采集频率、调查方法及分类标准上差异显著,导致跨国家、跨时期的数据可比性受限;尽管数据集已选取ILO认定的‘最佳来源’,但部分观测值仍带有‘序列中断’或‘不精确’等状态标记,影响时间序列分析的稳健性。构建过程中,从异构来源中提取并统一编码性别、经济活动等分类维度,处理多源数据冲突与稀疏观测,并确保1996至2025年间的长期覆盖,均构成技术上的主要挑战,尤其是当个别国家数据间隔较长或指标仅在特定分层下可用时,需谨慎处理缺失与偏差问题。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交汇地带,该数据集为亚洲地区性别工资差异的时空演化分析提供了难得的数据支撑。凭借覆盖25个亚洲国家、跨越近三十年(1996—2025年)的54,975条观测记录,研究者得以通过小时工资这一精细度量,精准刻画不同性别劳动者在各类经济活动领域内的薪酬分布格局。基于其结构化的分类变量(如经济部门代码、本地货币单位),该数据集常被用于构建面板数据模型或时间序列回归,以识别工资增长的趋势拐点、经济转型对劳动力报酬的冲击,以及性别薪酬差距随发展阶段收敛或扩大的动态路径。其颗粒度达到按性别、经济活动与货币三重交叉的分类层次,使得跨国产出比较与区域内异质性分析成为现实。
实际应用
在政策制定与国际发展合作实践中,该数据集展现出多维度的应用价值。国际组织与国家统计机构可借助其时间序列信息,动态监测亚洲各国在《2030年可持续发展议程》框架下关于体面工作与同工同酬目标的达成进度,尤其适用于追踪性别薪酬差距的收敛速度,并识别高增长行业中潜在的劳动报酬不均衡风险。对于跨国企业而言,将其全球供应链的人力成本核算与区域薪酬基准进行对标,有助于在东南亚及南亚投资布局时做出更富竞争力的薪酬决策。非政府组织与学术智库亦可利用该数据,为倡导劳动权益、设计针对性培训项目或评估特定经济改革的社会效果提供量化论据,从而推动从“数据知情”到“数据驱动”的社会治理转型。
衍生相关工作
该数据集已在多个研究方向上催生出具有影响力的派生工作。基于其面板结构,学者构建了亚洲性别工资差距元分析模型,系统比较了制造业、服务业与农业部门中的性别薪酬变异来源。部分研究利用分类维度中的“货币类型”字段,结合汇率数据,创新地测算了按购买力平价调整后的实际地区间工资差异,有效剥离了名义汇率波动对比较结果的影响。此外,机器学习领域的标注工作亦从中受益:该数据集的地理、时间及性别标签被用于训练工时预测、部门间工资溢出效应等任务的监督学习模型。更有研究团队将其与ILOSTAT的其他劳动指标(如失业率、非正规就业比例)进行数据融合,构建出综合性的亚洲劳动力市场预警指数,拓展了单一工资数据集在宏观计量与政策模拟中的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务