遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-cur-nb-median-hourly-earnings-of-employees-by-sex-and-cur

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲25个国家从1996年至2025年的员工每小时收入中位数数据,按性别和货币进行划分。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API提取并过滤亚洲国家代码。数据集包含1,884个观测值,涵盖1个核心指标(EAR_EHRM_SEX_CUR_NB),即按性别和货币划分的员工每小时收入中位数。数据以表格形式组织,包括国家代码、年份、观测值、数据来源、性别分类等字段,适用于表格分类、回归和时间序列预测等任务。数据已由Electric Sheep Asia重新打包,便于机器学习使用。

This dataset contains median hourly earnings data for employees in 25 Asian countries from 1996 to 2025, disaggregated by gender and currency. The data is sourced from the ILOSTAT statistical database of the International Labour Organization (ILO), extracted via API and filtered for Asian country codes. The dataset consists of 1,884 observations, covering one core indicator (EAR_EHRM_SEX_CUR_NB): median hourly earnings of employees disaggregated by gender and currency. It is organized in tabular format, with fields including country code, year, observed value, data source, gender category and other relevant fields, and is suitable for tasks such as tabular classification, regression and time series forecasting. The dataset has been repackaged by Electric Sheep Asia for enhanced usability in machine learning applications.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-cur-nb-median-hourly-earnings-of-employees-by-sex-and-cur 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API直接获取原始指标数据,仅筛选出亚洲25个国家的观测记录。数据采集后,由Electric Sheep Asia团队进行标准化处理,将原始微数据依据ICLS定义进行协调统一,并以Parquet格式封装,确保机器学习就绪。数据覆盖1996年至2025年,共计1884条观测,包含1个核心指标,即按性别和货币划分的雇员每小时收入中位数。
特点
数据集具有多维度的结构化特征,涵盖25个亚洲国家,时间跨度长达三十年,提供了丰富的纵向比较可能。其独特的分解维度包括性别(男性、女性、总计及其他),以及货币类型等分类变量。每个观测值均附带详细的来源标签、状态标志和注释信息,便于用户进行数据溯源与质量评估。此外,数据经过ILO的标准化处理,确保跨国比较的统计口径一致。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数便捷加载数据,并转换为Pandas DataFrame进行后续分析。典型应用包括按国家筛选进行国别分析,或针对特定指标绘制时间序列趋势图。亦可通过透视表操作,将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析。数据集特别适用于亚洲劳动力市场研究、性别工资差异分析以及跨国经济发展比较等学术与政策研究场景。
背景与挑战
背景概述
在全球劳动经济学与可持续发展目标(SDGs)的宏观背景下,收入不平等与性别工资差距始终是国际社会关注的核心议题。国际劳工组织(ILO)作为劳动统计领域的权威机构,其ILOSTAT数据库为全球200多个经济体提供标准化的劳动力市场指标。2025年,由Electric Sheep Asia重新打包发布的亚洲地区按性别和货币划分的雇员中位数小时收入数据集,整合了25个亚洲国家1996年至2025年间共计1884条观测记录。该数据集聚焦于“EAR_EHRM_SEX_CUR_NB”单一指标,通过ILOSTAT官方API获取,并依据国际劳工统计学家会议(ICLS)定义进行数据协调,为研究亚洲地区劳动报酬的性别差异、跨时段趋势以及国家间比较提供了关键基础。其发布不仅丰富了区域劳动力数据资源,也为政策制定者评估最低工资、社会保障及体面劳动目标进展提供了实证支撑。
当前挑战
该数据集所面临的挑战主要体现在两个层面。在领域问题层面,亚洲地区多国劳动力市场结构差异悬殊,涵盖从工业化经济体到农业主导国家的广泛谱系,单一的中位数收入指标难以全面反映非正规就业、职业隔离以及隐性报酬不平等的复杂性。此外,不同国家的调查方法(如劳动力调查与家庭收支调查)与数据质量参差不齐,ILOSTAT虽提供来源标记,但跨国的时序可比性仍受限于方法论变动与统计中断(如观察状态中的‘Break in series’标记)。在构建层面,原始数据源自ILOSTAT的REST API,整合过程中需处理多源异构的元数据描述,包括性别人口细分(总、男、女、其他)以及货币分类标识。同时,部分国家数据稀疏(如缅甸仅45条记录,东帝汶覆盖时段不连续),导致时间序列分析中存在大量缺失值,这对模型的鲁棒性与推断准确性构成了显著挑战。
常用场景
经典使用场景
该数据集汇集了亚洲25个国家在1996至2025年间按性别与货币分组的雇员小时工资中位数,共计1884条观测记录。经典使用场景涵盖面板数据分析、时间序列建模以及多国比较研究。研究者可借此分析亚洲各国工资水平的长期演变轨迹,考察性别工资差异在不同经济发展阶段中的动态变化,并利用时间序列预测模型对特定国家的未来工资走势进行推演。同时,该数据集为宏观经济政策制定者提供了标准化、跨国的薪资基准,助力评估全球化进程中劳动报酬的收敛或发散趋势。
实际应用
在国际组织、政府部门与社会科学智库的实际决策中,该数据集具有广泛的应用价值。国际劳工组织(ILO)可据此监控亚洲成员国在体面劳动与性别平等目标上的进展;国家统计机构可以此为基准,校准本国工资调查的方法论与数据质量;而关注劳工权益的非政府组织则能利用可比较的跨国工资数据,撰写出具有说服力的政策建议报告。此外,跨国公司的人力资源部门可应用该数据集进行区域性薪酬基准分析,优化海外分支机构的薪资策略,确保在多元文化背景下的公平待遇。
衍生相关工作
围绕这一数据集,学术界与数据科学社区已衍生出多项经典工作。基于该ILOSTAT面板数据,研究者构建了预测亚洲新兴经济体性别收入差距收敛速度的贝叶斯分层模型,以及评估经济危机对工资中位数冲击的干预分析框架。在数据产品层面,出现了可视化的亚洲工资仪表盘,将时间序列与地理空间信息结合,直观展示各国薪资变迁。此外,该数据集被整合进多指标劳动市场数据库中,用于训练机器学习模型以自动化识别离群值与异常波动,提升了国际劳动统计数据的质量诊断效率。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务