遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-nb-median-hourly-earnings-of-employees-by-sex-local-c

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲25个国家按性别划分的员工小时收入中位数(本地货币)统计数据,涵盖1996年至2025年期间的663个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,这是一个全球领先的劳动统计数据源,整合了就业、失业、工资、工作时间等多个领域的指标。数据集通过ILOSTAT REST API获取,并筛选了亚洲国家的ISO3代码,确保数据覆盖印度尼西亚、菲律宾、土耳其、柬埔寨、越南、斯里兰卡、巴基斯坦、泰国、巴勒斯坦、亚美尼亚、印度、约旦、蒙古、东帝汶、孟加拉国等25个国家和地区。数据按性别维度进行细分(包括总计、男性、女性等),并包含国家代码、国家名称、数据来源、指标代码、观测年份、观测值、数据状态等列。数据集适用于表格分类、表格回归和时间序列预测等机器学习任务,可用于分析亚洲国家收入趋势、性别收入差异等研究。数据以Parquet格式发布,便于使用HuggingFace的`load_dataset()`函数快速加载和处理。

This dataset contains median hourly earnings (in local currency) statistics for employees in 25 Asian countries, disaggregated by gender, with 663 observations spanning the period from 1996 to 2025. This dataset is sourced from the ILOSTAT database of the International Labour Organization (ILO), a leading global labor statistics data source that integrates indicators across multiple domains including employment, unemployment, wages, and working hours. The dataset was obtained via the ILOSTAT REST API, and ISO3 codes for Asian countries were filtered to ensure coverage of 25 Asian countries and regions including Indonesia, the Philippines, Turkey, Cambodia, Vietnam, Sri Lanka, Pakistan, Thailand, Palestine, Armenia, India, Jordan, Mongolia, Timor-Leste, and Bangladesh. The data is disaggregated by gender (including total, male, female, etc.), and includes columns such as country code, country name, data source, indicator code, observation year, observed value, and data status. This dataset is suitable for machine learning tasks such as tabular classification, tabular regression, and time series forecasting, and can be used for research analyzing income trends and gender income gaps in Asian countries. The data is released in Parquet format, enabling fast loading and processing using HuggingFace's `load_dataset()` function.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-nb-median-hourly-earnings-of-employees-by-sex-local-c 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接获取原始指标数据,并依据亚洲地区的ISO3国家代码进行地理筛选与整合。数据收录了1996年至2025年间25个亚洲国家的663条观测记录,涵盖按性别分列的雇员每小时收入中位数(以本币计)这一核心指标。ILO遵循国际劳工统计学家会议(ICLS)的定义标准,对各国劳动力调查、住户收入调查及行政记录等原始微观数据进行统一协调与清洗,确保跨国家与跨时间的可比性。Electric Sheep Asia对原始数据进行了重新封装,将非标准化的源数据转化为结构统一的表格格式,并补充了来源标签、观测状态等元数据列,以提升数据的可追溯性与机器可读性。
特点
该数据集最显著的特点在于其聚焦亚洲区域且时间跨度长达三十年的纵向结构,能够支撑跨国家、跨性别的收入动态比较分析。数据严格区分了性别维度(SEX_T总人口、SEX_M男性、SEX_F女性、SEX_O其他),并保留了原始来源标识与观测状态标志(如序列中断、暂定值等),为数据质量评估提供了透明依据。指标定义明确且单位统一为各国本币,避免了汇率折算带来的偏差。此外,数据以年度频率发布,并采用ILO筛选的“最佳来源”策略处理同一国家年份的多源冲突,确保了序列的权威性与一致性。
使用方法
用户可通过HuggingFace Datasets库以`load_dataset()`函数一键加载该数据集至Python环境,并可直接转换为Pandas DataFrame进行后续操作。典型应用包括:按国家代码(如`ref_area`列)筛选特定国家的收入序列;以`indicator`列锁定核心指标(EAR_EHRM_SEX_NB),结合`time`列进行时间序列分析与可视化;利用`sex`列实现性别分组比较;通过数据透视表将长格式数据重塑为国家×年份的矩阵,便于构建面板数据模型或进行区域对比研究。所有操作均基于标准化的列名与数据类型,极大降低了数据预处理的工作量。
背景与挑战
背景概述
在劳动经济学与社会政策研究领域,性别收入差距始终是衡量劳动力市场公平性与可持续发展目标(SDG)进展的核心议题。国际劳工组织(ILO)通过其ILOSTAT数据库长期致力于全球劳动统计数据的标准化与发布,而亚洲作为全球劳动力最密集且社会经济结构多元的区域,其性别工资差异的量化研究尤为关键。2025年,Electric Sheep Asia基于ILOSTAT的REST API,将指标EAR_EHRM_SEX_NB(按性别划分的雇员小时工资中位数,以本币计)重新打包为面向机器学习的结构化数据集,覆盖25个亚洲国家1996至2025年间663条观测记录。该数据集为跨国家、长周期的性别工资动态比较提供了统一且可复用的数据基础,有力地支撑了计量经济学分析、时间序列预测与政策评估研究。
当前挑战
该数据集面临的核心挑战包括:一、领域问题层面,不同国家间劳动力调查的定义、覆盖范围与统计口径存在显著差异(如来源代码与调查类型各异),导致跨国比较时需谨慎处理数据异质性与可比性问题;二、数据稀疏性与非平衡性突出,如阿富汗仅1条记录,而印度尼西亚达84条,且部分年份观测缺失,给时间序列建模与面板数据分析带来插补与推断困难;三、观测状态标识(如序列中断、临时估计)提示数据质量波动,需引入适当的筛选或稳健估计策略;四、数据集构建过程中,从异构的ILOSTAT API提取、标准化为统一Schema,并处理多级分类维度的非空约束,涉及复杂的数据清洗与元数据对齐工作。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织(ILO)所辖ILOSTAT数据库中关于亚洲25个国家1996至2025年间按性别划分的雇员每小时工资中位数(以当地货币计)的观测记录,共663条。其经典使用场景集中于劳动力经济学与性别不平等研究,研究者可借助此数据进行跨国纵向比较,分析亚洲地区收入分配的性别差异演化轨迹。尤为重要的是,该数据集提供了统一的指标定义与元数据标注,使得跨年度、跨国家的时间序列建模成为可能,常被用于构建面板数据回归模型,以控制国家固定效应与时间趋势,从而揭示经济发展水平、劳动政策变迁与性别收入差距之间的复杂关联。
衍生相关工作
围绕该数据集衍生的经典工作主要体现在方法论创新与交叉研究融合两个维度。一方面,基于该数据的时间序列结构,研究人员开发了针对稀疏面板数据的插补算法与缺失值处理策略,从而拓展了不完整劳动统计数据的建模方法论。另一方面,该数据集常与ILOSTAT其它主题数据库(如失业率、非正规就业比重、社会保护覆盖率)进行横向联结,催生了探讨性别工资差距的多维度影响因素分析框架。此外,亦有工作将其与地理空间数据相结合,构建亚洲区域劳动市场工资的热力演化地图,从而在宏观层面上直观揭示性别收入差异的地理分布格局与动态变迁路径。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区按性别分列的雇员每小时收入中位数,为劳动经济学中的性别薪酬差异研究提供了极具价值的纵向数据支撑。在当前全球推动体面劳动与性别平等的宏大背景下,尤其是联合国可持续发展目标8(体面工作和经济增长)与目标5(性别平等)的落实评估中,该数据成为关键量化工具。前沿研究方向集中在对亚洲新兴经济体与转型国家(如印度尼西亚、土耳其、柬埔寨)的性别工资差距时空演变分析,以及利用时间序列模型(如ARIMA、LSTM)预测分性别收入趋势。此外,结合新冠疫情后经济复苏与劳动力市场重构的热点事件,该数据集有助于剖析性别化失业与恢复弹性,为各国政府与国际劳工组织(ILO)制定精准的性别预算与平等薪酬政策提供严谨实证依据,其跨25国、近三十年的覆盖范围显著提升了比较研究的外部效度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务