遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-age-nb-average-hourly-earnings-of-employees-by-sex-and-ag

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含5,270个观测值,涉及25个亚洲国家从1996年到2025年的员工平均每小时收入数据(以本地货币计),覆盖1个独特指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动统计的主要来源。数据集包含指标EAR_EHRA_SEX_AGE_NB,即按性别和年龄划分的员工平均每小时收入(本地货币)。数据列包括国家代码、国家名称、来源、指标代码、指标名称、性别分类、年龄分类、观测年份、观测值等,并提供了数据质量注意事项,如数据为年度频率,使用最佳来源等。数据集由Electric Sheep Asia重新打包,旨在为亚洲提供统一的、机器学习就绪的数据层。

This dataset contains 5,270 observations of average hourly earnings data for employees across 25 Asia countries, spanning from 1996 to 2025, covering 1 distinct indicator. The data is sourced from ILOSTAT, the International Labour Organizations central statistics database, which is a leading global source for labour statistics. The dataset includes the indicator EAR_EHRA_SEX_AGE_NB, which represents average hourly earnings of employees by sex and age in local currency. The columns include country codes, country names, sources, indicator codes, indicator labels, sex classifications, age classifications, observation years, observed values, and more, with data quality caveats such as annual frequency and use of best sources. The dataset is repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-age-nb-average-hourly-earnings-of-employees-by-sex-and-ag 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接提取核心指标EAR_EHRA_SEX_AGE_NB的原始数据,并经Electric Sheep Asia团队进行二次封装与区域筛选。构建过程中,首先基于ISO 3166-1 alpha-3国家代码,精准锁定亚洲地区的25个经济体,确保地域聚焦的准确性。随后,依据国际劳工统计学家会议(ICLS)定义的统一标准,对各国劳动力调查、家庭收入调查等来源的微观数据进行规范化整合与标注,并在source.label列中保留数据溯源信息。最终整合为包含5,270条观测值、覆盖1996年至2025年时间跨度的结构化表格数据集,以Parquet格式打包发布,旨在为亚洲劳动经济学研究提供标准化的机器可读数据基础。
特点
该数据集的核心特征在于其高度结构化且多维度的指标设计,以雇员平均小时收入(本地货币)为核心观测变量,同时纳入性别(SEX_T/M/F/O)和年龄段(如Youth/Adults)两个关键分类维度,支持精细化的分群分析。数据跨越近三十年,覆盖亚洲25个发展中国家与新兴经济体,观测值超过五千条,具备良好的时空广度。每个观测值均包含丰富的元数据列,如观测状态标志(obs_status)、数据来源标签、货币单位注释等,便于用户评估数据质量与进行来源追溯。数据集还遵循CC-BY-4.0许可协议,兼具开放性与合规性,为跨国比较、面板数据建模及时间序列预测等任务提供了可靠且易于整合的数据资产。
使用方法
该数据集专为机器学习工作流而设计,支持通过HuggingFace Datasets库以一行代码`load_dataset()`直接加载,并自动转换为Pandas DataFrame,极大简化了数据读取流程。用户可基于ref_area列按国家进行高效筛选,例如提取印度尼西亚子集进行国别分析;亦可利用indicator列锁定核心指标,结合time与obs_value列构建时间序列,并通过可视化或统计模型进行趋势挖掘与预测。此外,数据集的多维分类特性使其适用于表格分类与回归任务,用户可通过pivot_table操作将数据重塑为国家×年份的面板矩阵,便于直接接入计量经济学软件或深度学习框架。总体而言,从快速探索到复杂建模,该数据集均提供了低门槛、高灵活性的使用路径。
背景与挑战
背景概述
在劳动经济学与社会政策研究领域,性别与年龄维度的工资差异始终是评估劳动力市场公平性与发展质量的核心指标。由国际劳工组织(ILO)统计部门创建并维护的ILOSTAT数据库,作为全球劳动统计的权威来源,长期为各国提供经国际劳工统计学家会议(ICLS)标准协调后的微观调查数据。Asia-ILO-EAR-EHRA-SEX-AGE-NB数据集由Electric Sheep Asia于2025年重新打包发布,聚焦亚洲地区,汇集了1996年至2025年间来自25个亚洲国家的5270条观测值,涵盖雇员按性别与年龄划分的平均小时工资(以本币计)。该数据集填补了亚洲区域细粒度工资数据的可获取性空白,为研究性别工资差距、年龄工资剖面以及区域劳动力市场动态提供了结构化、机器可读的标准化数据基础,对推动亚洲发展经济学和计量劳动研究的实证分析具有显著价值。
当前挑战
该数据集所应对的核心领域挑战在于,亚洲多数国家长期缺乏跨年份、跨国别且按性别与年龄维度细分的统一工资统计,导致区域比较分析和面板数据构建困难。具体而言,领域面临的挑战包括:不同国家调查方法与统计口径各异,要求数据集提供经ILO协调的标准化指标以消除定义偏差;工资数据常附带缺失、中断或临时性标记(如obs_status字段),需研究者审慎处理序列连续性;以及数据仅提供年度频率,部分国家观测起始年份较晚或存在间断,限制了长周期时序模型的适用性。在构建过程中,主要挑战包括:从ILOSTAT REST API提取亚洲国家数据时需精确筛选ISO3国别代码并应对不同来源的数据质量标签;需处理性别分类(SEX_T、SEX_M、SEX_F)与年龄分组(如classif1字段中的青年/成人分类)的多维交叉结构,保持模式一致性;此外,因数据依赖各国劳动调查的可得性与时效性,部分国家观测数量悬殊(如印度尼西亚672行与孟加拉国122行),如何在不引入偏倚的前提下整合面板数据是实际难点。
常用场景
经典使用场景
该数据集基于国际劳工组织ILOSTAT数据库,汇集了25个亚洲国家自1996年至2025年期间,按性别与年龄分层的雇员平均时薪观测数据,共计5,270条记录。其经典使用场景主要集中于劳动力经济学中的薪酬差异分析与时间序列建模,研究者可借助该数据集描绘亚洲地区劳动力市场中不同性别、不同年龄段劳动者的薪酬分布特征,并追踪其长期演变趋势。作为横跨近三十年、涵盖多元经济发展阶段国家的结构化面板数据,它特别适用于构建面板数据回归模型,探究经济增长、产业结构变迁与劳动报酬之间的动态关联。
实际应用
在实际应用层面,该数据集为国际组织、政府劳动部门及研究机构提供了可靠的劳动力市场监测工具。政策制定者可以依据不同国家的性别与年龄薪酬数据,评估现有劳动法规与平等就业政策的实施效果,识别薪酬歧视的高发人群,从而制定更具针对性的最低工资调整、就业促进与性别平等干预措施。跨国企业与社会责任组织亦可借助该数据集进行区域性薪酬对标分析,优化薪酬体系的公平性设计。对于金融与保险行业,这些长时间序列的薪酬数据可用于构建宏观经济风险模型,预测消费能力变化对社会保险基金可持续性的潜在影响。
衍生相关工作
基于此数据集的衍生工作主要集中在薪酬差距分解方法的创新与亚洲劳动力市场比较研究的深化。研究者常结合Oaxaca-Blinder分解法,利用该数据将性别薪酬差异划分为禀赋效应与歧视效应两部分,进而识别各国劳动力市场中不可解释部分的变化趋势,催生了一系列关于亚洲性别工资差异决定因素的实证文献。此外,部分经典工作从时间序列分析角度出发,运用协整检验与误差修正模型,探究亚洲各国薪酬水平与劳动生产率、通货膨胀等宏观经济变量之间的长期均衡关系。该数据集还推动了机器学习方法在劳动经济预测中的应用,例如利用梯度提升树或长短期记忆网络对特定国家与群体的未来平均时薪进行预测,为劳动经济学研究与公共政策评价提供了新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务