遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-edu-nb-median-hourly-earnings-of-employees-by-sex-and-edu

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲地区员工按性别和教育划分的每小时中位数收入(以当地货币计)的统计数据,由国际劳工组织(ILO)的ILOSTAT数据库提供。数据集涵盖25个亚洲国家,时间跨度为1996年至2025年,共包含8,088个观测值,涉及一个核心指标:EAR_EHRM_SEX_EDU_NB(按性别和教育划分的员工每小时中位数收入)。数据通过ILOSTAT REST API获取,并经过标准化处理,使用ICLS(国际劳工统计学家会议)定义。数据集包括国家代码、来源信息、指标代码、性别分类(总计、男性、女性等)、教育分类、观测年份、观测值及其状态标志等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains statistics on the median hourly earnings of employees by sex and education in local currency for Asia, sourced from the ILOSTAT database of the International Labour Organization (ILO). It covers 25 Asian countries from 1996 to 2025, with 8,088 observations and one core indicator: EAR_EHRM_SEX_EDU_NB (Median hourly earnings of employees by sex and education). Data is retrieved via the ILOSTAT REST API and harmonized using ICLS (International Conference of Labour Statisticians) definitions. The dataset includes columns such as country code, source information, indicator code, sex classification (total, male, female, etc.), education classification, observation year, observed value, and status flags, making it suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-edu-nb-median-hourly-earnings-of-employees-by-sex-and-edu 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API接口直接获取原始指标数据,并依据亚洲ISO3国家代码进行地理筛选。数据采集自各国劳动力调查、家庭收入调查、机构调查及行政记录,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行标准化处理。在构建过程中,数据集保留了源数据的可追溯性标记(source.label列),并采用年度频率记录,确保与ILO官方数据源的一致性。最终形成包含25个亚洲国家、覆盖1996至2025年的8,088条观测记录。
特点
该数据集聚焦于亚洲地区雇员按性别和教育程度划分的时薪中位数(本地货币),提供单一核心指标但具备丰富的多维细分能力。数据维度涵盖性别(男、女、总计及其他)与教育水平(聚合等级),且每条记录附有详细的观测状态、分类注释及数据来源说明,便于进行细粒度分析。地域覆盖广泛,包含印度尼西亚、柬埔寨、越南等25个亚洲经济体,时间跨度长达30年,为研究亚洲劳动力市场薪酬不平等、性别薪资差距及教育回报率等议题提供了稀缺的跨国面板数据资源。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载数据集,并将其转换为Pandas DataFrame进行后续分析。典型应用包括:按国家筛选子集进行国别分析,例如使用df[df['ref_area'] == 'IDN']获取印度尼西亚数据;按时间序列排序后绘制单一指标的变化趋势图;利用pivot_table方法将数据重塑为国家×年份的矩阵形式,便于进行跨国比较。数据集中的性别与教育分类变量支持分组统计,可应用于回归建模或时间序列预测等机器学习任务。
背景与挑战
背景概述
在全球劳动力市场研究中,薪酬数据的性别与教育维度异质性长期被视为评估社会公平与发展成效的关键指标。由国际劳工组织统计司构建的ILOSTAT数据库,汇集了200余个经济体的劳动力调查数据,为跨境比较提供了权威基础。在此背景下,Electric Sheep Asia团队于2025年对ILOSTAT中亚洲地区的薪酬数据进行了系统化重组,构建了涵盖25个亚洲国家、跨越1996至2025年、共计8088条观测值的专题数据集,聚焦于按性别与教育程度划分的雇员小时薪酬中位数(本币计值)。该数据集以标准化的表格格式呈现,整合了劳动调查来源代码、观测状态标识及多级分类注释,旨在为区域劳动力不平等研究、薪酬预测模型及可持续发展目标监测提供高质量、机器可读的数据支撑。
当前挑战
该数据集所应对的领域核心挑战在于亚洲劳动力市场中薪酬差异的多维复杂性与统计可比性缺失。具体而言,不同国家间劳动调查的定义口径、教育分类体系及数据采集频率存在显著异质性,传统单一来源数据难以支持跨国的性别薪酬差距分析和教育回报率建模。在构建过程中,团队面临的主要挑战包括:需处理ILOSTAT原始API中因调查方法变更导致的序列断点标记,如'Break in series'状态标志的甄别与处理;面对多来源冲突时需依据ILO'最佳来源'选择逻辑进行融合,同时保持来源溯源字段的透明性;此外,非标准教育等级的注释字段需要人工解析与标准化,以确保性别与教育交叉分类的粒度一致性。这些挑战充分体现了在亚洲劳动力数据这种高异质场景中,构建一个洁净、可复现的统计数据集所需的严谨工程化努力。
常用场景
经典使用场景
在劳动经济学与发展经济学研究领域,该数据集凭借其横跨25个亚洲国家、覆盖近三十年(1996–2025年)的长时间序列特征,成为分析亚洲劳动力市场薪酬动态的经典基石。研究者通常利用其提供的按性别与教育程度划分的员工中位数小时收入数据,构建面板数据模型,以比较不同亚洲经济体的工资水平演变趋势,或探究教育回报率与性别工资差异在区域间的异质性表现。
实际应用
在实际应用层面,该数据集是国际组织、国家统计局及政策研究机构进行区域劳动力市场评估与薪酬政策制定的宝贵工具。例如,发展机构可借助该数据追踪亚洲各国在联合国可持续发展目标(SDG)框架下关于体面工作与经济增长目标的实现进程,识别出教育投入与薪酬回报之间的关联缺口。政府与工会也能据此开展跨国基准比较,为调整最低工资标准、制定产业技能培训计划或设计反性别歧视的薪酬法规提供实证依据。
衍生相关工作
基于这一权威数据源,学界已衍生出若干具有影响力的研究脉络。众多研究利用ILOSTAT的薪酬数据序列,构建了亚洲各国的工资弹性模型,评估国际贸易与外商直接投资对本地劳动力报酬的溢出效应。另有工作聚焦于数据清洗与插值方法,以补全天数较短的观测点,生成更加平滑的年度薪酬面板,用于收入不平等分解研究。该数据集的高结构化特征也促进了与其它经济指标(如GDP、失业率)的联合分析,催生了探讨教育—就业—薪酬联动机制的多维度计量工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务