遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-mts-cur-nb-median-hourly-earnings-of-employees-by-sex-marital

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲25个国家从1996年至2025年期间,员工按性别、婚姻状况和货币分类的每小时收入中位数的统计数据。数据集共有5,946个观测值,涵盖1个核心指标(EAR_EHRM_SEX_MTS_CUR_NB),数据来源于国际劳工组织(ILO)的ILOSTAT数据库。数据集提供了详细的列信息,包括国家代码、国家名称、数据来源、指标代码、指标标签、性别分类(总计、男性、女性等)、婚姻状况分类、货币类型、观测年份、观测数值、数据状态标志以及相关注释。数据经过ILO harmonization处理,使用国际劳工统计学家会议(ICLS)的定义进行标准化,并标注了原始调查数据来源以便追溯。数据集由Electric Sheep Asia重新打包,旨在为亚洲地区提供统一、机器学习就绪的数据层。

This dataset contains 5,946 observations of median hourly earnings of employees by sex, marital status and currency across 25 Asia countries, spanning from 1996 to 2025. It covers one distinct indicator (EAR_EHRM_SEX_MTS_CUR_NB) sourced from the International Labour Organizations (ILO) ILOSTAT database. The dataset includes detailed columns such as country code, country name, data source, indicator code, indicator label, sex disaggregation (total, male, female, etc.), marital status classification, currency type, observation year, observed value, observation status flags, and related notes. The data is harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions and flagged with original survey sources for traceability. Repackaged by Electric Sheep Asia, it aims to provide a unified, ML-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-mts-cur-nb-median-hourly-earnings-of-employees-by-sex-marital 数据集图片
构建方式
该数据集基于国际劳工组织(ILO)的ILOSTAT数据库构建,通过REST API接口直接提取指标编码为EAR_EHRM_SEX_MTS_CUR_NB的原始数据。数据获取后,依据亚洲ISO3国家代码进行地理范围过滤,仅保留25个亚洲经济体的观测值。ILOSTAT本身遵循国际劳工统计学家会议(ICLS)的定义,对各国劳动力调查、家庭收入调查、企业调查及行政记录等原始微观数据进行统一协调与标准化处理。数据集中每一条观测均附带来源标识(source.label),便于用户追溯数据出处与统计口径。整个流程由Electric Sheep Asia平台完成数据重封装与发布,确保数据以高效、一致的格式呈现。
特点
该数据集的核心特征在于其专注于亚洲地区员工时薪中位数的精细分组统计,涵盖1996年至2025年间25个国家的5,946条观测。其独特之处在于多维度的分类结构:不仅按性别(男性、女性、总计、其他)进行分解,还引入了婚姻状况(如总计聚合)和货币类型(如本币)作为交叉分类变量,从而支持更深入的劳动力市场差异分析。数据还包含了观测状态标识(如序列中断)、来源注释等元信息字段,增强了数据的可追溯性与质量控制透明度。此外,该数据集以年度频率发布,并采用ILO精选的“最佳来源”策略处理同一国家年份的多来源冲突,确保数据权威性。
使用方法
该数据集以Hugging Face Datasets格式发布,用户可通过一行Python代码加载整个数据集:`load_dataset('electricsheepasia/asia-ilo-ear-ehrm-sex-mts-cur-nb-median-hourly-earnings-of-employees-by-sex-marital')`,并轻松转换为Pandas DataFrame进行数据分析。典型的使用场景包括按国家过滤进行时间序列分析,例如提取印度尼西亚的子集;或针对特定指标(如时薪中位数)按年份排序并绘制趋势图;亦可通过透视表构建国家×年份的矩阵,便于跨区域比较。数据集中包含的ref_area、sex、classif1等离散维度字段,为分组聚合、统计建模或机器学习任务(如表格分类或回归)提供了标准化的特征输入。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)旗下ILOSTAT数据库于2025年整理发布,经Electric Sheep Asia重新封装至HuggingFace平台,聚焦亚洲25个国家1996至2025年间按性别和婚姻状况分列的雇员小时工资中位数。ILOSTAT作为全球劳动统计的权威来源,长期整合各国劳动力调查、家庭收入调查及行政记录数据,其核心研究问题在于揭示亚洲经济体内部工资结构的性别与婚姻差异,为劳动经济学、性别平等及可持续发展目标(SDG)中的体面工作指标提供量化基础。数据集涵盖5946条观测,覆盖菲律宾、印尼、土耳其等国,凭借ILO的标准化方法(ICLS定义)与多维度分类(性别、婚姻状况、货币类型),在区域劳动市场比较分析、工资差距量化及政策评估领域具有重要影响力。
当前挑战
该数据集面临的核心挑战涉及多重维度。在领域问题层面,亚洲各国劳动力市场存在显著的结构性差异,包括非正规就业比例高、调查方法不统一(如部分国家采用劳动力调查,另一些依赖行政记录),导致不同国家间的工资中位数可比性受质疑;此外,婚姻状况对工资的影响往往与教育、职业、地域等混杂因素交织,单纯基于性别的工资差距分析难以剥离出净效应。在构建过程中,ILOSTAT需从200多个经济体收集并协调来源与定义不一的原始数据,处理时间序列中断(如标志“Break in series”)、货币单位转换(本地货币与标准化币种间的波动)以及缺失值问题;同时,数据集仅包含年度频率信息,缺乏季度或月度高频数据,限制了短期动态分析的能力,且部分国家观测年份稀疏(如亚美尼亚仅至2017年),影响长期趋势推断的稳健性。
常用场景
经典使用场景
该数据集收录了1996年至2025年间亚洲25个国家雇员的小时工资中位数,并按照性别、婚姻状况及货币类型进行精细化分层,共计5,946条观测记录。在劳动经济学与统计推断领域,研究者常将其作为基准数据,用于构建收入分布模型、解析性别工资差距的时空演变趋势,以及评估婚姻状态对劳动力市场回报的调节效应。通过引入国际劳工组织ILOSTAT的标准化统计口径,该数据集为跨国的工资比较与面板数据分析提供了可靠的时间序列基础,尤其适用于探究亚洲新兴经济体中结构性劳动市场调整的长期动态。
衍生相关工作
围绕这一数据集,学术界已衍生出若干具有影响力的相关研究工作。一方面,它被用作ILOSTAT全球工资报告的分支数据源,支撑了多篇针对亚洲特定区域性别工资差距分解的实证论文;另一方面,该数据启发了基于分层贝叶斯模型与序列对比学习的方法论研究,旨在从未均衡的跨国观测中推断隐性工资结构。此外,有团队基于此数据构建了面向劳动力市场的因果推断基准,用于测试领域泛化下的Treatment Effect估计器。数据本身的高质量标注与规范化设计,也促进了ILO与Electric Sheep Asia合作推出的标准化劳动统计开源仓库,推动亚洲劳动数据生态的开放透明化。
数据集最近研究
最新研究方向
基于ILOSTAT权威数据的亚洲雇员时薪中位数数据集,正成为劳动经济学与性别平等研究的前沿基石。该数据集覆盖25个亚洲经济体长达三十年的观测,通过性别、婚姻状态及货币类型的精细分层,为破解亚洲劳动力市场的薪酬结构谜题提供了不可多得的数据支撑。当前,学者们正利用这一资源深入探究新冠疫情冲击下亚洲非正规就业者的收入韧性、婚姻溢价在不同性别间的异质性表现,以及货币波动对实际购买力平价的微妙影响。其意义在于,通过整合跨国长时序微观数据,推动了从描述性统计向因果推断的范式跃迁,为国际劳工组织倡导的体面劳动与可持续发展目标(SDG 8)提供了可量化的实证锚点,助力政策制定者精准识别脆弱群体并设计更具包容性的薪酬干预策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务