遇见数据集

electricsheepasia/asia-ilo-ear-emtm-sex-geo-cur-nb-median-monthly-earnings-of-employees-by-sex-rural

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲25个国家从1996年至2025年的员工月收入中位数统计数据,重点关注按性别、农村/城市地区和货币划分的收入情况。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,包含6,585个观察值,涉及一个核心指标:EAR_EMTM_SEX_GEO_CUR_NB(按性别、农村/城市地区和货币划分的员工月收入中位数)。数据集提供了结构化表格,列包括国家代码、指标、性别分类、时间年份、观测值等,支持表格分类、回归和时间序列预测任务。数据经过ILO的标准化处理,覆盖印度尼西亚、塞浦路斯、柬埔寨等国家,并包含数据来源和质量说明。

This dataset contains median monthly earnings statistics for employees across 25 Asian countries from 1996 to 2025, focusing on earnings disaggregated by sex, rural/urban areas, and currency. Sourced from the International Labour Organization (ILO)s ILOSTAT database, it includes 6,585 observations and one key indicator: EAR_EMTM_SEX_GEO_CUR_NB (Median monthly earnings of employees by sex, rural / urban areas and currency). The dataset is structured in tabular format with columns such as country code, indicator, sex classification, time year, observed value, etc., supporting tasks like tabular classification, regression, and time-series forecasting. Data is harmonized by ILO, covering countries like Indonesia, Cyprus, Cambodia, and includes source and quality annotations.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emtm-sex-geo-cur-nb-median-monthly-earnings-of-employees-by-sex-rural 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接抽取指标代码为EAR_EMTM_SEX_GEO_CUR_NB的原始数据,并依据ISO 3166-1 alpha-3标准筛选出亚洲25个国家的观测记录。数据经过ILOSTAT的标准化处理,采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调,并在source.label字段中标注数据来源,如劳动力调查或行政记录,以确保数据的可追溯性与一致性。最终由Electric Sheep Asia团队重新封装为HuggingFace数据集,格式为高效的Parquet文件。
特点
数据集包含6,585条观测记录,覆盖1996年至2025年的时间跨度,聚焦于亚洲地区雇员按性别、城乡区域及货币计价的中位数月收入指标。其核心特色在于多维度分类变量,包括性别(总体、男性、女性)及地域覆盖类型(全国、城乡等),并提供了丰富的元数据列,如来源标识、货币类型和观测状态标志。数据均为年度频率,且采用了ILO选取的‘最佳来源’策略以保障质量。
使用方法
用户可通过HuggingFace的datasets库快速加载数据集,运行load_dataset()命令即可将其转换为Pandas DataFrame进行后续分析。典型应用包括按国家筛选子集、对单一指标进行时间序列可视化,以及通过pivot_table构建国家×年份的面板数据矩阵。该数据集适用于社会科学中的收入不平等研究、劳动力市场监测及跨国比较分析,配合其标注清晰的分类变量,可灵活支持回归建模或聚类分析等任务。
背景与挑战
背景概述
在全球劳动经济学研究中,工资收入数据的可获得性与可比性长期困扰着学术界与政策制定者。国际劳工组织(ILO)作为全球劳动统计的权威机构,其下设的ILOSTAT数据库自2010年代起便致力于整合各国劳动力调查数据,为跨区域劳动经济分析奠定基础。在此背景下,Electric Sheep Asia于2025年基于ILOSTAT API构建了该数据集,聚焦亚洲25个国家1996至2025年间按性别、城乡区域及货币划分的雇员月收入中位数,共计6585条观测值。该数据集以标准化的表格形式呈现,融合了多维度分类变量,为研究者探究亚洲劳动市场的性别工资差异、城乡收入鸿沟及货币效应提供了珍贵的时序数据支撑,对发展经济学、劳动经济学及区域不平等研究具有显著推动价值。
当前挑战
该数据集所应对的核心领域挑战在于,亚洲各国劳动收入数据的采集口径、调查方法及货币单位高度异质,导致跨国比较与纵向趋势分析面临系统性偏差。具体而言,各国采用的劳动力调查类型(如家庭调查与机构调查)不同,且ILOSTAT虽进行标准化处理,但数据源标志列中仍保留了原始调查标识,要求用户具备专业的统计调校能力。构建过程中的挑战则更为复杂:首先,ILO的API接口频繁更新,需持续维护数据抓取管线以确保时序连续性;其次,不同国家同一指标存在多源数据竞争,需依据ILO“最佳来源”规则进行筛选,该规则缺乏透明性;再者,缺失值模式在不同性别、城乡分类间分布不均,可能引入样本选择偏误;最后,亚洲货币单位多样,本地货币与统一货币的转换策略未在数据集中预置,增加了建模前的预处理复杂度。
常用场景
经典使用场景
该数据集的核心价值在于为亚洲地区劳动经济学与性别平等研究提供了标准化的面板数据支撑。经典使用场景聚焦于跨国家、跨时间维度的薪资差异分析,研究人员可利用其丰富的分类维度——性别、城乡地域与货币单位——构建固定效应或随机效应模型,系统考察各国中位月薪的演变规律。同时,数据集时序跨度达三十年,使其成为时间序列预测任务的理想基石,能够支撑基于ARIMA或深度学习模型的薪资走势推断,为宏观劳动政策制定提供数据锚点。
解决学术问题
在学术层面,该数据集直击亚洲发展中经济体劳动市场数据碎片化与不可比性的痛点。它解决了两个核心问题:其一,通过ILOSTAT统一标准,使研究人员得以在25个国家间进行跨国工资水平横向比较,消除因调查口径差异导致的测量误差;其二,按性别与城乡分类的记录方式,为量化劳动力市场中的性别薪资鸿沟、识别农村与城市收入分化提供了稀缺的高质量长时序面板。这一基础性资源极大地降低了区域劳动经济学研究的准入门槛,推动了关于全球化、产业结构变迁与收入分配公平性的实证探索。
衍生相关工作
围绕该数据集,已涌现出一系列衍生研究工作,推动了方法论与应用场景的创新。基于其长时序面板结构,研究者开发了适用于稀疏跨领域数据的贝叶斯分层预测模型,提升了欠发达地区薪资估算的稳健性。同时,该数据催生了多篇聚焦亚洲新兴经济体的性别工资差距分解研究,通过Oaxaca-Blinder方法量化了禀赋效应与歧视效应的相对贡献。此外,其时间序列特征被成功整合至宏观经济先行指标构建中,衍生出融合劳动收入与城镇化进程的综合景气指数,为后续NLP与混合模型的区域经济预警系统提供了基准验证集。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务