遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-geo-nb-average-monthly-earnings-of-employees-by-sex-and-r

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲25个国家的2,304个观测值,时间跨度为1996年至2025年,专注于一个指标:按性别和城乡地区划分的员工月平均收入(本地货币),指标代码为EAR_EMTA_SEX_GEO_NB。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API直接提取并过滤为亚洲国家,涵盖了就业、收入等劳动统计信息。数据集包括国家代码、年份、性别分类、观测值等列,并提供了数据质量说明,如年度频率、最佳来源选择等。该数据集由Electric Sheep Asia重新打包,适用于表格分类、回归和时间序列预测等任务。

This dataset comprises 2,304 observations across 25 Asian countries, spanning the period from 1996 to 2025, with a sole focus on the indicator: monthly average employee earnings (in local currency) disaggregated by gender and urban-rural region, with the indicator code EAR_EMTA_SEX_GEO_NB. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), directly retrieved via API and filtered to retain only data from Asian countries, covering labor statistics including employment and earnings. The dataset includes columns such as country code, year, gender category, and observation values, and provides data quality notes including annual frequency and optimal source selection. This dataset was repackaged by Electric Sheep Asia, and is suitable for tasks including tabular classification, regression, and time series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-geo-nb-average-monthly-earnings-of-employees-by-sex-and-r 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,作为全球劳动统计的权威来源,它整合了各国劳动力调查、家庭收入调查及行政记录等多元数据。本数据集通过ILOSTAT REST API直接提取,聚焦亚洲地区,筛选出25个亚洲国家的ISO3国家代码,并针对性地汇聚了关于雇员平均月薪的指标。数据经过ILO基于国际劳工统计学家会议(ICLS)定义的标准进行协调统一,最终收录了2304条观察值,时间跨度从1996年至2025年。
特点
数据集的核心指标为按性别与城乡区域划分的雇员平均月薪(以当地货币计),提供了独特的细分视角。其特点包括覆盖25个亚洲国家,时间序列长达三十年,且数据来源可追溯至具体的调查或行政记录,在`source.label`列中清晰标注。数据结构包含国家、性别、区域类型(如国家级、城乡)、时间及观测值等关键字段,并带有观测状态标志以区分数据的可靠性,为深入研究亚洲劳动力市场薪酬差异提供了宝贵素材。
使用方法
使用者可通过HuggingFace的`datasets`库便捷加载,调用`load_dataset('electricsheepasia/asia-ilo-ear-emta-sex-geo-nb-average-monthly-earnings-of-employees-by-sex-and-r')`即可将数据转换为Pandas DataFrame进行分析。典型应用包括筛选特定国家(如印度尼西亚)的子集进行深度分析,或针对单个指标绘制时间序列图以观察趋势。此外,可轻松构建国家-年份的透视矩阵,便于进行跨国比较与面板数据研究,极大简化了从原始数据到可分析形态的预处理流程。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过ILOSTAT数据库整理发布,并由Electric Sheep Asia团队在HuggingFace平台上进行重新封装与标准化。核心研究问题聚焦于亚洲地区25个国家在1996年至2025年间,按性别与城乡划分的员工平均月收入(以当地货币计)的时空演变规律。作为劳动经济学与区域发展研究的重要数据基础,该数据集为探究亚洲劳动力市场中的性别收入差距、城乡经济分化以及长期就业质量变迁提供了高时间分辨率与地理覆盖度的观测窗口。其影响力体现在对可持续发展目标(SDG)中体面工作指标的量化支撑,以及为跨国比较分析和机器学习模型在工资预测、收入不平等测度等任务上提供了稀缺的、经过协调的亚洲面板数据。
当前挑战
领域层面,该数据集旨在回应劳动经济学中长期存在的两大挑战:一是亚洲发展中国家因统计体系薄弱导致的工资数据缺失与可比性不足,二是性别与城乡维度的收入差异在官方统计中常被聚合而掩盖深层结构性问题。构建过程中面临的主要挑战包括:多来源调查(劳动力调查、行政记录)的元数据冲突与时间序列不连续性,如各国调查方法中‘最佳来源’的选择标准差异导致同一国家不同年份的观测值可能存在断点;原始数据中存在缺省值、标记为‘暂定’或‘不可靠’的观测状态,需要依赖ILO的协调机制进行清洗;此外,数据按年度发布而无法覆盖高频波动(如月度或季度工资变化),限制了其对短期经济冲击影响收入的建模能力。
常用场景
经典使用场景
该数据集聚焦于亚洲地区按性别和城乡划分的雇员平均月薪(以当地货币计),收录了来自25个亚洲国家、跨越1996年至2025年的2304条观测记录。其最经典的使用场景在于开展跨国的收入不平等与劳动力市场分层研究,研究者可借助该数据集对亚洲各国在不同时间截面上的薪资水平进行横向对比,并考察性别工资差异在城乡维度上的空间分布。此外,该数据也常被用于构建时间序列模型,以揭示亚洲劳动力市场中薪资演变的长期趋势。
衍生相关工作
基于该数据集,一系列衍生工作应运而生。在学术层面,有研究者利用此数据构建了亚洲地区的工资收敛面板模型,量化了全球化对不同性别劳动者收入趋同速度的影响。在工程领域,开发者基于该数据训练了面向劳动力市场的时序预测模型,并与ILOSTAT其他指标结合,构建了多模态的亚洲体面劳动评估系统。此外,该数据集还被用于开发可视化的宏观经济仪表盘,以交互式方式呈现亚洲各国薪资水平的动态演化,降低了劳动统计数据的理解门槛。
数据集最近研究
最新研究方向
在劳动经济学与可持续发展目标(SDG)监测的前沿,该数据集聚焦于亚洲地区雇员月均收入在性别与城乡维度上的结构化差异,为验证贝克尔歧视理论在亚洲新兴市场中的应用、评估1996至2025年间经济转型对收入分配的影响提供了高分辨率时间序列证据。结合ILOSTAT的标准化采集框架与2030年议程对体面工作的倡导,研究者可深入剖析印度尼西亚、柬埔寨等国家的城镇化进程与女性劳动力市场参与度之间的联动效应,并对巴基斯坦、蒙古等跨越疫情冲击的经济体展开结构性断点分析。该数据在推动交叉性收入不平等建模、以及基于机器学习的薪酬预测与政策反事实模拟方面,正成为连接宏微观劳动统计与因果推断方法的核心枢纽。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务