electricsheepasia/asia-ilo-ear-emtm-sex-geo-nb-median-monthly-earnings-of-employees-by-sex-and-ru
收藏数据链接:
官方服务:
资源简介:
该数据集包含亚洲25个国家从1996年到2025年的2,304个观测值,涵盖了“按性别和城乡地区划分的员工月收入中位数(本地货币)”这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家,涉及收入主题。数据集包括国家代码、来源、指标、性别分类、年份、观测值等列,用于表格分类、回归和时间序列预测等任务。
This dataset contains 2,304 observations of median monthly earnings of employees by sex and rural/urban areas (local currency) across 25 Asia countries, spanning from 1996 to 2025. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), obtained via API and filtered to Asian countries, focusing on the earnings topic. The dataset includes columns such as country code, source, indicator, sex disaggregation, year, and observed value, and is intended for tasks like tabular classification, regression, and time-series forecasting.
提供机构:
electricsheepasia搜集汇总
数据集介绍

构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接提取指标“EAR_EMTM_SEX_GEO_NB”的原始数据,并依据亚洲地区ISO3国家代码进行筛选与整合。ILOSTAT基于国际劳工统计学家会议(ICLS)定义,对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一协调与标准化处理。数据集中每个观测值均附有来源标签(source.label)以追溯原始调查类型,共汇集25个亚洲国家、覆盖1996年至2025年间的2,304条年度观测记录。
特点
数据集以“按性别和城乡划分的员工月收入中位数(本币)”为核心指标,提供了性别(总、男、女、其他)与地理覆盖(全国、城乡等)的多维分类维度,字段设计完整,包含区域代码、指标标签、观测值、状态标记及注释信息。数据年度频率统一,缺失值处理遵循ILO选取的“最佳来源”原则,确保了跨时间与跨国比较的可靠性。结构化特征使其天然适配于表格分类、回归分析及时间序列预测等任务。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据集,并转换为Pandas DataFrame进行后续分析。典型应用包括按国家筛选子集(如印度尼西亚)、对单一指标进行时间序列可视化,或利用透视表构建国家×年份矩阵以观察跨区域趋势。数据集支持CC-BY-4.0许可协议,使用时需同时引用ILO原始数据源及Electric Sheep Asia的重新封装版本。
背景与挑战
背景概述
在全球劳动经济学研究中,性别与地域维度下的收入差距始终是衡量社会公平与经济发展质量的关键指标。国际劳工组织(ILO)作为这一领域的权威机构,其ILOSTAT数据库持续提供经过国际劳工统计学家会议(ICLS)定义协调的标准化劳动统计数据。该数据集由Electric Sheep Asia于2025年重新整理发布,聚焦亚洲地区,汇集了1996年至2025年间来自25个亚洲国家的2304条观测记录,核心指标为按性别和城乡划分的雇员月收入中位数(以本币计)。这一精细化的时空数据结构,为研究者深入探究亚洲劳动力市场中性别收入鸿沟的演变趋势、城乡二元经济结构对薪酬分配的影响,以及各国劳动政策成效提供了坚实的量化基础,对推动联合国可持续发展目标(SDGs)中体面工作与经济增长的相关研究具有重要价值。
当前挑战
该数据集所应对的领域核心挑战在于,亚洲各国劳动统计体系差异显著,数据采集方法(如劳动力调查、行政记录)和定义标准不一,导致跨国或跨时期的收入比较难以直接进行,且性别维度下的数据缺失与城乡划分口径不同,使得揭示真实收入差距的内在机制充满困难。在数据集构建过程中,面临的主要挑战包括:从ILOSTAT API提取原始数据时需处理多源异构信息的标识与映射;筛选并统一亚洲国家ISO代码时,需应对领土编码变更及数据覆盖率不足等问题;此外,针对同一国家与年份存在多个数据来源的情况,需采用ILO优选源策略以保证数据质量,同时保留溯源标识以供评估,整个过程对数据清洗、质量控制和元数据管理的严谨性要求极高。
常用场景
经典使用场景
该数据集聚焦于亚洲地区雇员按性别与城乡划分的中位月收入(本币计量),是劳动经济学与性别不平等研究中的基础性资源。经典使用场景包括构建时序预测模型,以分析过去三十年(1996-2025年)间亚洲25国收入水平的演变轨迹;亦可用于面板数据回归,探究性别收入差距的时空分化特征。通过将收入指标与性别、城乡、国家及年份等维度相结合,研究者能够系统评估经济发展、政策干预与结构性因素对劳动力市场回报的影响,进而揭示性别与地域双重维度下的收入不平等动态。
实际应用
在实际政策评估与劳动力市场监测中,该数据集扮演着至关重要的工具性角色。国际组织如国际劳工组织、亚洲开发银行及各国劳动部门可借助这些数据,识别收入分配中的弱势群体,监控就业质量指标的年度变化,并评估性别平等政策与乡村振兴举措的实际效能。此外,研究人员可通过构建收入预测模型,为社会保障体系设计、最低工资标准修订以及区域发展计划提供数据支撑,从而推动基于证据的公共决策。
衍生相关工作
基于该数据集,一系列经典学术工作得以衍生。研究者常将其作为基准,比较不同收入计量指标(如平均收入与中位收入)对性别不平等测度的敏感性;或将其与ILO其他劳动统计数据集(如失业率、行业就业结构)进行拼接,构建多维劳动力市场分析框架。部分工作进一步运用分解方法(如Oaxaca-Blinder分解),量化教育水平、职业隔离等可观测因素对性别收入差距的贡献。这些衍生研究推动了劳动经济学方法论的精细化,并丰富了关于亚洲劳动力市场制度变迁的实证证据库。
以上内容由遇见数据集搜集并总结生成



