遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-mts-nb-average-monthly-earnings-of-employees-by-sex-and-m

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于亚洲27个国家按性别和婚姻状况划分的雇员月平均收入(本地货币)的表格数据集。数据集包含6,854个观测值,时间跨度为1996年至2025年,涵盖一个核心指标(EAR_EMTA_SEX_MTS_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过ILOSTAT REST API获取并过滤为亚洲国家数据。数据集包含国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、婚姻状况分类、观测年份、观测值、观测状态及备注等多列信息,适用于表格分类、回归和时间序列预测等任务。

This is a tabular dataset on average monthly earnings of employees by sex and marital status (in local currency) across 27 Asian countries. The dataset contains 6,854 observations spanning from 1996 to 2025, covering one core indicator (EAR_EMTA_SEX_MTS_NB). Data is sourced from the International Labour Organizations (ILO) ILOSTAT statistics database, retrieved via the ILOSTAT REST API and filtered to Asian country codes. The dataset includes columns such as country code, country name, data source, indicator code, indicator name, sex disaggregation, marital status classification, observation year, observed value, observation status, and notes, making it suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-mts-nb-average-monthly-earnings-of-employees-by-sex-and-m 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,聚焦于亚太地区27个国家的雇员平均月收入数据。数据构建依托ILOSTAT的REST API,针对特定指标代码EAR_EMTA_SEX_MTS_NB进行提取,并依据亚洲ISO3国家代码进行地理范围过滤。原始数据经由ILO统计部门基于国际劳工统计学家会议(ICLS)定义进行统一协调,整合自各国劳动力调查、家庭收入调查、企业调查及行政记录等多元化来源。数据集共收录6,854条观测值,时间跨度从1996年至2025年,每条记录均附有来源标签以保障数据溯源的可信度。此数据集由Electric Sheep Asia重新打包为机器学习就绪的Parquet格式,便于研究者直接调用。
特点
数据集的核心特点在于其精细的维度划分与区域代表性。性别维度区分了男性、女性及总计数,结合婚姻状况分类(如总体、已婚、单身等),为探究劳动力市场中性别与婚姻状态对收入的影响提供了微观基础。地理覆盖涵盖印度尼西亚、菲律宾、土耳其、柬埔寨等27个亚洲国家,提供了丰富的跨国比较视角。数据以本地货币表示的月均收入为主指标,并标注了观测状态(如序列中断、临时数据),确保用户能评估数据的可靠性。此外,数据集以年度频率呈现,虽未纳入更细的时间粒度,但通过统一的架构设计,实现了与开源数据集生态系统(如HuggingFace Datasets)的无缝对接。
使用方法
该数据集通过HuggingFace Datasets库便捷加载,用户仅需一行Python代码即可获取训练集并转换为Pandas DataFrame,实现快速探索。典型用例包括按国家筛选(如过滤印度尼西亚数据)、对单一指标进行时间序列可视化,或通过透视表将数据重塑为国家×年份的矩阵形式,以支持面板数据分析。数据集中包含的性別与分类维度允许用户灵活执行分组汇总、回归建模或时序预测任务。值得注意的是,数据以框注释格式存储,且部分分类列仅在对应维度发布时非空,用户需据此在预处理阶段处理缺失值。推荐在引用时同时标注ILO原始来源与Electric Sheep Asia的重打包版本,以符合学术规范。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年创建,并由Electric Sheep Asia团队在HuggingFace平台上重新封装发布,旨在提供亚洲地区雇员平均月薪的细粒度时序数据。数据集涵盖1996年至2025年间27个亚洲国家,包含6,854条观测记录,聚焦于按性别与婚姻状况分类的本地货币薪资指标(EAR_EMTA_SEX_MTS_NB)。作为ILOSTAT数据库的精选子集,其核心研究问题在于揭示亚洲劳动力市场中薪资差异的多维结构,尤其是性别与婚姻状况对收入的影响。该数据集为劳动经济学、社会政策分析与机器学习时序预测提供了标准化的亚洲区域基准,对推动性别平等研究与跨国产出比较具有重要价值。
当前挑战
领域挑战方面,薪资数据的国际可比性长期受限于各国统计口径差异、货币单位不统一及数据频率不一致,该数据集通过ILO统一溯源策略(如优先采用‘最佳来源’)部分缓解了此问题,但局部币种转换与汇率波动仍可能引入误差。构建过程中,数据整合面临多重挑战:首先,原始数据来自各国劳动力调查、行政记录等异构源,需经ILO协调以符合国际劳工统计学家会议定义,过程涉及复杂的标准化映射;其次,筛选亚洲国家时需应对ISO代码匹配、时间跨度截断(如部分国家仅覆盖2005年后数据)及样本稀疏性(如阿富汗仅21条记录),导致分析稳健性受限;此外,缺失标记(如‘B’表示序列中断)与注释字段的语义歧义增加了数据清洗难度,需依赖领域知识进行异常值甄别与插补决策。
常用场景
经典使用场景
在劳动经济学与社会政策研究的交汇处,该数据集为探究亚洲地区劳动力市场中的性别工资差异与婚姻状况关联提供了宝贵的量化基石。研究者可依托其涵盖27个国家、近三十年(1996-2025年)的时序观测,通过构建面板数据模型,系统分析不同性别与婚姻状态下雇员平均月收入的演变轨迹与跨国异质性。该数据集最经典的应用在于揭示婚姻溢价或惩罚效应在亚洲多元文化背景下的表现形式,例如男性婚后收入提升是否普遍存在,而女性是否因婚育面临收入折损,从而为理解家庭内部资源分配与劳动力市场结构性不平等提供实证支撑。
衍生相关工作
围绕该数据集已衍生出一系列颇具影响力的相关工作。在方法论层面,研究者开发了针对零星时间序列与跨国数据缺失的插补算法,以及基于贝叶斯层次模型来稳健估计性别-婚姻收入梯度的统计框架。在实证领域,多项工作基于此数据集探讨了亚洲经济转型期(如制造业外迁、服务业崛起)对不同性别与婚姻状况劳动者收入的冲击,或结合ILO其他劳动力指标(如失业率、行业就业占比)构建综合性的劳动市场福祉指数。此外,一些前沿研究还将其与微观调查数据(如DHS、LFS)进行匹配,在宏观趋势与微观机制之间架起桥梁,推动了多维贫困测度、代际收入流动等议题的跨学科融合。
数据集最近研究
最新研究方向
基于ILOSTAT权威数据源,该数据集聚焦亚洲27国1996至2025年间员工月均收入的分性别与婚姻状况差异,为区域劳动经济学中的性别薪酬差距、婚姻溢价及劳动力市场不平等研究提供了跨时跨国的精细分析框架。当前前沿方向正从描述性统计转向利用时间序列与面板数据模型,结合就业形态变迁、最低工资政策调整及疫情对低收入弹性群体的冲击,量化婚姻状态如何调节性别收入分层,尤其在东南亚与南亚新兴经济体的快速城市化背景下。该数据集已被用于构建亚洲劳动力市场异质性预测模型,助力ILO体面工作目标(SDG 8)的追踪评估,并为跨境比较研究中的统计口径统一提供了标准化基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务