遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-ind-nb-average-monthly-earnings-of-employees-by-ilo-secto

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲23个国家从2005年至2025年的员工平均月收入数据,按国际劳工组织(ILO)部门和性别(总计、男性、女性等)分类,使用本地货币单位。数据集共有12,386个观测值,覆盖1个核心指标(EAR_EMTA_SEX_IND_NB),数据来源于ILO的ILOSTAT数据库,通过调查和行政记录收集,并经过ICLS定义标准化。数据以表格形式呈现,包括国家代码、年份、性别分类、观测值及其状态等列,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Asia重新打包,旨在为亚洲地区提供机器学习就绪的数据层。

This dataset contains average monthly earnings data for employees across 23 Asian countries, spanning the period from 2005 to 2025. The data is classified by International Labour Organization (ILO) sectors and gender categories (total, male, female, etc.), and denominated in local currency units. It includes a total of 12,386 observations and encompasses a single core indicator (EAR_EMTA_SEX_IND_NB). The data is sourced from the ILO's ILOSTAT database, collected via surveys and administrative records, and standardized in accordance with the definitions of ICLS. Presented in tabular format, the dataset features columns such as country code, year, gender category, observation value and its corresponding status. It is suitable for tasks including tabular classification, regression and time series forecasting. This dataset was repackaged by Electric Sheep Asia, with the objective of providing a machine learning-ready data layer for the Asian region.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-ind-nb-average-monthly-earnings-of-employees-by-ilo-secto 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接获取EAR_EMTA_SEX_IND_NB指标数据,并依据ISO 3166-1 alpha-3标准筛选出23个亚洲国家的观测记录。原始数据基于各国劳动力调查、家庭收支调查及行政记录等多元来源,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调与质量标注,确保跨国的可比性。Electric Sheep Asia对原始数据进行二次封装,以Parquet格式存储,并附有规范的元数据描述,便于研究者高效加载使用。
特点
本数据集囊括了2005年至2025年间23个亚洲国家的平均月收入观测值,总计12,386条记录,聚焦于按ILO部门和性别分层的员工收入指标。其核心特点在于细致的分类维度,包括性别(总、男、女)及行业部门等分组变量,且数据来源在source.label列中清晰标注,保证了数据的可追溯性。数据集覆盖范围广泛,从土耳其、越南到印度尼西亚等国,提供了丰富的时间序列跨度,为区域劳动力市场分析、收入不平等研究及跨国比较提供了坚实的数据基础。
使用方法
研究者可通过HuggingFace Datasets库中提供的load_dataset()函数直接加载该数据集,并轻松将其转换为Pandas DataFrame进行后续分析。例如,可利用条件筛选快速提取特定国家的观测值,或按指标代码过滤出原始平均月收入数据,再按年份排序以绘制时间序列趋势图。此外,通过pivot_table方法可将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析或可视化展示。数据集注释中包含了规范的引用格式,供学术使用时注明原始来源与封装方信息。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)在2025年通过其核心统计数据库ILOSTAT整理发布,并经Electric Sheep Asia重新打包,聚焦于亚洲23个国家2005至2025年间雇员按ILO行业和性别划分的平均月收入(以本币计)。在劳动经济学与可持续发展目标(SDG)监测领域,准确的收入数据是衡量体面劳动、性别工资差异以及区域经济失衡的关键指标。该数据集合涵盖12,386条观测值,为亚洲劳动市场的时间序列分析、面板数据建模及收入预测提供了统一、标准化的资源,显著推动了亚太地区劳动统计研究的可复现性与比较分析能力。
当前挑战
该数据集面临的领域挑战在于,亚洲各国劳动市场结构差异悬殊,非正规经济、农业季节性就业与零工经济盛行,导致ILO采用的国际劳动统计学家会议(ICLS)定义在局部场景下与各国实际统计口径存在偏差,影响收入指标的可比性与模型泛化能力。构建过程中的挑战则源自数据异构性:原始数据来自各国劳动力调查、住户收入调查及行政记录等多元来源,存在观测值标记为“不可靠”(如obs_status为U)的情况;此外,部分国家的时间序列稀疏,且披露维度(如性别)存在缺失,为多源数据融合与时间序列插补引入了显著的技术障碍。
常用场景
经典使用场景
在全球劳动经济学研究领域,追踪不同行业与性别维度下的薪资变动轨迹是理解劳动力市场动态的核心。该数据集汇集了2005年至2025年间亚洲23个国家的月度平均收入数据,按国际劳工组织(ILO)行业分类和性别进行细致分层,为研究人员提供了极具代表性的时间序列样本。经典的使用方式包括构建面板数据模型,用于分析亚洲各国薪资水平的长期趋势、收敛性以及结构性差异,或结合宏观经济变量(如GDP、通货膨胀率)进行回归分析,探究影响薪资变动的关键因素。
实际应用
在实际应用中,该数据集为国际组织、政策制定机构及跨国企业的人力资源战略提供了关键决策依据。例如,研究人员可与世界银行或亚洲开发银行合作,利用数据评估最低工资政策对特定行业女性劳动者的实际影响,识别欠发达国家中的贫困劳工群体,设计针对性的技能培训与薪资干预方案。此外,跨国企业在布局亚洲新兴市场时,可依据该数据对标不同国家的行业薪酬基准,优化薪酬体系与人才吸引策略。国际劳工组织自身也借此监测各国体面劳动目标的进展,推动区域公平薪酬标准的制定。
衍生相关工作
该数据集衍生出一系列具有影响力的经典工作,推动了亚洲劳动经济学与数据科学方法的深度融合。一方面,研究者基于该数据构建了混合效应模型与贝叶斯结构时间序列模型,以预测特定国家或行业的薪资波动。另一方面,自然语言处理技术的引入使得研究者将数据中的行业聚类结果与社交媒体文本或政策文件分析相结合,探索政策话语环境对实际薪资变动的影响。此外,有学者以该数据为基础开发了交互式可视化分析平台,用于展示亚洲薪资差异的时间演变,促进了劳动经济学研究的可视化与公众可及性,形成了跨学科的创新成果。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务