遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-eco-cur-nb-average-monthly-earnings-of-employees-by-sex-econo

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲45个国家从1969年至2025年的员工平均月收入数据,共127,686个观测值,涵盖1个核心指标:按性别、经济活动和货币细分的员工平均月收入(指标代码为EAR_EMTA_SEX_ECO_CUR_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家。数据集提供了结构化表格,包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性等)、经济活动和货币分类、观测年份、观测值、数据状态标志以及相关注释。数据按年度频率发布,经过ILO的标准化处理,确保与国际劳工统计学家会议(ICLS)定义一致。数据集适用于表格分类、回归和时间序列预测等任务,旨在支持劳动力市场研究和机器学习应用。

This dataset contains 127,686 observations of average monthly earnings data across 45 Asia countries, spanning from 1969 to 2025, covering 1 distinct indicator: Average monthly earnings of employees by sex, economic activity and currency (indicator code EAR_EMTA_SEX_ECO_CUR_NB). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to Asia ISO3 country codes. It provides a structured tabular format with columns including country code, country name, source code, indicator code, sex disaggregation (total, male, female, etc.), economic activity and currency classifications, observation year, observed value, observation status flags, and related notes. The data is published at annual frequency, harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions. It is suitable for tasks such as tabular classification, regression, and time-series forecasting, supporting labour market research and machine learning applications.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-eco-cur-nb-average-monthly-earnings-of-employees-by-sex-econo 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API直接提取指标EAR_EMTA_SEX_ECO_CUR_NB的原始数据,并依据ISO3166-1 alpha-3国家代码筛选出亚洲45国的观测记录。数据涵盖1969年至2025年间共127,686条样本,经ILO基于国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理,原始调查来源(如劳动力调查、企业调查)均在source.label字段中明确标注,确保了数据的可追溯性与一致性。最终由Electric Sheep Asia团队重新打包为便于机器学习使用的Parquet格式数据集。
特点
该数据集聚焦于亚洲地区员工按性别、经济活动与货币划分的月均收入,包含45个亚洲国家长达56年的时序观测,覆盖广泛的跨区域与跨时期劳动经济信息。其核心变量包括国家代码、性别细分(总/男/女)、经济活动分类(如行业大类)、货币类型及观测值,并附带详尽的状态注释字段以标记序列中断、数据可靠性等质量信息。数据集还支持从宏观的行业总值到具体的本地货币单位等多维度拆解,为研究亚洲劳动力市场结构、性别收入差距及经济发展变迁提供了丰富且细粒度的数据基础。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载该数据集,并直接转换为Pandas DataFrame进行后续分析。典型应用包括:按国家筛选(如df[df['ref_area']=='IDN'])获取特定区域的时间序列;对单一指标进行排序与可视化,以观察趋势变化;利用pivot_table构建国家×年份的观测矩阵,便于面板数据分析或跨国家比较。数据集还支持按性别、经济活动等分类变量进行分组聚合,适合开展收入不平等、行业工资差异等经济学实证研究,或作为时间序列预测模型的训练输入。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,由Electric Sheep Asia于2025年重新整理并发布在HuggingFace平台,核心指向亚太地区劳动力市场中雇员月均薪酬的性别与经济活动差异。源自ILOSTAT数据库,这一数据集整合了45个亚洲国家自1969年至2025年间超过12.7万条观测记录,聚焦于按性别、经济活动及货币划分的平均月薪指标,旨在为区域劳动经济学研究提供跨国家、长跨度的标准化数据基础。作为全球权威的劳动统计来源,ILO依据国际劳工统计学家会议定义进行数据协调,为研究亚洲劳动力市场性别收入差距、产业结构演变及工资水平变迁提供了关键支撑,对发展经济学和劳动政策评估具有重要意义。
当前挑战
该数据集的核心挑战在于应对劳动力市场数据固有的时空异质性与比较难题。领域层面,亚洲各国经济发展阶段、产业结构及统计体系差异显著,不同国家调查类型(如劳动力调查、企业调查)与数据来源的多元性导致指标口径难以完全统一,如何在年度频率下精确反映性别收入差距的动态变化并确保跨国可比性,是劳动经济学长期面临的困境。构建过程中,数据整合需克服多源数据的清洗与标准化,特别是处理各国因调查断点、分类变更及货币单位差异导致的观测值标记(如'序列中断'指示),同时保持按性别、行业维度一致拆解的完整性,对数据治理与质量管控提出了严格要求。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交汇地带,该数据集凭借其横跨1969至2025年、覆盖45个亚洲国家的127,686条观测记录,成为探究亚洲劳动力市场薪酬动态的基石性资源。研究者可借此构建跨国面板数据模型,剖析性别、经济活动部门与货币类型对月均收入的影响机制,长时序设计为捕捉薪酬趋势的周期性波动与结构性变化提供了宝贵窗口。
实际应用
在政策制定与跨国机构的实践中,该数据集直接服务于亚洲各国劳动部门的薪酬监察与最低工资调整决策,国际劳工组织可据此追踪体面劳动目标(SDG 8)在区域内的落实进展。同时,跨国企业的人力资源部门能够利用这份数据,在布局亚洲供应链时对标不同经济体的行业薪酬水平,从而制定更具竞争力的本地化薪酬策略。
衍生相关工作
基于该数据集已衍生出针对特定子区域的薪酬异质性分析,如东南亚制造业与中亚资源型经济的薪酬动力机制对比;其时间序列特性也催生了以机器学习方法(如长短期记忆网络)预测国别薪酬趋势的探索性研究。此外,该数据与ILOSTAT其他指标(如失业率、工作时长)的联合使用,推动了多元劳动福祉指数的构建工作,深化了对亚洲非正规就业形态收入特征的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务