遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-cur-nb-average-monthly-earnings-of-employees-by-sex-and-c

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是亚洲员工按性别和货币分类的平均月收入(ILOSTAT)数据集,包含5,461条观测记录,覆盖44个亚洲国家,时间跨度为1969年至2025年。核心指标为EAR_EMTA_SEX_CUR_NB,即员工按性别和货币分类的平均月收入。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过标准化处理,包含国家代码、来源、指标、性别分类(总计、男性、女性等)、观测年份、观测值等列。数据集适用于表格分类、回归和时间序列预测任务,支持经济分析、劳动力市场研究和机器学习应用。数据以Parquet格式发布,附带详细的数据模式、使用示例和引用信息。

This dataset is Average monthly earnings of employees by sex and currency | Asia (ILOSTAT), containing 5,461 observations across 44 Asia countries, spanning from 1969 to 2025. The core indicator is EAR_EMTA_SEX_CUR_NB, representing average monthly earnings of employees disaggregated by sex and currency. Data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for Asia ISO3 country codes. It includes columns such as country code, source, indicator, sex classification (total, male, female, etc.), observation year, observed value, and more. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, supporting economic analysis, labor market research, and machine learning applications. It is published in Parquet format with detailed schema, usage examples, and citation information.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-cur-nb-average-monthly-earnings-of-employees-by-sex-and-c 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,经由Electric Sheep Asia重新封装后发布于HuggingFace平台。数据通过ILOSTAT REST API直接获取,筛选出亚洲44个国家的ISO3国家代码,并整合了源自劳动力调查、家庭收入调查、企业调查及行政记录等多元渠道的原始微观数据。ILO依据国际劳工统计学家会议(ICLS)的定义对数据进行统一协调处理,并在source.label列中标注了数据来源,确保了数据的可追溯性和跨国的可比性。
特点
数据集共包含5,461条观测记录,时间跨度从1969年延伸至2025年,覆盖了亚洲44个国家。其核心指标为“按性别和货币划分的雇员平均月收入”(EAR_EMTA_SEX_CUR_NB),并提供了性别(男性、女性、总计及其他)的细分维度。此外,数据还包含了货币类型、观测状态标志及多种注释列,为用户深入理解数据的计算方式、序列断裂或货币变动等背景信息提供了详尽支持。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据集,使用load_dataset()函数即可将其转换为Pandas DataFrame进行后续分析。典型应用包括:按国家代码筛选特定国家的数据以研究其收入趋势;按时间序列排序并可视化单一指标的演变规律;亦可利用pivot_table方法构建国家与年份的矩阵视图,便于进行跨国比较与面板数据分析,极大降低了研究人员获取和处理亚洲劳动力市场数据的技术门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,经Electric Sheep Asia重新封装后呈现于HuggingFace平台。数据集聚焦于亚洲地区雇员按性别与货币划分的平均月收入,收录了44个亚洲国家从1969年至2025年间的5,461条观测记录。作为ILOSTAT数据库的核心子集,该数据旨在为劳动经济学、性别薪酬差异及区域经济发展研究提供标准化、跨国可比的收入基准。其影响力在于,通过统一的数据架构与细致的分类维度(如性别、货币类型),推动了亚洲劳动力市场不平等问题的量化分析,并为国际劳工组织的体面劳动目标监测提供了关键实证支撑。
当前挑战
首先,该数据集面临的领域问题挑战在于劳动收入的度量异质性:不同亚洲国家的收入调查在频率(年度、月度)、货币换算、购买力平价调整及非正规经济覆盖上存在显著差异,导致跨国可比性受限。其次,构建过程中的挑战体现在数据整合的复杂性上:ILOSTAT需从国家劳动力调查、行政记录等多源异构数据中提取信息,并处理因统计方法变更(如断点标记‘Break in series’)导致的时间序列一致性下降。此外,部分国家长期缺失性别细分数据,使得性别薪酬差距的完整刻画受到制约。
常用场景
经典使用场景
在劳动经济学与区域发展研究中,该数据集被广泛应用于跨国收入比较与性别薪酬差距的纵向分析。其涵盖44个亚洲国家、跨越半个多世纪的月均收入观测值,为研究者提供了宝贵的时序面板数据。通过按性别与货币维度划分的收入指标,学者能够洞察亚洲各国劳动力市场的演进轨迹,量化经济发展阶段与报酬水平之间的关联,并借助本土货币与统一统计口径,揭示区域内部收入差异的深层结构性动因。
解决学术问题
该数据集有效解决了亚洲范围内劳动报酬数据分散、统计口径不一及长期可比性缺失的学术困境。它使研究者得以系统评估性别收入不平等的时空演变规律,识别制度变迁、经济周期与全球化进程对劳动者报酬的异质性冲击。在可持续发展目标(SDG)框架下,该数据为监测体面劳动指标进展、验证人力资本理论及量化贸易开放对收入分配效应提供了坚实可信的实证基础,显著推动了区域劳动经济学的经验研究。
衍生相关工作
依托该数据集,学术界已衍生出若干具有影响力的研究成果。研究者利用其长时序面板特性,构建了亚洲国家收入收敛性分析的计量模型,检验了库兹涅茨假说在东亚与南亚地区的适用性。另有工作聚焦于性别收入差距的动态分解,结合教育水平与职业结构的代理变量,揭示了劳动力市场分割的演变特征。在方法论层面,该数据被用于验证缺失值估算技术与多国购买力平价调整算法的稳健性,促进了跨国比较统计方法论的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务