遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-geo-cur-nb-average-monthly-earnings-of-employees-by-sex-rural

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由Electric Sheep Asia重新打包,源自国际劳工组织(ILO)的ILOSTAT数据库,专注于亚洲25个国家从1996年到2025年的员工平均月薪数据。数据集包含6,585个观测值,涵盖1个核心指标:EAR_EMTA_SEX_GEO_CUR_NB,该指标按性别(总计、男性、女性等)、城乡地区和货币类型细分员工平均月薪。数据以表格形式组织,包括国家代码、年份、观测值、数据来源、分类变量(如性别和地区类型)等列,适用于表格分类、回归和时间序列预测等任务。数据通过ILOSTAT API获取,并经过标准化处理,确保与ILO的统计定义一致。数据集支持多种分析,如按国家筛选、时间序列可视化和数据透视,并遵循CC-BY-4.0许可。

This dataset, repackaged by Electric Sheep Asia, is sourced from the International Labour Organization (ILO) ILOSTAT database and focuses on average monthly earnings data for employees across 25 Asian countries from 1996 to 2025. It contains 6,585 observations covering one core indicator: EAR_EMTA_SEX_GEO_CUR_NB, which disaggregates average monthly earnings by sex (total, male, female, etc.), rural/urban areas, and currency type. The data is presented in tabular format with columns including country codes, years, observed values, data sources, and classification variables (e.g., sex and area type), suitable for tasks such as tabular classification, regression, and time-series forecasting. Data is retrieved via the ILOSTAT API and harmonized according to ILO statistical definitions. The dataset supports various analyses like country filtering, time-series visualization, and pivot tables, and is released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-geo-cur-nb-average-monthly-earnings-of-employees-by-sex-rural 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦亚洲地区雇员平均月收入这一核心劳动经济指标。构建过程中,数据通过ILOSTAT官方REST API直接拉取,并依据亚洲ISO3国家代码进行筛选过滤,最终汇集了25个亚洲国家自1996年至2025年间的6,585条观测记录。ILO统计部门依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行标准化处理,以确保跨国家、跨年份数据的可比性与一致性;每条数据均附带来源标识字段(source.label),便于研究者追溯原始调查类型,例如劳动力调查或企业调查。
特点
该数据集的核心特点在于其多维度的精细划分与结构化设计。除基本的时间序列与地理覆盖外,数据按性别(男性、女性、总计及其他)以及城乡地理区域进行分解,同时辅以货币类型分类,为分析不同人口群体间的收入差异提供了宝贵素材。数据集包含丰富的元数据列,如观测状态标记(obs_status)、断点注释(note_indicator.label)等,有效揭示了数据质量与可能存在的序列中断。此外,所有数据均采用年度频率,并选用ILO评选的“最佳来源”,在保障数据权威性的同时兼顾了来源的透明度。
使用方法
该数据集以HuggingFace Datasets库的标准格式封装,可直接通过load_dataset()函数加载至Python环境,并便捷地转换为pandas DataFrame进行后续分析。研究者可依据国家代码(ref_area)筛选特定国家的收入序列,或按指标代码(indicator)提取特定收入类型的时间序列数据用于可视化或建模。数据集还支持透视操作,能够将数据重塑为国家×年份的矩阵形式,便于开展面板数据分析、时间序列预测或分类回归等机器学习任务。该数据集特别适合用于亚洲劳动经济学研究、收入不平等比较以及跨国计量经济建模等场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)旗下ILOSTAT数据库于2025年整理发布,并由Electric Sheep Asia在HuggingFace平台重新封装,聚焦于亚洲地区按性别及城乡划分的员工平均月收入。作为全球劳动统计领域的权威来源,ILOSTAT整合了各国劳动力调查、家庭收入调查等数据,该数据集涵盖了1996年至2025年间25个亚洲国家的6,585条观测值,旨在填补亚洲区域收入数据的结构化空白,为跨国劳动经济学比较、性别工资差距分析及可持续发展目标(SDG)中体面工作指标的监测提供标准化、机器可读的基石。其影响力体现于:通过统一的分类体系与元数据标注,大幅降低了跨地域、跨时间面板数据的研究门槛,推动了亚洲劳动市场的实证分析进程。
当前挑战
该数据集所应对的领域挑战在于:劳动收入数据常受限于各国统计口径迥异、货币单位不统一及城乡二元结构下抽样偏差,导致跨国比较与时间序列建模面临数据异构性与缺失值处理难题;ILOSTAT虽通过ICLS定义进行协调,但原始调查来源的差异(如劳动力调查与行政记录)仍可能引入系统性误差。构建过程中的挑战包括:从ILOSTAT REST API提取数据时,需筛选亚洲国家ISO3代码并处理多源数据的最佳来源选择逻辑;同时,部分指标仅发布月度或季度序列,而本数据集仅收录年度数据,造成时间粒度上的信息损失;此外,分类变量(如sex、classif1)仅在特定维度非空,增加了数据融合与空缺值推断的复杂性。
常用场景
经典使用场景
该数据集收录了1996年至2025年间亚洲25个经济体按性别与城乡地域划分的雇员平均月收入数据,涵盖6585条观测值。最经典的使用场景在于构建面板数据模型,以纵向追踪亚洲各国劳动力市场报酬结构的动态演变。研究者常借此分析性别收入差距的时空异质性,或评估城镇化进程中不同地域劳动者收入水平的收敛或发散趋势。同时,该数据亦常用于时间序列回归,探讨宏观政策变动、经济周期或制度变革对实际工资水平的影响。
衍生相关工作
基于该数据集,学术界已衍生出一系列开创性工作。例如,有研究利用其性别与地域分组特征构建了亚洲城乡性别工资差距的贝叶斯层级模型,揭示了不同发展水平国家间差异化的性别不平等特征。另一些文献将其与ILO其他劳动统计指标衔接,开展宏观经济冲击与劳动力报酬协动性的因果推断。在实践层面,多家研究机构借助该数据训练了针对低收入国家劳动力市场预警的机器学习分类器,为早期干预提供数据驱动力。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区雇员平均月收入的性别、城乡与货币维度的精细化比较,为劳动经济学中的性别薪酬差距、城乡收入分化及区域不平等研究提供了关键数据支撑。当前前沿方向包括利用时序数据构建预测模型,分析全球化、技术变革及政策干预对亚洲劳动力市场的影响,并与ILOSTAT其他指标联动,探究收入与就业质量、非正规经济及可持续发展目标(SDGs)之间的关联。随着亚洲经济体数字化转型加速,该数据集还可用于评估新冠疫情后收入恢复的异质性模式,以及跨境供应链重组对本地劳动报酬的冲击。其标准化的分类体系与长时序跨度,为跨国产出比较、薪酬机制的空间计量分析及基于机器学习的不平等预警模型训练奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务