遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-age-cur-nb-average-monthly-earnings-of-employees-by-sex-age-a

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲地区员工月平均收入数据,涵盖了30个亚洲国家从1996年到2025年的19,110个观测值。核心指标为按性别、年龄和货币分类的员工平均月收入(指标代码:EAR_EMTA_SEX_AGE_CUR_NB)。数据按国家、数据来源、性别(总计、男性、女性等)、年龄组、货币类型(本地货币等)和年份进行细分,并包含观测值、观测状态和相关注释。数据集经过重新打包,旨在为机器学习提供统一、标准化的亚洲数据层,便于研究人员和开发者直接使用。

This dataset contains average monthly earnings data for employees in Asia, sourced from the International Labour Organization (ILO) ILOSTAT database. It includes 19,110 observations across 30 Asian countries spanning from 1996 to 2025. The core indicator is Average monthly earnings of employees by sex, age and currency (indicator code: EAR_EMTA_SEX_AGE_CUR_NB). Data is disaggregated by country, data source, sex (total, male, female, etc.), age group, currency type (e.g., local currency), and year, and includes observed values, observation status flags, and relevant notes. The dataset has been repackaged to provide a unified, standardized data layer for Asia that is ready for machine learning, facilitating easy use by researchers and developers.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-age-cur-nb-average-monthly-earnings-of-employees-by-sex-age-a 数据集图片
构建方式
在全球劳动统计领域,国际劳工组织(ILO)的ILOSTAT数据库是权威数据源。本数据集依托ILOSTAT REST API,从`https://rplumber.ilo.org/data/indicator?id=EAR_EMTA_SEX_AGE_CUR_NB`直接抓取原始指标数据,并依据ISO 3166-1 alpha-3国家代码筛选出亚洲区域。ILOSTAT遵循国际劳工统计学家会议(ICLS)定义,对各国劳动力调查、住户收入调查等微观数据进行标准化处理,确保跨国家与跨时期的可比性。数据集中每个观测值均附有`source.label`字段,清晰标注数据来源,实现全程可追溯。
特点
该数据集收录了19,110条观测记录,覆盖30个亚洲国家,时间跨度从1996年至2025年,聚焦于“按性别、年龄和货币划分的雇员平均月收入”这一核心指标。其突出特点在于精细的维度切分:提供了性别(总、男、女、其他)、年龄组以及货币类型(本币)等多重分类变量,满足研究者从不同视角剖析收入结构的需求。数据标注了观测状态(如中断、临时值)和来源注释,充分反映数据质量与潜在局限性,为严谨的推断分析奠定基础。
使用方法
借助HuggingFace Datasets库,用户可通过一行代码`load_dataset("electricsheepasia/asia-ilo-ear-emta-sex-age-cur-nb-average-monthly-earnings-of-employees-by-sex-age-a")`快速加载数据集至Pandas DataFrame。典型应用包括:按国家筛选特定子集(如印度尼西亚);针对单一指标按时间排序绘制时间序列图;或利用透视表构建国家×年份的观测矩阵,便于进行面板数据分析。数据集以Parquet格式存储,兼顾了ML任务的读写效率与内存友好性。
背景与挑战
背景概述
在劳动经济学与发展研究领域,薪资数据的系统化采集与分析对于理解区域经济不平等、劳动力市场动态以及性别与年龄维度的收入差异至关重要。该数据集由国际劳工组织(ILO)旗下的ILOSTAT数据库于2025年整理发布,并由Electric Sheep Asia团队在HuggingFace上重新封装。其核心研究问题聚焦于亚洲30个国家在1996年至2025年间,按性别、年龄及货币类别划分的员工平均月收入,旨在为跨国比较、时间序列建模及政策评估提供标准化数据基础。作为ILO统计体系中的关键组成部分,该数据集因其覆盖30个亚洲国家、长达30年的观测窗口与精细的人口统计学分类,已成为分析亚洲劳动市场薪酬结构演化、评估体面劳动目标进展及推动区域劳动力研究的重要基石。
当前挑战
该数据集所解决的领域问题核心在于:劳动经济学中亚洲地区薪资数据的碎片化、不兼容与时间跨度不足等挑战,具体表现为各国统计口径差异、货币单位不一及性别-年龄交叉分组的缺失,这阻碍了跨国纵向比较与精准政策制定。在构建过程中,数据集成面临多重挑战:首先,各国原始数据来自劳动调查、行政记录等异构来源,需依据国际劳工统计学家会议(ICLS)定义进行严格协调与质量控制;其次,国家间数据稀疏性与时间序列不连续性(如阿富汗仅有极少量观测)要求审慎处理缺失值与代表性偏差;再者,仅保留年度频率而排除月度或季度序列,限制了高分辨率动态分析的潜力;最后,观测状态标记(如系列中断、暂定值)增加了数据清洁与可靠性评估的复杂度,需研究人员在建模时充分考虑这些质量标签带来的不确定性。
常用场景
经典使用场景
在劳动经济学与社会科学领域,亚洲雇员性别与年龄分类的平均月收入数据集堪称基础性资源。该数据集汇聚了国际劳工组织ILOSTAT数据库中30个亚洲国家横跨1996至2025年的19,110条观测记录,涵盖了以性别和年龄分组的雇员月均收入信息。其经典使用场景在于支撑跨国劳动力市场的比较研究,例如通过分析不同经济体在性别工资差距与代际收入分布上的异同,揭示亚洲各国劳动力结构的演化轨迹。同时,该数据可作为时间序列预测模型的训练基础,用于估算或外推特定区域或群体的收入趋势,为宏观经济政策制定提供量化支撑。
实际应用
在实际应用层面,该数据集为国际发展机构、政府部门与私营部门的多元需求提供了数据赋能。国际劳工组织及相关非政府组织可借助其评估各国劳工政策成效,识别低收入或性别不平等突出的区域以精准投放援助资源。政府统计部门与央行可基于其间收入中位数与平均值的变动趋势,调整社会保障缴费基数、最低工资标准及通胀挂钩的福利津贴。企业人力资源部门则能通过跨行业、跨国家的收入标杆数据,制定更具竞争力的薪酬策略,尤其适用于在亚洲多国运营的跨国企业进行薪酬公平性审计。
衍生相关工作
依托该数据集的精细时间序列与地理标签,催生了一系列具有奠基意义的学术与工程作品。经济学界利用它构建了亚洲性别收入差距动态模型,产出了如《亚洲劳动力市场中的工资结构演化》等专题研究报告。计算机科学领域则以此数据为基础,开发了专门针对跨区域收入预测的鲁棒回归算法与降水状图可视化工具。部分研究还将其与健康、教育等社会经济指标联合分析,形成揭示收入—福祉关联性的多模态数据库。ILO自身的年度工作报告亦频繁引用该数据源,用以论证亚洲地区体面劳动目标的实现程度与区域间差异,从而强化了其作为权威基准数据的影响力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务