遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-ocu-cur-nb-average-monthly-earnings-of-employees-by-sex-occup

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲36个国家从1996年至2025年的40,378个观察值,专注于“员工按性别、职业和货币划分的平均月收入”这一指标(指标代码:EAR_EMTA_SEX_OCU_CUR_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲地区。数据集涵盖了国家代码、国家名称、数据来源(如劳动力调查)、指标代码、指标标签、性别分类(总计、男性、女性、其他)、职业分类、货币分类、观测年份、观测数值、观测状态标志以及相关注释等信息。数据以年度频率发布,经过ILO的标准化处理,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 40,378 observations across 36 Asian countries from 1996 to 2025, focusing on the indicator Average monthly earnings of employees by sex, occupation and currency (indicator code: EAR_EMTA_SEX_OCU_CUR_NB). The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved via API and filtered for Asia. It includes columns such as country code, country name, data source (e.g., labour force survey), indicator code, indicator label, sex disaggregation (total, male, female, other), occupation classification, currency classification, observation year, observed value, observation status flags, and related notes. The data is published at annual frequency, harmonized by ILO, and suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-ocu-cur-nb-average-monthly-earnings-of-employees-by-sex-occup 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,经由Electric Sheep Asia团队从其REST API直接提取并重新封装。原始数据基于各国劳动力调查、家庭收入调查、企业调查及行政记录等多元来源,并依据国际劳工统计学家会议(ICLS)定义进行标准化校验。在构建过程中,团队将范围精准限定于亚洲36个国家的ISO3代码,聚焦于月均收入指标(EAR_EMTA_SEX_OCU_CUR_NB),最终形成包含40378条观测值的数据集,时间跨度覆盖1996年至2025年,所有数据均以Parquet格式存储,便于机器学习和时间序列分析。
特点
该数据集的核心特色在于其精细的维度拆解与地域广度。除了核心的月均收入数值外,数据集提供了按性别(男性、女性、总计)和职业分类(如技能等级)的细分字段,同时包含货币类型标注,支持本地货币与统一货币单位的对比分析。地理覆盖上囊括了塞浦路斯、柬埔寨、越南、土耳其等36个亚洲经济体,时间序列长达30年,为跨区域、跨时期的劳动力市场对比提供了坚实基础。此外,数据集中嵌入了来源标志与观测状态注释,如“序列中断”或“临时数据”标识,增强了数据的可追溯性与质量透明度。
使用方法
用户可通过HuggingFace的`datasets`库便捷加载该数据集,一行代码即可将其转化为Pandas DataFrame进行深度分析。实践中,可依据`ref_area`字段对国家进行筛选,例如提取印度尼西亚的子集,或利用`indicator`列聚焦单一指标进行时间序列绘图。对于面板数据分析,推荐使用`pivot_table`方法将数据重塑为国家×年份的矩阵形式。数据集中丰富的中介变量(如性别、技能分类)支持多维分组比较,适用于回归建模或预测任务。所有操作均基于标准化列名与类型,极大降低了数据清洗门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其统计数据库ILOSTAT创建,并由Electric Sheep Asia在HuggingFace平台上重新包装发布,旨在提供亚洲地区按性别、职业和货币分列的雇员平均月收入信息。数据集涵盖1996年至2025年间36个亚洲国家的40,378条观测记录,核心研究问题聚焦于劳动经济学中收入不平等、性别工资差异以及职业结构对薪酬的影响。作为全球劳动统计的权威来源,ILOSTAT的数据为政策制定者、经济学家和社会科学家提供了实证基础,推动了亚洲地区劳动力市场分析、可持续发展目标(SDG)监测以及跨国家比较研究的进展。该数据集的出现,不仅增强了区域劳动数据的可获取性,还通过标准化格式降低了研究者处理跨国面板数据的技术门槛,对劳动经济学和公共政策领域产生了深远影响。
当前挑战
该数据集所解决的领域问题在于,亚洲地区长期缺乏统一、可比且高频率的工资数据,阻碍了关于收入不平等、性别歧视和劳动力市场效率的精确分析。由于各国统计方法、调查频率和数据质量参差不齐,构建该数据集时面临多重挑战:首先,需从ILOSTAT API中整合36个国家的异构行政记录和调查数据,并依据国际劳工统计学家会议(ICLS)定义进行规范化处理;其次,需处理缺失值、序列中断(如标记为'Break in series'的观测)以及多来源冲突,例如同一国家同一年份存在多个来源时需筛选ILO选定的'最佳来源';此外,货币单位的不统一(如本地货币与美元)和职业分类的差异进一步增加了跨国家比较的复杂性,需要借助分类变量(如classif1和classif2)进行细致分层,以确保数据分析的可靠性和一致性。
常用场景
经典使用场景
该数据集基于国际劳工组织(ILO)的ILOSTAT数据库,聚焦于亚洲36个国家1996至2025年间按性别、职业和货币划分的雇员月均收入数据,共计40,378条观测值。在劳动力经济学与公共政策研究领域,它被广泛用于构建多元回归模型,以剖析性别收入差距、职业技能溢价以及货币汇率波动对实际收入的影响。研究人员常借助此数据集进行面板数据分析,通过固定效应模型或工具变量法,识别经济发展水平、教育投入与劳动法规等宏观因素如何塑造亚洲各地不同群体的收入格局。其时间跨度长、国家覆盖广且细粒度分类的特性,使得跨区域、跨时期的比较研究成为可能,有效支撑了关于亚洲劳动力市场结构变迁的实证探讨。
解决学术问题
长期以来,亚洲地区缺乏标准化、跨国的收入微观数据,导致学者难以系统性地探讨性别收入不平等的演变趋势、职业分割对经济回报的作用机制,以及货币价值变动对劳动者实际购买力的影响。该数据集通过统一口径收录了按性别、职业和货币分类的月均收入指标,有效填补了这一空白。基于这一资源,研究者得以量化女性在特定职业领域面临的系统性收入劣势,验证人力资本理论在亚洲不同发展阶段经济体的适用性。此外,数据集还助力评估最低工资政策、劳动法改革等制度干预的实际效果,为国际发展经济学提供了关键的经验支撑,推动了关于亚洲劳动力市场非正规性与收入分配公平性的学术讨论。
衍生相关工作
依托该数据集的丰富维度,学术界衍生出多项具有影响力的研究工作。在性别经济与收入不平等领域,学者构建了基于分位数回归的收入差距分解模型,揭示了亚洲各国不同收入阶层中性别差异的异质性表现,并探讨了职业隔离与教育回报在其中扮演的角色。部分研究利用时间序列分析方法,将收入数据与亚洲金融危机的冲击、产业结构升级等宏观事件相关联,量化了劳动力市场应对经济波动的韧性。此外,数据集促成了利用机器学习方法进行收入预测的探索,通过引入性别、职业和国家的特征组合,开发了适用于跨国比较的薪资估算工具。这些衍生效不仅深化了对亚洲劳动经济动态的理解,也为后续政策模拟与反事实分析奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务