遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-cct-cur-nb-average-monthly-earnings-of-employees-by-sex-citiz

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲15个国家从2007年至2024年的员工月平均收入统计,数据来源于国际劳工组织(ILO)的ILOSTAT数据库。数据集共1,632个观测值,涵盖1个核心指标:按性别、公民身份和货币分类的员工月平均收入。数据列包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类(总计、男性、女性)、公民身份分类、货币分类、观测年份、观测值、观测状态及相关注释。数据集适用于表格分类、回归和时间序列预测任务,支持对亚洲劳动力市场收入趋势的分析。

This dataset contains statistics on the average monthly earnings of employees across 15 Asian countries from 2007 to 2024, sourced from the International Labour Organization (ILO) ILOSTAT database. It includes 1,632 observations covering one core indicator: average monthly earnings of employees disaggregated by sex, citizenship, and currency. The data columns encompass country codes, country names, data sources, indicator codes, indicator names, sex classification (total, male, female), citizenship classification, currency classification, observation year, observed values, observation status, and related notes. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, facilitating analysis of income trends in Asian labor markets.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-cct-cur-nb-average-monthly-earnings-of-employees-by-sex-citiz 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)下属ILOSTAT数据库,聚焦于亚洲地区雇员的平均月收入,按性别、国籍及货币维度进行细分。数据通过ILOSTAT REST API直接获取,原始指标代码为EAR_EMTA_SEX_CCT_CUR_NB,并依据亚洲ISO3国家代码进行筛选。ILO依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调,数据来源在source.label列中予以标注,以确保可追溯性。最终,该数据集涵盖了15个亚洲国家、2007年至2024年间的1632条观测记录,由Electric Sheep Asia重新封装为HuggingFace数据集格式。
特点
该数据集的核心特点在于其多维度异构性,不仅包含了按性别(总、男、女)细分的收入数据,还引入了国籍与货币分类变量,如CCT_CIT_TOTAL(国籍:总计)和CUR_TYPE_LCU(货币:当地货币),从而能够支持交叉分析。数据时间跨度达18年,覆盖文莱、泰国、约旦等15个亚洲经济体,观测数量不均但代表性明确。每一条记录均附带观测状态标志(如provisional、unreliable),便于数据质量评估。此外,数据集以Parquet格式封装,兼容Python机器学习工作流,具备良好的可复用性。
使用方法
使用者可通过HuggingFace Datasets库快速加载该数据集:首先使用load_dataset函数获取数据,随后转换为Pandas DataFrame进行探索性分析。典型应用包括按国家过滤(如df[df['ref_area'] == 'IDN'])、单指标时间序列可视化(按时间排序后绘图),以及构建国家×年份的透视表矩阵以比较跨国趋势。数据集中包含16个字段,涵盖地理标识、分类维度、观测值及元数据,用户可利用sex、classif1等列进行分层聚合。所有操作均可在Python环境中实现,无需额外数据清洗即可直接用于回归或时间序列预测任务。
背景与挑战
背景概述
在劳动经济学与跨国劳动力流动研究中,薪资水平的性别差异与公民身份效应是揭示劳动力市场结构性不平等的重要维度。由国际劳工组织(ILO)统计部门维护的ILOSTAT数据库,长期致力于整合全球200多个经济体的劳动力调查与行政记录数据,为相关研究提供权威支撑。该数据集由Electric Sheep Asia于2024年基于ILOSTAT API重新打包并发布,聚焦亚洲15国,涵盖2007至2024年间“按性别、公民身份与货币划分的员工月平均收入”指标,共1632条观测记录。该数据集的引入弥补了亚洲地区在跨国家、跨时间的薪资微观数据方面系统性不足的缺憾,为性别工资差距分析、移民劳动力融入研究及区域劳动政策评估提供了标准化、高可比性的数据基础。
当前挑战
该数据集所解决的领域挑战主要在于:亚洲各国劳动统计口径不一、公民身份与薪资数据关联薄弱,导致跨国比较和性别平等评估长期面临数据碎片化困境。例如,日本、韩国等关键经济体缺失,使得区域整体推断受限;同时,观测状态标记为“不可靠”(unreliable)的记录需审慎剔除,增加了数据清洗成本。在构建过程中,挑战来自于多源数据整合时的分类变量对齐,如ILO使用自行定义的“最佳来源”策略,可能引入抽样偏误;此外,性别、公民身份等维度的断点式更新导致部分年份国家观测稀疏,如不丹仅覆盖2021年,削弱了时序分析的稳健性。整体可解释性依赖于对ILOSTAT元数据体系的深入理解,提升了非专业用户的使用门槛。
常用场景
经典使用场景
在该数据集的典型应用中,研究者常将其用于分析亚洲地区不同性别与国籍员工平均月薪的时空差异。通过整合国际劳工组织的标准化统计指标,该数据集为开展跨国比较研究提供了高质量的时间序列数据,尤其适合探究薪资不平等、劳动力市场结构变迁以及移民劳工经济融入等议题。研究者可基于性别(男性、女性、总计)和公民身份(本国与外国)等维度进行分组分析,结合时间跨度(2007–2024年)构建面板数据模型,从而揭示经济增长、政策调整与薪资动态之间的深层关联。其结构化的标注字段和分类变量使得数据清洗与特征工程变得高效,为后续统计推断或机器学习建模奠定了坚实的数据基础。
实际应用
在现实应用层面,该数据集为国际组织政策评估、国家劳动部门决策及企业薪酬策略制定提供了坚实的数据基石。国际劳工组织可借此监测亚洲各国在体面劳动与可持续发展目标(SDGs)方面的进展,尤其是性别平等与移民劳工权益保障的现状。各国政府能够基于跨国比较数据识别自身薪资结构的短板,制定更具针对性的最低工资调整方案与就业促进政策。此外,人力资源管理咨询公司和跨国企业可利用该数据集进行区域薪酬基准分析,优化海外人才招聘与薪酬体系设计。非政府组织也可借助这些信息开展倡导工作,呼吁缩小性别与公民身份导致的收入鸿沟,推动更具包容性的劳动市场改革。
衍生相关工作
围绕该数据集已衍生出一系列具有影响力的研究工作与学术成果。基于ILOSTAT标准指标的亚洲区域子集,学者们发展了针对劳动力市场分割的计量经济学模型,例如利用固定效应回归或工具变量方法识别性别工资差距的成因。一些研究进一步结合移民人口存量数据,构建了跨国劳动流动与薪资动态的关联分析框架。此外,该数据集常被用作时间序列预测的基础,研究者采用ARIMA、GARCH或机器学习回归器对亚洲主要经济体的平均月薪进行中长期预测,为劳动力规划提供前瞻性参考。也有工作将其与教育年限、产业结构等辅助数据融合,运用因果推断方法评估制度改革或外部冲击对弱势群体薪资的影响,从而拓展了劳动经济学实证研究的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务