遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-cbr-cur-nb-average-monthly-earnings-of-employees-by-sex-place

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲19个国家从2001年至2024年的2,309个观测值,主要指标为“按性别、出生地和货币划分的员工平均月收入”(指标代码:EAR_EMTA_SEX_CBR_CUR_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了员工收入统计,并按性别(总计、男性、女性)、出生地(总计)和货币(本地货币)等维度进行细分。数据集以表格形式提供,包括国家代码、国家名称、数据来源、指标代码、指标标签、性别分类、分类变量、观测年份、观测值、观测状态等列,适用于表格分类、回归和时间序列预测等任务。数据经过ILO harmonization处理,并标注了来源和质量标志,由Electric Sheep Asia重新打包发布,便于机器学习使用。

This dataset contains 2,309 observations of average monthly earnings of employees across 19 Asia countries, spanning from 2001 to 2024, with the primary indicator Average monthly earnings of employees by sex, place of birth and currency (indicator code: EAR_EMTA_SEX_CBR_CUR_NB). Sourced from the International Labour Organization (ILO) ILOSTAT database, it covers labor statistics on employee earnings, disaggregated by sex (total, male, female), place of birth (total), and currency (local currency). The dataset is provided in tabular format, including columns such as country code, country name, data source, indicator code, indicator label, sex classification, classification variables, observation year, observed value, observation status, etc., suitable for tasks like tabular classification, regression, and time-series forecasting. Data is harmonized by ILO with source and quality flags, repackaged by Electric Sheep Asia for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-cbr-cur-nb-average-monthly-earnings-of-employees-by-sex-place 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口直接提取指标EAR_EMTA_SEX_CBR_CUR_NB的原始数据,并依据亚洲ISO3国家代码进行地域筛选。数据采集自19个亚洲国家的劳动力调查、家庭收入调查及行政记录,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行标准化处理,以确保跨国的可比性。最终由Electric Sheep Asia重新封装,生成包含2309条观测值的结构化数据集,涵盖2001至2024年的时间跨度。
特点
数据集聚焦于亚洲19国员工按性别与出生地划分的月均收入指标,以本地货币计价,提供1966个观测值。其核心特征在于精细的分类维度:性别维度涵盖总计、男性与女性三类;出生地与货币分类进一步细化分析层次。数据质量经过标识,来源字段(source.label)标注了具体调查机构,观测状态(obs_status)如“不可靠”等标记为用户提供审慎使用提示。时间序列结构支持多国面板分析,便于追踪收入变迁与性别差异。
使用方法
用户可通过HuggingFace的datasets库以一行代码加载数据集,直接转换为Pandas DataFrame进行探索性分析。典型应用包括按国家过滤子集(如印度尼西亚),对单一指标绘制时间序列图,或构建国家-年份交叉矩阵以进行跨国比较。数据兼容表格分类、回归及时序预测任务,适合经济学、劳动社会学与亚洲区域研究。建议使用时遵循CC-BY-4.0许可,引用ILO原始数据及Electric Sheep Asia的再封装版本。
背景与挑战
背景概述
在劳动经济学与移民研究领域,基于性别的工资差异和移民劳动者的经济融合是核心议题。该数据集由国际劳工组织(ILO)于2024年发布,经Electric Sheep Asia重新封装后提供,聚焦亚洲19个国家在2001至2024年间按性别和出生地划分的员工平均月收入。ILOSTAT作为全球劳动统计的权威来源,整合了来自劳动力调查、家庭收支调查等多元数据,经国际劳工统计学家会议(ICLS)定义统一。该数据集为探究亚洲地区劳动力市场中性别不平等与移民身份对收入的影响提供了标准化、跨国的定量基础,对推动区域劳动政策制定与学术研究具有重要价值。
当前挑战
首先,领域核心挑战在于解构亚洲国家间复杂的劳动力市场结构差异,如非正式经济比例高、数据采集标准不一,导致跨国比较时需谨慎处理因文化、经济制度差异带来的混淆因素。其次,构建过程中面临显著的数据质量挑战:部分国家数据存在缺失(如不同年份覆盖不均)、观测状态标记为不可靠或临时值(如‘obs_status’标识仅为‘U’),需甄别源数据中来自不同调查类型的异质性。此外,按性别和出生地细分的数据在部分国家样本量有限,可能影响统计推断的稳健性,且货币单位不一致(如币种列为‘classif2’)要求额外标准化处理以支持跨年度与跨国分析。
常用场景
经典使用场景
该数据集汇集了国际劳工组织ILOSTAT数据库中亚洲19个国家2001至2024年间按性别与出生地分层的雇员平均月薪信息,共计2,309条观测记录。其典型应用场景聚焦于劳动经济学领域的时空比较分析,研究者可利用该数据剖析亚洲各国薪资水平的长期演变轨迹,揭示性别工资差距在国家间的异质性特征,并探讨移民身份对劳动报酬的影响机制。通过将数据与国家经济指标、人口结构或政策变迁关联,可构建面板数据模型,深入挖掘工资动态与劳动力市场结构性转型之间的内在联系。
实际应用
从实际应用视角审视,该数据集是政府机构和社会政策制定者评估绿色就业转型、最低工资制度效果以及移民融入政策的宝贵工具。例如,国家统计部门可借助该数据分析不同行业和性别的薪资分布,为调整社会保障缴款基准或设计有针对性的劳动力激活计划提供依据。国际组织如世界银行或亚洲开发银行可用其监测可持续发展目标8(体面工作和经济增长)的实现进程,尤其是在衡量性别平等和移民工人经济权益方面。此外,该数据所包含的标准化元数据与时间序列特性,使其能够无缝嵌入企业薪酬对标分析平台,为跨国人力资源合规管理提供参考。
衍生相关工作
该数据集已成为一系列衍生研究工作的数据基石,尤其激励了亚洲劳动经济学领域计算社会学与计量经济学方法论的创新。经典工作包括基于该数据开发的面板向量自回归模型,以探究工资波动与经济增长、移民流动之间的动态因果关系;以及采用分解技术(如Oaxaca-Blinder分解)量化性别工资差距中禀赋效应与歧视效应的相对贡献。近年来,深度学习在时间序列预测上的应用也被引入,研究者利用该数据训练长短期记忆网络,对特定国家组的薪资趋势进行多步预测,并与传统ARIMA模型进行精度对比。这些衍生工作共同推动了从描述性统计向因果推断与预测建模的方法论跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务