遇见数据集

electricsheepasia/asia-ilo-ear-emta-sex-dsb-cur-nb-average-monthly-earnings-of-employees-by-sex-disab

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲国家员工平均月收入数据,具体指标为EAR_EMTA_SEX_DSB_CUR_NB(按性别、残疾状况和货币划分的员工平均月收入)。数据集涵盖18个亚洲国家,时间跨度为1996年至2024年,共有2,471个观测值。数据通过ILOSTAT REST API获取,并过滤为亚洲ISO3国家代码,经过ILO使用国际劳工统计学家会议(ICLS)定义进行标准化处理。数据结构包括国家代码、来源、指标、性别分类、时间、观测值等列,并提供分性别(总计、男性、女性、其他)和残疾状况的维度。数据为年度频率,包含质量注释和来源信息,适用于表格分类、回归和时间序列预测等任务。数据集以cc-by-4.0许可证发布,由Electric Sheep Asia重新打包,便于机器学习使用。

This dataset contains average monthly earnings of employees in Asia, sourced from the International Labour Organization (ILO) ILOSTAT database, with the indicator EAR_EMTA_SEX_DSB_CUR_NB (Average monthly earnings of employees by sex, disability status and currency). It includes 2,471 observations across 18 Asian countries, spanning from 1996 to 2024. Data is retrieved via the ILOSTAT REST API, filtered to Asia ISO3 country codes, and harmonized using ICLS definitions. The schema comprises columns such as country code, source, indicator, sex classification, time, observed value, and quality flags, with disaggregation dimensions for sex and disability status. The data is annual frequency, includes caveats and source information, and is suitable for tabular classification, regression, and time-series forecasting tasks. Released under the cc-by-4.0 license, it is repackaged by Electric Sheep Asia for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-emta-sex-dsb-cur-nb-average-monthly-earnings-of-employees-by-sex-disab 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT权威统计数据库,通过REST API接口直接提取指标代码为EAR_EMTA_SEX_DSB_CUR_NB的原始数据,并依据ISO 3166-1 alpha-3标准筛选出亚洲18个国家的观测记录。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行规范化处理,同时在source.label列中标注数据来源以保证可追溯性。最终经由Electric Sheep Asia团队重新打包为Parquet格式,形成包含2471条观测、覆盖1996至2024年时间跨度的结构化数据集。
特点
这一数据集聚焦于亚洲地区雇员按性别与残疾状况划分的月均收入指标,具备多维度的精细分解特性。除核心的obs_value观测值外,数据还包含sex(性别)、classif1(残疾状态)、classif2(货币类型)等分类字段,支持对四个性别类别及不同残疾状态的交叉分析。数据来源涵盖劳动力调查、机构调查等多种渠道,并附有详细的obs_status状态标记和注释信息,便于研究者评估数据质量与一致性。其时间序列覆盖近三十年,横跨从塞浦路斯到东帝汶的多样化经济体,为区域劳动力市场比较提供了坚实基础。
使用方法
研究者可通过HuggingFace Datasets库的load_dataset函数一键加载该数据集,并将其转换为Pandas DataFrame进行后续分析。典型应用包括按国家筛选特定观测值(如印度尼西亚数据)、对单一指标进行时间序列可视化,或通过透视表构建国家×年份的矩阵以跨区域比较薪酬趋势。数据集已做好机器学习的封装准备,适用于分类、回归及时序预测任务,用户可直接利用sex与classif等分类变量作为特征进行建模。建议在使用时注意观测状态标记与数据质量备注,以确保分析结论的稳健性。
背景与挑战
背景概述
在劳动经济学与可持续发展目标(SDGs)研究领域,薪资数据的跨国可比性始终是实证分析的核心挑战。该数据集由国际劳工组织(ILO)统计部门通过ILOSTAT平台整合发布,并由Electric Sheep Asia于2024年重新封装为机器学习友好格式。数据集聚焦于亚洲18个国家1996至2024年间按性别与残疾状态划分的雇员平均月收入,包含2471条观测记录。作为首个系统覆盖亚洲地区残疾人群薪资差异的标准化数据集,它为研究劳动力市场中的性别与残疾双重歧视、评估各国体面劳动进程提供了关键跨时空证据。该数据集的发布显著降低了研究者获取权威劳动统计数据的门槛,对于推动亚洲地区包容性经济增长的量化研究具有里程碑意义。
当前挑战
该数据集所解决的领域核心挑战在于:传统劳动统计多聚焦于总体平均工资,缺乏按性别与残疾身份交叉分类的细粒度数据,导致针对弱势群体薪资差距的实证研究长期受限于数据可得性。在构建过程中,ILO面临的首要挑战是如何协调来源迥异的各国劳动力调查数据——不同国家对残疾的界定标准(如国际劳工统计学家会议定义与非标准定义并存)导致跨国产出可比性受损。此外,数据稀疏性构成另一技术障碍:部分国家仅提供个别年份的观测值,且本地货币与美元的双重计价模式增加了经济学分析中汇率换算的复杂性。最终数据集通过标注位点(如`note_classif.label`)明确记录定义差异,为使用者提供了必要的质量警示。
常用场景
经典使用场景
在劳动经济学与不平等研究领域,该数据集最经典的用途在于分析亚洲地区雇员月均收入的性别差异与残障状况交叉效应。研究者可借助其时间序列结构,追踪1996年至2024年间18个亚洲国家内不同性别与残障状态群体的收入演变轨迹,从而揭示劳动力市场中结构性不平等的长期趋势。通过将收入数据与性别、残障状态分类变量相结合,学者能够构建多元回归或面板数据模型,量化残障状况对收入水平的独立影响,并评估性别与残障之间是否存在叠加劣势效应。此外,该数据集支持跨国家比较,有助于理解不同社会经济制度下包容性就业政策的实际成效。
实际应用
在实际应用层面,该数据集为国际组织与各国劳动部门制定包容性就业政策提供了数据驱动的决策支持。例如,ILO可基于收入差距的时间序列变化,评估亚洲各国残障人士就业促进计划的有效性,并针对性别收入差距恶化的国家提出定向干预建议。企业社会责任部门与多元平等包容(DEI)顾问亦可利用该数据基准,对标同行业或同地区的收入公平性表现,设计更具包容性的薪酬结构。非政府组织在倡导残障人士权益时,能够引用具体国家的收入数据增强政策游说的说服力,而研究人员则能将其作为输入特征,训练机器学习模型以预测政策干预对收入差距的潜在影响。
衍生相关工作
该数据集衍生了多项标志性研究工作,涵盖了从描述性统计到因果推断的完整方法谱系。基于其面板结构,学者开发了专门针对残障收入差距的分解方法,如扩展Oaxaca-Blinder分解以分离性别与残障的交互效应。在时间序列预测领域,有工作利用该数据训练长短期记忆网络(LSTM)模型,预测亚洲各国收入差距的未来演变趋势。此外,该数据集催生了多个聚焦于东亚与东南亚的制度比较研究,其中学者将收入数据与ILO其他就业指标(如非正规就业率)关联,构建了多维度劳动力脆弱性指数。该数据还作为基准数据集,被收录于若干劳动经济学公开数据库(如ILOSTAT Explorer的工具包),推动了亚洲劳动市场研究的可复现性革命。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务