遇见数据集

electricsheepasia/asia-ilo-ear-smta-sex-cur-nb-average-monthly-earnings-of-stem-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲21个国家从2007年至2025年期间STEM(科学、技术、工程和数学)员工的月平均收入数据,共1,227个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,涵盖了按性别和货币分类的平均月收入指标(EAR_SMTA_SEX_CUR_NB)。数据集以表格形式组织,包含国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、时间(年份)、观测值、观测状态等列,并提供了数据质量说明,例如数据为年度频率,且当同一国家同年份有多个数据来源时,采用ILO选定的最佳来源。该数据集由Electric Sheep Asia重新打包,旨在为亚洲地区提供统一、机器学习就绪的数据层,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 1,227 observations of average monthly earnings of STEM (Science, Technology, Engineering, and Mathematics) employees across 21 Asia countries, spanning from 2007 to 2025. It covers the indicator Workers in STEM occupations (EAR_SMTA_SEX_CUR_NB), disaggregated by sex and currency. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, pulled via API and filtered to Asia ISO3 country codes. The dataset is structured in tabular format with columns including country code, country name, data source, indicator code, sex classification (total, male, female), time (year), observed value, observation status, and more. Data quality notes indicate annual frequency and use of ILO-selected best source when multiple sources exist for the same country-year. Repackaged by Electric Sheep Asia, it provides a unified, ML-ready data layer for Asia, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-smta-sex-cur-nb-average-monthly-earnings-of-stem-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API接口,获取了指标EAR_SMTA_SEX_CUR_NB(按性别和货币划分的STEM员工月均收入)的原始数据。数据经过区域筛选,仅保留亚洲21个国家的观测值,并利用ILO基于国际劳工统计学家会议(ICLS)定义的统一标准对各国劳动力调查、家庭收支调查等微观数据进行协调处理。最终由Electric Sheep Asia团队进行重封装,形成结构化的表格数据集,包含1227条观测记录,时间跨度覆盖2007年至2025年。
特点
该数据集的核心特色在于聚焦亚洲STEM领域劳动者的收入状况,提供了按性别(男性、女性、总计)拆分的月均收入数据,并记录货币类型,为分析性别收入差距提供精细维度。数据来源权威,由ILO官方统计部门负责协调,兼具跨国家(21个亚洲经济体)和跨年度(近20年)的纵向与横向比较能力。数据质量经过控制,包含来源标签和观测状态标志,便于用户识别数据衔接等异常情况,且以Parquet格式发布,适用于机器学习与时间序列分析。
使用方法
使用该数据集极为便捷,借助HuggingFace的datasets库,仅需调用load_dataset函数即可一键加载,自动转为Pandas DataFrame进行后续分析。用户可基于ref_area列筛选特定国家,通过indicator列定位目标指标,轻松绘制按时间序列变化的收入趋势图。此外,支持按性别、货币等分类变量进行分组聚合,或透视生成国家-年份矩阵,以适用于回归、分类及时序预测等多样化任务。数据集采用cc-by-4.0许可,使用时须引用原始来源及Electric Sheep Asia的封装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Asia重新整理并托管于HuggingFace平台,聚焦于亚洲21个国家2007至2025年间STEM(科学、技术、工程与数学)从业者按性别和货币分类的平均月收入。其核心研究问题在于揭示亚洲地区STEM领域内性别收入差距的时空异质性,为区域劳动经济学、性别平等政策及可持续发展目标(SDG)中体面工作指标的量化分析提供可靠数据支持。作为ILOSTAT数据库的子集,该数据集填补了亚洲STEM从业人员性别化收入微观数据在高频时间序列上的空白,对推动跨国比较研究及机器学习驱动的劳动市场建模具有重要价值。
当前挑战
该数据集在领域应用中面临的首要挑战是STEM职业定义的跨国差异性与数据可比性,不同国家对STEM范畴的界定标准不一,导致跨区域分析时需谨慎处理分类偏差。构建过程中,ILOSTAT虽通过国际劳工统计学家会议(ICLS)定义进行数据协调,但源自各国劳动力调查、行政记录等多源异构数据的质量参差不齐,部分观测值标记为“序列中断”或“临时性”,增加了时序一致性维护的难度。此外,仅涵盖年度频率的观测限制了收入波动的实时捕捉,且“最佳来源”筛选机制可能隐含样本选择性偏差,需在建模时予以充分考量。
常用场景
经典使用场景
在全球劳动力研究与性别经济学领域,该系统化整理的STEM(科学、技术、工程与数学)从业人员平均月收入数据,为学者提供了宝贵的亚洲区域跨国面板资料。经典使用场景包括基于性别的收入差异分析、STEM职业的薪资动态追踪,以及不同货币单位下的跨国收入比较。研究者可利用该数据集构建时间序列模型,探究亚洲21国从2007年至2025年间STEM行业薪酬演化趋势,从而揭示性别工资鸿沟在经济发展进程中的变化规律。
实际应用
在实际应用层面,该数据集具有显著的政策研究与商业咨询价值。政府部门、国际组织(如ILO与UNESCO)以及非政府机构可利用其分析结果制定针对性的STEM人才激励政策,例如性别配额调整和薪酬公平法案的评估。同时,跨国企业在进行亚洲市场薪酬基准设定时,能够参考该数据调整本地化福利策略,助力人力资源管理中性别平等目标的实现。这些应用直接推动了社会经济系统向更具公平性与可持续性的方向演进。
衍生相关工作
基于该数据集已衍生出一系列影响深远的研究工作,包括利用面板固定效应模型和分位数回归方法探讨性别收入差距的驱动因素,以及采用时间序列预测方法(如ARIMA与长短期记忆网络)预估未来STEM行业收入走势。部分学者更将其与教育投入、产业升级指标融合,构建复合指标体系以评估亚洲国家可持续发展目标(SDG 8与SDG 10)的达成进度。这些工作不仅深化了对性别的经济学理解,也为后续研究提供了方法论与实证基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务