遇见数据集

electricsheepasia/asia-ilo-ear-shra-sex-cur-nb-average-hourly-earnings-of-stem-employees-by-sex-a

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含1,110个观测值,涉及21个亚洲国家(如越南、柬埔寨、土耳其等),时间跨度为2007年至2025年,专注于“STEM员工按性别和货币划分的平均每小时收入”指标(代码为EAR_SHRA_SEX_CUR_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家。数据集包括结构化列,如国家代码、国家名称、数据来源、指标、性别分类(总计、男性、女性)、货币类型、观测年份、观测值(如收入数值)以及数据质量标志。数据以年度频率提供,并经过ILO的标准化处理,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Asia重新打包,以CC-BY-4.0许可证发布,旨在为亚洲地区提供机器学习就绪的数据层。

This dataset contains 1,110 observations across 21 Asian countries (e.g., Vietnam, Cambodia, Turkey), spanning from 2007 to 2025, focusing on the indicator Average hourly earnings of STEM employees by sex and currency (code EAR_SHRA_SEX_CUR_NB). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for Asian countries. It includes structured columns such as country code, country name, data source, indicator, sex disaggregation (total, male, female), currency type, observation year, observed value (e.g., earnings), and data quality flags. The data is provided at an annual frequency and harmonized by ILO, suitable for tasks like tabular classification, regression, and time-series forecasting. Repackaged by Electric Sheep Asia under a CC-BY-4.0 license, it aims to offer a machine-learning-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-shra-sex-cur-nb-average-hourly-earnings-of-stem-employees-by-sex-a 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API接口直接获取指标EAR_SHRA_SEX_CUR_NB的原始数据。Electric Sheep Asia团队对数据进行再处理,仅保留亚洲21个国家的观测记录,并依据国际劳动统计学家会议(ICLS)定义对调查微观数据进行统一标准化。数据集包含1110条观测,覆盖2007年至2025年间STEM从业者的平均时薪信息,每条记录均附有来源标签以确保可追溯性。
使用方法
用户可通过Hugging Face的datasets库直接加载数据集,使用load_dataset函数即可快速获取训练集,并转换为Pandas DataFrame进行下游分析。支持按国家代码筛选特定国家的时间序列,也可按指标排序后绘制随时间变化的趋势图。通过数据透视表功能,还能方便地构建以年份为行、国家为列的观察值矩阵,便于进行跨区域比较与建模研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)旗下的ILOSTAT数据库整理,于2025年经Electric Sheep Asia重新打包发布,聚焦亚洲21个国家在2007至2025年间STEM(科学、技术、工程与数学)从业者的平均小时工资,并按性别与货币进行细分。研究机构长期关注劳动力市场中性别工资差异与技能溢价问题,该数据集通过标准化指标EAR_SHRA_SEX_CUR_NB,为分析亚洲区域STEM领域的薪酬结构、性别平等进展及经济增长效益提供了珍贵的时序数据。作为ILOSTAT全球劳动力统计体系的重要延伸,其发布推动了区域间可比性研究,支持政策制定者评估科技人才激励机制的有效性。
当前挑战
该数据集面临的核心挑战在于:其一,解决STEM领域性别薪酬差距的精细度量问题——多数国家仅公开总体均值,缺乏按性别、货币与时间维度交叉的标准化数据,且亚洲各国统计体系与调查频率差异显著,影响跨国比较的准确性。其二,构建过程遇到多重障碍:数据源于各国劳动力调查与行政记录,需经过ILO协调统一的最小定义(如ICLS分类),但部分观测值标注了‘系列中断’或‘初步统计’状态;时间序列稀疏性突出(如印度仅覆盖2022–2025年),且国家间行数分布不均(越南达135条,而东帝汶仅36条),给基于平衡面板的统计建模带来显著困难。
常用场景
经典使用场景
该数据集汇集了21个亚洲国家2007年至2025年间STEM(科学、技术、工程与数学)从业人员按性别与货币分类的平均小时收入数据,共计1110条观测记录。其结构与元数据清晰,特别适用于跨国家、跨时间维度的面板数据分析,研究者可借此构建性别薪酬差距的效应模型,或检验国家经济发展水平与STEM领域薪酬结构之间的关联。数据按性别、货币种类及来源等维度进行精细划分,为开展多元回归、面板固定效应分析及时间序列聚类等经典计量任务提供了坚实基础。
解决学术问题
在劳动经济学与性别研究领域,该数据集直接回应了“亚洲各国STEM行业中性别薪酬差距的量化表征与演化趋势”这一核心学术命题。通过提供标准化、可比较的薪酬指标,它使研究者得以系统地评估亚洲新兴经济体与转型国家中,女性STEM从业者相对于男性的收入劣势程度及其跨期变化,弥补了既有研究多聚焦于西方发达经济体而忽视亚洲地区(尤其是发展中国家)的数据盲区。由此,该数据推动了关于制度环境、产业结构与性别平等政策对薪酬鸿沟影响的跨国实证研究。
实际应用
在实际应用层面,该数据集为国际组织、国家劳动部门与企业人力资源战略制定者提供了可靠的基准参照。例如,基于各国STEM从业者的时薪数据,政策制定者可识别出本国性别薪酬差距的痛点,设计差异化的最低工资调整、税收优惠或女性科技人才激励方案;企业亦能对照区域行业薪酬中位数,优化自身薪酬体系的公平性与竞争力。此外,它还可被嵌入实时劳动力市场监测仪表盘,辅助生成面向公众的年度薪酬平等评估报告,从而促进亚洲劳动市场的信息透明度与问责机制建设。
数据集最近研究
最新研究方向
在劳动力市场与性别平等的前沿研究中,该数据集为探究亚洲地区STEM(科学、技术、工程与数学)从业者的薪酬性别差异及货币折算效应提供了关键支撑。近年来,随着全球对科技人才争夺加剧及ESG(环境、社会和治理)投资的兴起,亚洲各国STEM领域的薪资公平性成为政策制定与学术辩论的焦点。该数据集覆盖21个亚洲国家长达近二十年的年度观测,使研究者能够突破传统个案分析的局限,运用时间序列预测与面板计量模型,系统评估货币汇率波动、经济周期以及劳动力市场结构性变迁对STEM性别薪酬鸿沟的动态影响。其价值在于,它不仅揭示了高收入国家与新兴经济体之间STEM薪资格局的演化轨迹,还通过统一的ILOSTAT统计框架,为跨国的性别就业质量与体面劳动目标的比较研究提供了可靠基准,进而推动亚洲本土化政策干预的实证根基。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务