遇见数据集

electricsheepasia/asia-ilo-emp-stem-sex-how-nb-employment-in-stem-occupations-by-sex-and-weekly-h

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含4,670个观测值,涉及30个亚洲国家,时间跨度为2007年至2025年,涵盖1个独特指标。数据主题为“按性别和每周实际工作小时数划分的STEM职业就业情况(以千计)”,源自国际劳工组织(ILO)的ILOSTAT统计数据库。数据集通过API获取,并过滤为亚洲国家代码,提供了详细的列结构,包括国家代码、国家名称、数据来源、指标代码、性别分类、时间年份、观测值及其状态等。数据以年度频率发布,并包含数据质量说明,如使用ILO选择的“最佳来源”以及分类列的非空条件。数据集适用于表格分类、回归和时间序列预测等任务,旨在支持机器学习和研究使用。

This dataset contains 4,670 observations of Workers in STEM occupations data across 30 Asia countries, spanning 2007–2025, covering 1 distinct indicator. The data is sourced from ILOSTAT, the ILOs central statistics database, and focuses on employment in STEM occupations by sex and weekly hours actually worked (in thousands). It includes detailed schema with columns such as country codes, source information, indicator codes, sex disaggregation, time years, observed values, and status flags. The data is annual frequency and is repackaged by Electric Sheep Asia for ML-ready use in tabular and time-series tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-stem-sex-how-nb-employment-in-stem-occupations-by-sex-and-weekly-h 数据集图片
构建方式
该数据集的构建依托于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接获取指标编码为EMP_STEM_SEX_HOW_NB的原始数据,并依据亚洲ISO3国家代码进行地理过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、住户收入调查及行政记录等微观数据进行标准化处理,确保跨国家与跨年度指标的可比性。数据集中每一条观测均保留原始来源标签以追踪数据溯源,共整合了来自30个亚洲国家的4,670条观测记录。
特点
该数据集以年度频率记录了亚洲30个国家2007年至2025年间STEM领域就业人数,按性别与每周实际工作小时数进行细分,包含总人数、男性及女性三个维度。其核心指标为单一但高度结构化的观测值,辅以详尽的元数据列,如观测状态标记、中断序列注释及方法论修订说明,便于使用者评估数据质量。数据集的独特之处在于其对ILOSTAT官方数据进行了机器学习的友好化重封装,以表格格式统一了分类与回归任务,并支持时间序列分析。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集,将其转换为Pandas DataFrame后进行探索性分析。例如,可依据国家代码筛选特定国家的子集,或按时间排序以绘制单一指标的变化曲线。对于面板数据分析,可利用pivot_table功能将数据重塑为国家与年份的矩阵形式,便于进行跨国家比较。数据集内丰富的标签列与状态标记字段允许用户根据观测可靠性或方法论一致性进行过滤,从而适配不同的统计建模需求。
背景与挑战
背景概述
在亚太地区经济结构转型与科技创新的双重驱动下,STEM(科学、技术、工程与数学)领域的劳动力构成已成为衡量区域人力资本质量的关键指标。由国际劳工组织(ILO)统计司构建并经由Electric Sheep Asia于2025年重新打包的asia-ilo-emp-stem-sex-how-nb数据集,聚焦于亚洲30个国家在2007至2025年间STEM职业的就业人数及其按性别和周实际工时的分布情况。该数据集基于ILOSTAT这一全球劳动统计权威数据库,从各国劳动力调查等源头数据中提取并标准化了4,670条观测值,旨在揭示地区内STEM就业的性别差异与时序演变趋势。其发布为发展经济学、劳动社会学及公共政策研究者提供了横跨近二十年的高颗粒度面板数据,对于评估女性在STEM领域参与度、比较各国劳动力政策效果以及构建预测模型具有不可或缺的支撑作用。
当前挑战
该数据集所应对的首要领域挑战在于,亚洲地区STEM就业统计长期面临定义不统一、时序断裂以及按性别和工时维度交叉细分的缺失,导致跨国比较与趋势分析举步维艰。构建过程中,数据权威性挑战体现为需从ILOSTAT的海量多源数据中精准甄别并提取仅针对亚洲国家的指标,并应对不同来源调查(如劳动力调查与行政记录)之间方法论差异带来的可比性问题;数据质量维度上,观测值中存在的不可靠标志(如'U'状态)以及系列中断提示(如方法论修订导致的断裂),要求清洗与插补策略必须兼顾跨时间一致性;此外,数据集虽覆盖30国,但各国观测密度悬殊(如伊朗411条vs.巴基斯坦144条),稀疏性与非平衡性为后续建模带来了显著的样本偏差挑战。
常用场景
经典使用场景
该数据集在学术研究中常被用作跨国家、跨时间维度的STEM劳动力分析基石。研究者可基于4,670条观测记录与30个亚洲国家2007至2025年的时间序列数据,构建性别与周工时交叉分类的统计模型,以揭示亚洲区域STEM就业结构的演变轨迹。其结构化的表格数据天然支持分类与回归任务,亦可用于时间序列预测,通过历史趋势外推未来STEM劳动力配置格局。
解决学术问题
该数据集有效破解了亚洲地区STEM就业数据碎片化与不可比较的困局。ILOSTAT的标准化方法论将各国来源迥异的调查微观数据统一至国际劳工统计学家会议定义框架下,使学者能规避跨国比较中常见的口径偏差问题。它解决了三个核心学术挑战:量化性别维度下STEM就业的纵向变迁、评估周工时分布对STEM劳动力供给的调节效应,以及识别亚洲各国STEM吸纳能力的分化路径,为劳动经济学与性别研究领域提供了可信的实证根基。
衍生相关工作
该数据集的发布催生了一系列衍生性学术工作,尤其在劳动力市场预测与不平等测度方向。基于此数据,研究者构建了亚洲STEM职业的性别隔离指数,并利用面板回归模型检验了教育扩张与产业升级对STEM女性就业率的异质性影响。部分工作将其与时序预测模型结合,开发出适应劳工统计时序特征的深度学习框架,实现了对亚洲主要经济体STEM就业波动的提前预警。此外,该数据还支撑了跨国比较研究,探讨了伊斯兰金融体系与STEM就业结构的交互作用,拓展了制度经济学与人力资源管理的交叉视野。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务