遇见数据集

electricsheepasia/asia-ilo-emp-stem-sex-edu-nb-employment-in-stem-occupations-by-sex-and-educatio

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲30个国家从2000年至2025年期间,按性别和教育程度划分的STEM(科学、技术、工程和数学)职业就业人数的统计数据,共计3,225个观测值,涵盖1个独特指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过标准化处理,以表格形式呈现,适用于表格分类、回归和时间序列预测等机器学习任务。数据集包括国家代码、年份、性别分类、教育程度分类、观测值及其状态等列,提供了对亚洲地区STEM劳动力市场的详细洞察。

This dataset contains 3,225 observations of employment in STEM occupations by sex and education (in thousands) across 30 Asia countries, spanning from 2000 to 2025, covering 1 distinct indicator. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), repackaged for machine learning use, and presented in tabular format suitable for tasks such as tabular classification, regression, and time-series forecasting. The data includes columns for country codes, years, sex disaggregation, education classification, observed values, and status flags, offering detailed insights into the STEM labor market in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-stem-sex-edu-nb-employment-in-stem-occupations-by-sex-and-educatio 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过调用其REST API接口(`EMP_STEM_SEX_EDU_NB`指标)直接提取STEM领域就业数据,并依据ISO 3166-1 alpha-3编码筛选出30个亚洲国家的观测记录。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、住户收入调查等原始微观数据进行统一协调处理,形成标准化的年度指标序列。数据以Parquet格式打包,通过Electric Sheep Asia管道进行架构标准化后发布,涵盖2000年至2025年间共3,225条观测数据。
特点
数据集聚焦'STEM职业就业人数'这一核心指标,按性别(总、男、女)和受教育程度进行多维细分,提供3,225条高维度观测记录。其显著优势在于覆盖30个亚洲国家长达25年的跨年度时间序列,且每条记录包含源数据来源标识(`source.label`),允许用户追溯原始调查方法。数据标注了观测状态标志(如不可靠)和断点注释,有助于研究者识别数据质量波动。作为单一主题的标准化面板数据,它便于进行跨国对比分析和时间序列建模。
使用方法
用户可通过HuggingFace的`datasets`库中的`load_dataset()`函数直接加载该数据集,返回的DataFrame格式兼容主流Python数据分析生态。典型使用场景包括:按国家代码(如`ref_area='IDN'`)筛选特定国家的子集进行局部分析;按时间排序绘制单一指标的折线图,观察亚洲各国STEM就业的长期趋势;或利用`pivot_table`将数据重塑为国家×年份的交互矩阵,便于构建面板数据回归模型。数据以年度频率更新,配合`obs_status`列可过滤低质量观测值以提升分析稳健性。
背景与挑战
背景概述
在全球劳动力市场转型的宏观背景下,STEM(科学、技术、工程与数学)领域的就业结构已成为衡量区域创新能力和人力资本质量的关键指标。由国际劳工组织(ILO)于2025年通过其核心数据库ILOSTAT发布的该数据集,聚焦亚洲30个国家2000至2025年间按性别与教育程度划分的STEM从业人数,共计3225条观测记录。Electric Sheep Asia团队对该数据进行了清洗、标准化与重新封装,使其便于机器学习领域的直接调用。该数据集不仅为分析亚洲各国在STEM领域的劳动力参与差异提供了纵向时间序列支撑,更对推动区域人力资本研究、劳动经济学模型构建以及性别平等政策评估具有重要参考价值。
当前挑战
数据集所应对的领域挑战在于,亚洲各国STEM劳动力的规模与结构长期缺乏细粒度、跨国家、可比较的标准化数据,多数研究依赖于碎片化的国家统计或抽样调查,难以进行有效的时间序列分析与区域性横向对比。在构建过程中,ILOSTAT需将各国来源不一、定义各异的劳动力调查微观数据统一至国际劳工统计学家会议(ICLS)的标准框架下,涉及数据清洗、指标映射和缺失值处理等复杂步骤。此外,不同国家对教育程度和性别的分类标准存在差异,数据质量标注(如“不可靠”状态)及方法论修订带来的序列断点问题,也给后续的机器学习建模与因果推断任务带来了额外挑战。
常用场景
经典使用场景
该数据集汇聚了2000年至2025年间亚洲30个国家的STEM(科学、技术、工程、数学)职业就业人数,按性别和受教育程度进行了精细分层,共计3225条观测记录。其最经典的使用场景在于开展跨国、跨时段的劳动经济计量分析,研究者可借助该数据揭示亚洲各国在STEM人才储备、性别平等及教育回报率等方面的宏观趋势与差异。通过时间序列建模,可精准刻画各国STEM就业的演进轨迹,为区域人力资源开发战略提供实证支撑。
衍生相关工作
在学术衍生产出方面,该数据集被广泛应用于构建劳动力市场预测模型、性别平等指数以及教育回报率评估框架。常见衍生工作包括:基于面板固定效应模型探究STEM就业中的性别差异影响因素;利用机器学习方法对亚洲各国未来STEM人才缺口进行时序外推;以及将其纳入多源数据融合分析,考察贸易开放、外商直接投资与STEM就业结构之间的互动关系。这些工作不仅丰富了劳动经济学的知识图谱,也为政策仿真提供了可复用的数据基础。
数据集最近研究
最新研究方向
在亚洲劳动市场研究中,该数据集为STEM领域就业的性别与教育维度交叉分析提供了关键支撑,尤其契合当前全球对科技人才短缺与性别平等议题的关注。前沿研究利用其2000至2025年的时间跨度与跨国面板结构,探索亚洲各国STEM职业女性参与率的演变趋势及其与教育水平间的动态关联。结合ILOSTAT的标准化方法论,数据集支持精准剖析不同教育层次下性别就业差距的收敛或分化模式,为评估亚洲区域在可持续发展目标(SDG)框架下推动包容性增长的进展提供了量化基础。相关工作已拓展至时变因果推断与政策效果评估,揭示技术转型期劳动市场结构的深层变迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务