遇见数据集

electricsheepasia/asia-ilo-emp-stem-sex-oc2-nb-employment-in-stem-occupations-by-sex-and-occupati

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲32个国家在2000年至2025年期间STEM(科学、技术、工程和数学)职业就业情况的统计数据,共5,702个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至亚洲地区,涵盖单一指标EMP_STEM_SEX_OC2_NB(按性别和职业分类的STEM职业就业人数,以千人为单位)。数据集采用国际劳工统计学家会议(ICLS)定义进行标准化,包含国家代码、年份、性别分类(总计、男性、女性)、观测值及数据来源等字段,适用于表格分类、回归分析和时间序列预测等机器学习任务。

This dataset contains 5,702 observations of STEM (Science, Technology, Engineering, and Mathematics) occupation employment statistics across 32 Asian countries from 2000 to 2025. Sourced from the International Labour Organization (ILO) ILOSTAT database, it is retrieved via API and filtered to Asian regions, covering a single indicator EMP_STEM_SEX_OC2_NB (Employment in STEM occupations by sex and occupation, in thousands). The data is harmonized using International Conference of Labour Statisticians (ICLS) definitions and includes fields such as country codes, year, sex disaggregation (total, male, female), observed values, and data sources, suitable for machine learning tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-stem-sex-oc2-nb-employment-in-stem-occupations-by-sex-and-occupati 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API接口直接获取原始数据,并依据亚洲ISO3国家代码进行地理区域筛选。在数据采集过程中,ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行标准化处理,确保了跨国家、跨时间序列的数据一致性。随后,Electric Sheep Asia团队对原始数据进行重新打包与格式统一,以Parquet格式发布,并附带了标准化的数据集卡片,旨在为研究人员和开发者提供即用型、机器学习就绪的亚洲劳动力统计数据。
特点
本数据集汇聚了2000年至2025年间32个亚洲国家STEM领域就业情况的5702条观测记录,覆盖了按性别(男性、女性、总计)及国际标准职业分类(ISCO-08)二级细分的就业人数(单位:千)。其核心特点在于多维度的分层结构,允许用户同时从性别、职业类别和时间维度进行深度剖析。此外,数据集详尽标注了原始调查来源(如劳动力调查)、数据质量标志(如不可靠、修订中)以及序列断裂等备注信息,为严谨的计量分析与稳健性检验提供了必要的透明度和可追溯性。
使用方法
用户可通过HuggingFace Datasets库以`load_dataset()`函数直接加载该数据集,并将其转换为Pandas DataFrame格式进行后续操作。典型的使用方式包括按特定国家(如印度尼西亚)筛选子集、针对`EMP_STEM_SEX_OC2_NB`这一核心指标绘制时间序列趋势图,或利用透视表功能构建国家-年份的数值矩阵,以便进行跨国家、跨性别的对比分析。数据集中包含的`sex`、`classif1`等分类维度列,使得精细化的分组统计与多维特征工程成为可能,极大便利了劳动经济学与性别平等相关议题的量化研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司(ILOSTAT)发布,经Electric Sheep Asia于2025年重新封装,聚焦亚洲32个国家2000至2025年间STEM(科学、技术、工程、数学)领域就业状况。作为劳动统计领域权威来源,ILOSTAT整合各国劳动力调查、行政记录等多种微观数据,依据国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集共包含5,702条观测记录,核心研究问题在于揭示性别与职业维度下STEM就业的结构性特征,为区域劳动力市场分析、性别平等评估及可持续发展目标(SDG)监测提供数据支撑。其影响力体现在推动亚洲欠发达经济体的劳动统计可比性,赋能跨国比较与政策制定。
当前挑战
该数据集面对的领域挑战包括:其一,亚洲各国劳动力调查方法、分类标准与数据质量参差不齐,ILO虽实施协调但仍存在定义差异,需借助元数据标记(如`source.label`、`obs_status`)追踪数据来源与可靠性。其二,构建过程中需应对多来源数据融合带来的结构异构问题,如性別细分(SEX_T/M/F)与职业分类(ISCO-08)的连贯性维护,以及存在断点(break in series)与方法论修订等时序不连续性。此外,部分国家观测稀疏(如仅有少数年份数据)或观测值标记为不可靠,增加了建模与推断的难度。
常用场景
经典使用场景
在劳动经济学与教育经济学交叉研究领域,该数据集最经典的使用场景在于量化分析亚洲地区科学、技术、工程与数学(STEM)行业就业的性别分化格局与职业层级差异。研究者可借助其涵盖32国、跨越四分之一世纪的年度观测数据,结合性别(SEX_T/SEX_M/SEX_F)与职业(ISCO-08二级分类)双重细分维度,系统构建STEM就业的时空演变轨迹,从而揭示不同经济体在技术人才储备与劳动力性别平等进程中的结构性特征。
解决学术问题
该数据集精准回应了关于亚洲发展中经济体STEM劳动力市场可比较分析的长期学术需求,有效解决了因各国统计标准不一而导致的跨国研究壁垒。通过统一遵循国际劳工组织ICLS定义进行数据协调,它使学者得以突破单一国家案例的局限,首次在区域尺度上检验女性在STEM领域代表性不足的普遍假说,并量化评估教育扩张、产业升级与性别平等政策对技术岗位就业结构的具体影响,为发展经济学与性别研究的理论对话提供扎实的实证基础。
衍生相关工作
围绕此核心数据衍生出一系列富有影响力的学术探索,例如部分研究将其与教育统计数据库(如UNESCO的SDG 4数据)融合,构建“STEM教育-就业”转化效率的计量模型;另有工作引入面板数据回归方法,系统剖析制度环境(如产假政策、反歧视立法)对女性STEM就业的调节效应。更为前沿的尝试则聚焦于利用时序预测算法(如Prophet或LSTM),基于2000年以来的历史轨迹外推2030年亚洲各国STEM劳动力性别构成的演进路径,为可持续发展目标(SDG 5与SDG 9)的监测提供可操作的预测工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务