遇见数据集

electricsheepasia/asia-ilo-emp-stem-sex-ec2-nb-employment-in-stem-occupations-by-sex-and-economic

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲32个国家从2000年到2025年的31,382个观察值,覆盖1个指标:按性别和经济活动(ISIC第2级)细分的STEM(科学、技术、工程和数学)职业就业数据,数据单位为千。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过处理和过滤以专注于亚洲地区,并包括国家代码、年份、性别分类、经济活动和观察值等列。

This dataset contains 31,382 observations across 32 Asian countries from 2000 to 2025, covering 1 indicator: employment in STEM (Science, Technology, Engineering, and Mathematics) occupations by sex and economic activity at ISIC level 2, in thousands. The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, processed and filtered for Asia, and includes columns such as country code, year, sex disaggregation, economic activity, and observed values.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-stem-sex-ec2-nb-employment-in-stem-occupations-by-sex-and-economic 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过调用其REST API接口获取原始指标数据,并依据亚洲ISO3国家代码进行地理过滤。原始数据基于各国劳动力调查、家庭收入调查及行政记录等多元来源,经ILO统计部门依照国际劳动统计学家会议(ICLS)定义进行统一协调处理,确保了跨国可比性。最终由Electric Sheep Asia团队进行二次封装与标准化处理,转化为符合HuggingFace Datasets规范的Parquet格式,以便机器学习流水线直接调用。
特点
数据集汇集了2000至2025年间32个亚洲国家关于STEM职业就业的年度观测值,共计31,382条记录,核心指标涵盖按性别和经济活动(ISIC二级分类)划分的就业人数(单位:千)。其特色在于提供多维度分类变量,包括性别(总、男、女)以及经济部门细分,并附有数据来源标签和观测状态标记(如不可靠、序列断裂等),为研究者提供了充分的数据质量警示与溯源能力。
使用方法
用户可通过`datasets`库的`load_dataset()`函数直接加载该数据集,并将其转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码筛选特定国家子集、对单一指标按时间排序绘制时间序列曲线,或利用透视表功能构建国家×年份的观测值矩阵。该数据集适用于监督学习(分类与回归)以及时间序列预测任务,为研究亚洲地区劳动力市场中STEM人才分布的性别差异与行业动态提供了结构化数据基础。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,并由Electric Sheep Asia在HuggingFace平台重新包装,旨在系统记录亚洲32个国家2000至2025年间STEM(科学、技术、工程与数学)领域的就业情况。数据集包含31,382条观测,涵盖按性别和经济活动(ISIC二级分类)划分的就业人数,来源于ILOSTAT数据库——全球劳动统计的核心权威。其核心研究问题在于揭示亚洲区域STEM劳动力市场在性别维度的分布特征与动态演变,为政策制定者、经济学家与社会科学研究者提供跨时空比较的基础数据。该数据集填补了亚洲发展中国家STEM就业数据长期碎片化的空白,对理解区域技术创新、劳动力结构转型及可持续发展目标(SDG)中的体面工作指标具有重要推动作用。
当前挑战
数据集的构建面临多重挑战。首先,在领域问题层面,亚洲各国劳动调查方法、统计口径与数据质量参差不齐,ILOSTAT虽通过国际劳工统计学家会议(ICLS)标准进行协调,但部分国家观测值被标记为“不可靠”(如状态标志“U”),影响跨国产出的可比性与建模置信度。其次,在构建过程中,数据整合需处理多源异构性,包括来自劳动力调查、行政记录等的混合来源,且存在时间序列断裂(如“方法修订”注释)与年度频率的限制,无法捕捉日内或季度波动。此外,性别与经济活动交叉维度的高细粒度也导致部分稀疏单元格的数据缺失,增加了时间序列预测与分类任务的复杂性。
常用场景
经典使用场景
在劳动经济学与教育政策研究中,该数据集常用于分析亚洲地区STEM(科学、技术、工程、数学)职业的性别分布与经济活动关联。研究者可基于31,382条涵盖32国、2000至2025年的年度观测值,构建面板数据模型,探讨女性在STEM领域就业比例的时间演变趋势,或对比不同经济发展阶段国家间STEM就业结构的异质性。数据集提供按性别(总、男、女)和ISIC二级经济活动分类的维度,为定量评估政策干预效果(如STEM教育激励计划)提供了坚实的数据基础。
衍生相关工作
该数据集衍生出多项经典研究与实践工作。例如,基于ILOSTAT的STEM就业数据,已有学者构建了跨国面板回归模型,检验了科研经费投入、女性高等教育入学率与STEM职业性别差异之间的因果关系。在方法论层面,部分工作聚焦于处理数据中因调查方法修订导致的序列断裂(如‘Break in series’标识),开发了适用于ILO官方统计的插补与稳健估计技术。此外,数据驱动型平台如Electric Sheep Asia的再封装版本,被集成至HuggingFace Datasets生态后,大幅降低了非传统编程背景研究者(如社会科学领域)使用PyTorch等工具进行机器学习建模的门槛,催生了利用Transformer或时序卷积网络预测亚洲各国STEM就业趋势的前沿探索。
数据集最近研究
最新研究方向
当前,该数据集为亚洲地区STEM就业的性别与经济结构分析提供了关键支撑。前沿研究聚焦于利用此细粒度时序面板数据,结合因果推断与机器学习方法,探究不同经济活动中STEM从业者的性别差异演化规律。热点议题包括数字经济崛起如何重塑STEM劳动力市场的性别鸿沟,以及后疫情时代各国产业政策(如半导体与AI战略)对女性STEM参与率的异质性影响。其基于ILOSTAT权威来源和统一的ISIC分类标准,使得跨国比较与长期趋势建模成为可能,为联合国可持续发展目标(SDG 8和SDG 5)的监测提供了严谨的量化证据,对制定精准的劳动市场干预政策具有重要指导意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务