遇见数据集

electricsheepasia/asia-ilo-emp-stem-sex-jbt-nb-employment-in-stem-occupations-by-sex-and-working

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲30个国家从2007年至2025年期间,按性别和工作时间安排划分的STEM(科学、技术、工程和数学)职业就业数据(以千计)。数据集包含2068个观测值,覆盖一个核心指标:EMP_STEM_SEX_JBT_NB,即按性别和工作时间安排划分的STEM职业就业人数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过亚洲国家代码过滤处理。数据集提供了详细的列结构,包括国家代码、国家名称、数据来源、指标代码、性别分类、工作时间安排分类、观测年份、观测值、数据状态标志和相关注释等,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并经过ILO的标准化处理,确保国际可比性。

This dataset contains employment data in STEM (Science, Technology, Engineering, and Mathematics) occupations by sex and working time arrangement (in thousands) for 30 Asian countries from 2007 to 2025. It includes 2,068 observations and covers one key indicator: EMP_STEM_SEX_JBT_NB, which represents employment in STEM occupations disaggregated by sex and working time arrangement. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asian ISO3 country codes. The dataset features a detailed schema with columns such as country code, country name, data source, indicator code, sex disaggregation, working time arrangement classification, observation year, observed value, observation status flags, and related notes. It is suitable for tabular classification, regression, and time-series forecasting tasks, with annual frequency data harmonized by ILO for international comparability.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-stem-sex-jbt-nb-employment-in-stem-occupations-by-sex-and-working 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接获取EMPLOYMENT IN STEM OCCUPATIONS BY SEX AND WORKING TIME ARRANGEMENT指标数据,并严格筛选至亚洲地区ISO3国家代码。ILOSTAT依据国际劳工统计学家会议定义对原始调查微观数据进行统一整合,数据来源在source.label列中予以标注以确保可追溯性。Electric Sheep团队对原始数据进行了重新封装,形成了包含2068条观测值、覆盖30个亚洲国家、时间跨度从2007年至2025年的标准化表格数据集。
特点
本数据集的核心特点在于其精准聚焦STEM领域就业情况,提供按性别(总人数、男性、女性)和工作时间安排(总计)细分的就业人数(单位:千)。数据结构包含ref_area、sex、time、obs_value等16个字段,其中obs_status和note_indicator列标注了数据可靠性和方法变更等元信息,便于使用者进行数据质量评估。数据集覆盖30个亚洲国家且时间跨度较长,能够支持区域间比较及时间序列分析,并以CC-BY-4.0许可协议开放,兼具学术严谨性与可用性。
使用方法
数据集可通过HuggingFace Datasets库便捷加载,使用load_dataset函数即可获取并转换为pandas DataFrame进行分析。用户可按国家代码(如ref_area为IDN)筛选特定国家数据,利用time和obs_value列绘制STEM就业人数的时间序列图,或借助pivot_table将数据重塑为国家×年份的矩阵形式以进行横向对比。数据集中sex和classif1等细分维度列仅在指标发布对应分类时非空,使用时需注意筛选有效子集。建议引用原始ILO数据来源及Electric Sheep Asia的重新封装版本。
背景与挑战
背景概述
在全球科技竞争日益激烈的背景下,科学、技术、工程与数学(STEM)领域的劳动力分布成为衡量区域创新能力与经济发展潜力的关键指标。该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT统计数据库创建,并由Electric Sheep Asia在HuggingFace平台重新封装发布,聚焦亚洲地区STEM职业的就业状况。数据集涵盖2007至2025年间30个亚洲国家的2,068条观测记录,按性别与工作时间安排进行细分,旨在系统量化亚洲各国在STEM领域的劳动力参与特征与结构性差异。其发布填补了亚洲区域在标准化、长期追踪的STEM就业数据方面的空白,为劳动力经济学、性别平等研究及国际比较分析提供了高质量的基准资源,有力推动了相关领域的数据驱动研究。
当前挑战
该数据集所解决的领域挑战在于,STEM就业数据在亚洲长期存在碎片化、统计口径不一致及性别维度缺失等问题,难以支撑精准的区域比较与政策制定。数据构建过程中面临多重困难:首先,各国原始调查数据的采集频率、问卷设计及职业分类标准各异,ILO需依据国际劳工统计学家会议(ICLS)定义进行严格统一,确保跨国产出可比;其次,部分年份或国家的数据存在来源变更与方法论修订,如断点序列需在标注中明确记录,增加了数据清洗与质量控制的复杂性;此外,数据中观测状态标记为“不可靠”的记录提示统计精度受限,而多源择优机制亦引入主观选择,对下游建模的鲁棒性构成隐性挑战。
常用场景
经典使用场景
该数据集汇聚了亚洲30个国家2007至2025年间STEM领域就业人口按性别与工作时间安排划分的详细数据,共计2068条观测记录。其最经典的应用场景在于时间序列分析与面板数据建模,研究者可借助该数据集对亚洲各国STEM就业的长期演变趋势进行纵向刻画,揭示不同性别群体在科技行业中的参与度变迁,为跨国家、跨时期的比较研究提供坚实的数据基础。
衍生相关工作
围绕该数据集已衍生出多项具有影响力的研究工作。基于ILOSTAT框架,该数据与全球其他区域的STEM就业统计相衔接,支持构建跨国性别就业差异的元分析模型。此外,该数据集启发了关于劳动统计中分类标准与数据可比较性的方法论探讨,促进了面向亚洲发展中国家的STEM劳动力预测模型的开发,推动了劳动经济学与数据科学的交叉融合。
数据集最近研究
最新研究方向
在区域劳动力市场与可持续发展议程交织的前沿,该数据集为解析亚洲STEM领域就业的性别分化与工时配置演变提供了关键计量锚点。依托国际劳工组织统一化统计框架,研究前沿聚焦于利用此跨30国、近20载的面板数据,量化第四次工业革命背景下技术密集型岗位的就业弹性,并追踪疫情后‘她力量’在STEM行业的恢复轨迹与结构性瓶颈。该数据与联合国SDG 8(体面工作)及SDG 5(性别平等)的监测需求深度契合,其时间序列特性催生了基于变点检测的就业拐点分析、以及融合宏观政策变量的因果推断模型,为探索亚洲新兴经济体人力资本转型与性别数字鸿沟弥合路径提供了实证基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务