遇见数据集

electricsheepasia/asia-ilo-ees-stem-sex-ins-nb-employees-in-stem-occupations-by-sex-and-public-pr

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲30个国家从2000年至2025年关于STEM(科学、技术、工程和数学)职业员工按性别和公共/私营部门分类的统计数据,单位为千人。数据集共有2,076条观测值,涵盖1个具体指标(EES_STEM_SEX_INS_NB),数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过Harmonization处理以确保一致性。数据集以表格形式呈现,包括国家代码、年份、性别分类、观测值等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 2,076 observations of employees in STEM occupations by sex and public/private sector (in thousands) across 30 Asia countries, spanning from 2000 to 2025. It covers one distinct indicator (EES_STEM_SEX_INS_NB) and is sourced from the ILOSTAT database of the International Labour Organization (ILO), with data harmonized using ICLS definitions. The dataset is provided in a tabular format with columns for country codes, years, sex disaggregation, observed values, and other metadata, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-stem-sex-ins-nb-employees-in-stem-occupations-by-sex-and-public-pr 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API获取指标代码为EES_STEM_SEX_INS_NB的原始数据,并依据亚洲ISO3国家代码进行地域过滤而构建。ILOSTAT遵循国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查及行政记录等原始微观数据进行协调与标准化处理,源数据信息在source.label列中得以完整保留。最终由Electric Sheep Asia团队重新整理打包,形成包含30个亚洲国家、时间跨度覆盖2000年至2025年的2,076条观测记录的数据集。
特点
该数据集聚焦于亚洲地区STEM(科学、技术、工程、数学)职业的就业人数,并按照性别(男性、女性、总计)及公共/私营部门进行多维细分。数据以千人为计量单位,提供单一核心指标,同时包含观测状态标志(如临时、不可靠)及系列中断等注释信息,便于质量评估。时间频率为年度数据,且ILO已为每个国家-年份组合筛选出最佳数据源。数据集结构规整,包含18个字段,涵盖国家代码、指标标签、分类维度及数值等要素,适合进行跨国家、跨时间的比较分析。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,使用load_dataset命令即可快速获取训练集数据,并转换为Pandas DataFrame进行分析。支持按国家代码过滤特定国家数据,或针对单一指标进行时间序列排序与可视化。此外,可借助pivot_table函数将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析或机器学习建模。该数据集适用于分类、回归及时间序列预测等任务,为研究亚洲劳动力市场中STEM人才的性别差异与部门分布提供了便捷的数据基础。
背景与挑战
背景概述
STEM领域从业人员的性别与部门分布是衡量区域科技发展水平与劳动力市场公平性的核心指标。该数据集由国际劳工组织(ILO)基于其ILOSTAT统计数据库整理,并经Electric Sheep Asia于2025年重新封装发布,涵盖2000年至2025年间30个亚洲国家的2076条观测记录。核心研究问题聚焦于亚洲地区STEM职业中不同性别及公共/私营部门的就业人数分布,旨在为劳动经济学、性别研究与区域发展政策提供高质量数据支撑。作为ILO全球劳动统计体系的重要组成,该数据集对探讨亚洲劳动力结构转型及可持续发展目标中的体面工作指标具有显著参考价值。
当前挑战
该数据集面临双重挑战。在领域问题层面,亚洲各国对STEM职业的定义与统计口径尚未统一,ILO虽依据国际劳工统计学家会议(ICLS)标准进行协调,但跨国可比性仍受限于原始调查方法的差异与数据标记的不一致性(如观测状态存在‘不可靠’标记)。在构建过程中,需从ILOSTAT REST API中提取原始数据并过滤至亚洲国家代码,同时处理多来源数据在同一国家-年份上的冲突,选择ILO认定的‘最佳来源’作为标准值。此外,数据频率仅限年度,排除月度或季度序列,且部分分类维度(如性别的三种取值)在细分层级上存在空缺,增加了时间序列分析与多维度建模的复杂性。
常用场景
经典使用场景
在劳动经济学与教育政策研究领域,该数据集广泛应用于分析亚洲地区STEM(科学、技术、工程、数学)领域就业的性别差异与部门分布特征。研究者可借助其按性别和公私部门划分的员工数量统计,构建面板数据模型,探讨经济发展阶段、教育投入水平与女性在STEM领域代表性之间的关联。数据集覆盖30个亚洲国家长达25年的时间跨度,为跨国比较研究和时间序列分析提供了扎实的数据基础,常被用于评估各国产业政策对STEM人才结构变迁的长期影响。
衍生相关工作
基于该数据集,学术界已衍生出多项具有影响力的研究工作。部分学者将其与ILOSTAT中的其他劳动力指标(如工资差距、行业就业结构)相结合,构建了预测亚洲各国STEM劳动力供需动态的综合模型。另有研究利用该数据的时间序列特征,系统评估了国家科技创新政策对女性STEM就业率的长期因果效应。此外,该数据集还常被用于验证和校准全球STEM人才流动模型中的区域参数,成为劳动经济学、性别研究和科技政策交叉领域的重要数据基准,推动了跨学科实证分析的深入发展。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区STEM(科学、技术、工程、数学)领域从业人员的性别差异与公共/私营部门分布,为劳动经济学与性别平等研究提供了关键的时间序列面板数据。当前前沿方向包括利用该数据构建机器学习模型预测亚洲各国的STEM劳动力结构性变化,并结合ILO的体面劳动指标(SDG 8)与性别平等指标(SDG 5)量化数字化浪潮下的职业性别隔离。特别是在后疫情时代全球产业链重构的背景下,该数据助力分析东南亚与南亚新兴经济体(如越南、柬埔寨)从制造业向知识密集型服务业转型中STEM岗位的增长轨迹。此外,通过融合ILOSTAT的微观调查元数据(如数据来源标志与中断序列注解),研究者可评估方法变更对面板一致性的影响,从而改善时间序列预测的鲁棒性。该数据集经由Electric Sheep Asia标准化为Parquet格式并托管于HuggingFace,极大降低了亚洲区域劳动统计数据的获取门槛,推动了跨学科实证研究的可复现性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务