遇见数据集

electricsheepasia/asia-ilo-ees-stem-sex-jbc-nb-employees-in-stem-occupations-by-sex-and-type-of-j

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是关于亚洲地区STEM(科学、技术、工程和数学)职业员工的数量统计,按性别和合同类型进行细分,单位为千。数据集包含1,827个观测值,覆盖25个亚洲国家,时间跨度为2000年至2025年,核心指标为EES_STEM_SEX_JBC_NB,即按性别和合同类型划分的STEM职业员工数(千)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API直接获取,并经过筛选以仅包括亚洲国家。数据集结构包括多个字段:如国家代码(ref_area)、国家名称(ref_area.label)、数据来源(source和source.label)、指标代码和标签(indicator和indicator.label)、性别分类(sex和sex.label)、合同类型分类(classif1和classif1.label)、年份(time)、观测值(obs_value)、观测状态(obs_status和obs_status.label)以及相关注释(note_indicator和note_source)。数据以年度频率发布,并提供了数据质量说明,例如ILO会选择最佳来源来处理同一国家×年份的多个数据源。数据集适用于表格分类、回归和时间序列预测等任务,可用于分析亚洲地区STEM就业趋势、性别差异和合同类型分布。使用示例包括加载数据、按国家筛选、绘制时间序列图以及创建国家×年份矩阵。数据集遵循CC-BY-4.0许可,由Electric Sheep Asia重新打包发布,旨在为亚洲地区提供统一的、适合机器学习的数据层。

This dataset contains 1,827 observations of Employees in STEM occupations by sex and type of job contract (thousands) data across 25 Asia countries, spanning from 2000 to 2025, covering 1 distinct indicator (EES_STEM_SEX_JBC_NB). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, pulled directly via its REST API and filtered to Asia ISO3 country codes. It includes detailed columns such as country codes, indicator labels, sex disaggregation (total, male, female), contract type classifications, observation years, values, and status flags. The dataset is designed for tabular classification, regression, and time-series forecasting tasks, providing insights into STEM employment trends in Asia. It is repackaged by Electric Sheep Asia for machine learning readiness, with usage examples for data loading, filtering, and analysis. The license is CC-BY-4.0, and proper citation of both ILO and the repackaging is required.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-stem-sex-jbc-nb-employees-in-stem-occupations-by-sex-and-type-of-j 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT中央统计数据库,聚焦于亚洲地区STEM(科学、技术、工程与数学)职业的从业人员数量,按性别与劳动合同类型进行细致划分。数据通过ILOSTAT REST API直接获取,并依据ILO统计学家国际会议(ICLS)定义进行协调与整合,随后筛选出亚洲25个国家的ISO3代码区域。最终收录了1827条观测记录,涵盖2000年至2025年的时间跨度,确保了数据在区域与时间上的广泛覆盖。
特点
数据集以单一核心指标'EES_STEM_SEX_JBC_NB'(单位为千人)为轴心,提供了丰富的维度划分,包括性别(男性、女性、总计)与合同类型(如总合同、非标准合同等)。每条记录附带源数据标签、观测状态标志以及可能的数列中断注释,极大增强了数据的可追溯性与质量透明度。这种精细化的分层设计,使得研究者能够深入剖析亚洲各国在STEM就业领域的性别差异与雇佣形态演变。
使用方法
用户可通过HuggingFace的`datasets`库便捷加载数据,调用`load_dataset('electricsheepasia/asia-ilo-ees-stem-sex-jbc-nb-employees-in-stem-occupations-by-sex-and-type-of-j')`即可获取训练集。随后可转化为Pandas DataFrame进行国家筛选、时间序列分析或按年份与国家的交叉表透视。示例代码展示了如何过滤出印度尼西亚数据、绘制指标随时间的变化趋势,以及构建国家×年份的数据矩阵,适合进行政策比较与趋势预测研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门(ILOSTAT)于2025年整理发布,并由Electric Sheep Asia团队在HuggingFace平台上进行重新封装与分发。其核心研究问题聚焦于亚洲地区25个国家在2000至2025年间,按性别与合同类型划分的STEM(科学、技术、工程与数学)领域就业人数分布。作为ILOSTAT全球劳动统计数据库的重要组成部分,该数据集为分析亚洲劳动力市场中STEM从业者的结构性特征、性别差异及就业形式提供了标准化的数值基础。其影响力体现在:1)为区域劳动力政策制定提供量化依据,特别是针对性别平等与高技术人才流动;2)支持跨国时间序列比较,揭示亚洲各国在STEM人力资本发展上的动态差异;3)通过公开许可(CC-BY-4.0)与便捷的HuggingFace接口,降低了研究者获取权威劳动统计数据的门槛。
当前挑战
该数据集面临的核心挑战包括:1)领域问题层面:如何准确刻画亚洲地区STEM就业的多元结构,特别是性别(男性、女性、总计)与合同类型(如正式、临时、全职、兼职)的交叉影响,以及各国在定义“STEM职业”时采用的不同统计口径(如国际标准职业分类ISCO与国家分类的差异);2)数据构建过程中:原始数据源自各国劳动力调查(LFS)、企业调查等多种来源,ILO虽进行标准化协调,但部分观测值存在序列中断(如注明的“方法变更”标记)、可靠性较低(如“不可靠”状态标志),以及同一国家-年份因多数据源导致的择优选择(“最佳来源”机制)可能引入选择偏差;3)时间跨度上,2000-2025间的数据覆盖率不均(如日本有249行记录,而印度仅48行),可能影响跨时均衡推断的稳健性。
常用场景
经典使用场景
该数据集的核心应用场景在于对亚洲地区STEM领域从业人员的性别结构与合同类型进行系统性分析。依托国际劳工组织ILOSTAT数据库的权威劳动统计资料,该数据集汇集了2000至2025年间25个亚洲国家的1,827条观测记录,覆盖了按性别和雇佣合同类型细分的STEM从业人员数量。研究者可借助这一结构化数据,开展跨国别、跨时段的人力资本演变趋势研究,尤其适用于探究不同性别群体在科学技术工程数学领域的参与差异及其与就业形态的关联机制。
解决学术问题
在学术研究层面,该数据集为解决劳动经济学与性别不平等研究中的关键问题提供了坚实的数据支撑。它能够帮助学者量化分析亚洲各国STEM从业人员的性别分布格局,揭示女性在科技领域面临的体制性障碍,并评估不同合同类型(如临时雇佣与长期雇佣)对职业稳定性的影响。通过时间序列数据,研究者可追踪政策干预、教育扩张及产业结构转型对STEM劳动力构成的作用效果,从而深化对劳动力市场分化和性别歧视持续性的理论理解。
衍生相关工作
围绕该数据集衍生的经典工作主要包括基于ILOSTAT整合框架的区域劳动市场比较研究。诸多学者以此为基础开展了亚洲国家STEM劳动力性别失衡的驱动因素分析,并构建了多项计量经济学模型,如面板数据固定效应回归和结构方程模型,用以评估教育投入、法律环境和产业结构对就业性别隔离的影响。此外,该数据集的标准化格式还催生了劳动统计可视化工具和预测算法的发展,推动了开放科学背景下跨国劳动研究的可重复性与可扩展性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务