遇见数据集

electricsheepasia/asia-ilo-emp-snif-sex-rt-informal-employment-rate-in-stem-occupations

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲24个国家从2008年至2025年的STEM职业非正规就业率数据,共有438个观测值,涵盖1个独立指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为亚洲国家代码。数据集包括国家代码、国家名称、数据来源、指标代码、性别分类、年份、观测值等列,适用于表格分类、回归和时间序列预测任务。数据已由Electric Sheep Asia重新打包,以Parquet格式发布,便于机器学习研究使用。

This dataset contains 438 observations of informal employment rate in STEM occupations across 24 Asia countries, spanning from 2008 to 2025, covering 1 distinct indicator. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved via REST API and filtered to Asia ISO3 country codes. It includes columns such as country code, country name, data source, indicator code, sex disaggregation, year, observed value, and more, suitable for tabular classification, regression, and time-series forecasting tasks. The dataset has been repackaged by Electric Sheep Asia in Parquet format for easy machine learning use.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-snif-sex-rt-informal-employment-rate-in-stem-occupations 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接提取了EMP_SNIF_SEX_RT指标的全部原始数据,并依据亚洲ISO3国家代码进行地理范围筛选。数据涵盖了24个亚洲国家在2008年至2025年间的438条年度观测记录,每条记录包含了观测值、性别分类、数据来源及状态标记等字段。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据集中的source.label列清晰标注了各条数据的来源,确保了可追溯性。
特点
该数据集聚焦于亚洲地区STEM职业中的非正规就业率,提供了按性别划分的详尽分类维度,包括总数、男性和女性三个层次。数据覆盖了从蒙古、土耳其到印度、孟加拉国等24个具有地理代表性的亚洲国家,时间跨度长达18年。所有数据均附带观测状态标志(如不可靠)和注释信息(如方法变更导致的序列中断),为用户提供了完整的数据质量透明度。此外,数据集以标准化Parquet格式封装,兼容HuggingFace Datasets接口,便于机器学习系统直接调用。
使用方法
用户可通过HuggingFace的`datasets`库以`load_dataset()`函数一键加载该数据集,并将其转换为Pandas DataFrame进行后续分析。支持按国家代码筛选特定国家的数据子集,或按时间序列进行排序与可视化,便于观察特定指标的趋势变化。利用数据集的gender列,研究者可以轻松实现性别分组分析。同时,pivot_table方法可将数据重塑为国家×年份的矩阵形式,为面板数据回归或时间序列预测等机器学习任务提供便利。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT构建,并由Electric Sheep Asia重新封装发布,聚焦亚洲24个国家中STEM职业的非正式就业率。核心研究问题在于量化亚太地区科技劳动力市场的非正规化程度及其性别差异,为可持续发展目标(SDG)中的体面工作指标提供实证支撑。数据集涵盖2008至2025年的438条观测,涉及各国劳动力调查等权威来源,其发布推动了跨国比较劳动经济学的发展,尤其在发展中国家政策制定与学术研究中具有重要参考价值。
当前挑战
该领域面临的主要挑战包括:跨国产出时间序列数据的不一致性,例如部分国家因调查方法修订导致序列中断;微观数据来源多样(如劳动力调查、行政记录),使指标可比性受限于ILO的协调标准;性别和教育水平等细分维度的稀疏性,限制了深入分析。构建过程中,需处理多源数据质量差异,如ILO标记的‘不可靠’观测值及缺失值;同时,从REST API批量采集时,需克服国家代码过滤、年度频次与月度数据的整合难题,并在Repackaging中维护原数据的可追溯性标识。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中24个亚洲国家STEM职业非正规就业率的年度观测数据,时间跨度覆盖2008至2025年。经典的学术使用场景聚焦于劳动经济学与性别经济学交叉领域,研究者可借助该面板数据构建多层级回归模型,系统揭示亚洲各国STEM领域非正规就业的时空演化规律。数据集中包含按性别细分的观测值,为分析女性在STEM职业中非正规就业的脆弱性提供了宝贵窗口,从而支撑关于性别差异与劳动力市场结构变迁的实证探讨。
实际应用
在政策与治理实践层面,该数据集是国际组织、国家劳动力部门及发展机构制定STEM人才战略的量化支撑。通过追踪各国非正规就业率的年度波动,政策制定者可以识别出就业质量恶化或改善的敏感区域,从而定向优化职业培训体系与劳动法规。数据集按性别分解的维度尤为实用,可助力评估性别平等政策在STEM劳动力市场的实际渗透效果,并为SDG目标八中体面工作的监测与报告提供权威依据。此外,数据与Python、Pandas工具链的便捷集成,显著降低了非营利智库与小型研究团队的数据使用门槛。
衍生相关工作
该数据集已催生出多个极具启发性的衍生研究方向。一方面,学者可将其与ILO的其他就业质量指标及世界银行的教育投入数据联动,构建亚洲STEM人才生态的综合评估框架。另一方面,数据的时间序列属性为时序预测模型提供了训练素材,使得前沿的研究如基于Transformer的就业率预测或国家间非正规经济传导机制的结构方程建模成为可能。此外,数据集中标记的方法修订断点信息,已推动方法论领域探讨调查口径变化对纵向可比性的量化影响,从而促进了劳动统计指标衔接技术的迭代发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务