遇见数据集

electricsheepasia/asia-ilo-emp-snif-sex-nb-informal-employment-in-stem-occupations-thousands

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲24个国家在2008年至2025年期间的非正规STEM职业就业数据(以千人为单位),共有438个观测值,覆盖1个核心指标(EMP_SNIF_SEX_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API提取并过滤至亚洲国家,使用国际劳工统计学家会议(ICLS)定义进行标准化。数据集包括国家代码、国家名称、数据来源、指标代码和名称、性别分类(总计、男性、女性)、观测年份、观测值、观测状态及相关注释等列,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并经过ILO的“最佳来源”选择处理,确保质量和一致性。

This dataset contains 438 observations of informal employment in STEM occupations (in thousands) across 24 Asia countries from 2008 to 2025, covering 1 distinct indicator (EMP_SNIF_SEX_NB). The data is sourced from ILOSTAT, the International Labour Organizations central statistics database, extracted via REST API and filtered to Asia ISO3 country codes, with harmonization based on ICLS definitions. It includes columns such as country code, country name, source, indicator code and label, sex disaggregation (total, male, female), observation year, observed value, observation status, and related notes, suitable for tabular classification, regression, and time-series forecasting tasks. The data is published at annual frequency, with ILO-selected best source used for consistency, ensuring data quality and reliability.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-snif-sex-nb-informal-employment-in-stem-occupations-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API直接提取指标编码为'EMP_SNIF_SEX_NB'的原始数据,并依据亚洲国家ISO3代码进行地理过滤。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、住户收入调查等微观数据进行统一协调与标准化处理,同时通过'source.label'列标注数据溯源信息,确保数据来源的可追溯性与权威性。Electric Sheep Asia团队进一步将数据重新打包为Parquet格式,形成包含438条观测值、覆盖24个亚洲国家、时间跨度从2008年至2025年的结构化数据集。
特点
数据集聚焦于亚洲地区STEM职业中的非正规就业规模(单位:千人),包含唯一的观测指标,并提供按性别(总、男、女)的详细分解维度。数据以年度频率呈现,包含国家代码、来源标识、指标标签、观测值及数据质量状态标志(如临时值、不可靠值)等16个字段,同时附有注释字段说明序列中断与方法修订等元信息。所有观测值均采用ILO筛选的'最佳来源',有效剔除了同一国家与年份存在的多源重复,保证了数据的一致性与可靠性。
使用方法
用户可通过HuggingFace Datasets库中的load_dataset()函数直接加载数据集,返回的Pandas DataFrame便于进行探索性分析与可视化。针对特定国家,可利用'ref_area'字段进行过滤;对于时间序列分析,可依据'indicator'字段筛选目标指标并按'time'字段排序;如需构建国家×年份的宽表矩阵,可借助pivot_table方法实现重透视。数据集兼容表格分类、回归及时序预测等多类任务,适用于劳动经济学、非正规经济与STEM就业交叉领域的研究与建模需求。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年整理发布,并经Electric Sheep Asia重新封装于HuggingFace平台。其核心研究问题聚焦于亚洲地区STEM(科学、技术、工程、数学)职业中的非正规就业规模,旨在通过标准化指标揭示该区域劳动力市场的结构性特征。数据集收录了2008至2025年间24个亚洲国家的438条观察记录,依托ILOSTAT——全球劳动统计权威数据库——对各国劳动力调查数据进行统一整合。作为连接宏观政策分析与微观劳动力结构的桥梁,它为研究非正规经济、性别就业差异及STEM人才流动提供了关键量化依据,对推动亚太地区体面劳动目标(SDG)的监测与评估具有显著学术价值。
当前挑战
该数据集面临的挑战主要集中在两个方面。在领域问题层面,非正规就业的界定标准因国家统计体系不同而存在差异,ILO依据国际劳工统计学家会议(ICLS)定义进行协调,但部分国家数据仍受限于调查方法、样本覆盖率和季节性波动,导致跨时空可比性受限。在构建过程中,数据整合面临多重障碍:其一,原始数据来源繁杂,涵盖劳动力调查、家庭收支调查及行政记录,需通过ILO内部算法筛选‘最佳来源’以统一口径;其二,不同国家观测年份不连续(如蒙古拥有51条记录而东帝汶仅9条),稀疏数据可能影响时间序列分析的稳健性;其三,性别等细分维度存在缺失值,且部分观测值被标记为‘不可靠’,需在使用时进行严格的质量控制与审慎解读。
常用场景
经典使用场景
该数据集聚焦于亚洲24个国家中STEM(科学、技术、工程与数学)职业从业者的非正式就业情况,以千人为统计单位,时间跨度覆盖2008年至2025年。经典使用场景集中于利用结构化表格数据进行时间序列分析与面板数据建模,研究者可依据国家、性别等维度对非正式就业规模展开纵向追踪与横向比较。借助数据集中提供的性别细分字段(男女合计、男性、女性),可以深入剖析STEM领域中非正式就业的性别差异及其演变趋势。数据集规模适中(438条记录),适合用于探索性数据分析、拟合线性或非线性趋势模型,以及构建精准度要求不高的预测性回归任务。
衍生相关工作
该数据集衍生出一系列与劳动经济学和发展研究紧密相关的经典工作。利用时间序列特征,研究者可构建国家或区域层面的非正式就业预测模型,将其与国内生产总值、教育投入、技术创新指数等宏观经济变量相结合,探索非正式就业比例的驱动因素。同时,性别维度的存在催生了关于STEM领域性别隔离现象的量化分析,相关研究通过比较男女非正式就业率的差异,评估了劳动市场制度对女性的保护程度。此外,数据集促进了对国际劳工组织体面劳动议程执行效果的跨国评估,衍生文献常以该数据作为基准,检验亚洲国家在改善工作条件方面所取得的实质性进展。
数据集最近研究
最新研究方向
在当前全球劳动力市场结构性变革的背景下,该数据集聚焦于亚洲地区STEM领域非正规就业的量化分析,为研究技术密集型产业中的劳动力脆弱性问题提供了关键数据支撑。前沿研究方向正围绕性别差异与职业隔离的交叉性展开,结合ILOSTAT的标准化调查数据,研究者可深入探讨女性在STEM岗位中非正规就业的比例演变及其与劳动力市场制度、技能错配的动态关联。同时,依托2008–2025年的时间序列覆盖,该数据为评估新冠疫情前后亚洲各国非正规就业政策的有效性、追踪可持续发展目标中体面工作指标(如SDG 8)的进展提供了实证基础,尤其对于揭示技术官僚型经济体中隐性就业的不平等结构具有显著的社会经济意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务