遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-mts-dsb-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲16个国家在2007年至2024年期间的非正规经济数据,共有4,377个观测值,涵盖1个独特指标:按性别、婚姻状况和残疾状况划分的非正规部门就业份额(%)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动力统计的主要来源,通过协调各国劳动力调查、家庭收入调查等原始数据,提供标准化统计。数据集经过重新打包,以方便机器学习使用,包括国家代码、指标值、年份、性别分类等字段,并附带数据质量说明,如年度频率、最佳来源选择等。

This dataset contains 4,377 observations of informal economy data across 16 Asia countries, spanning from 2007 to 2024, covering 1 distinct indicator: Share of employment outside the formal sector by sex, marital status and disability status (%). The data is sourced from ILOSTAT, the ILOs central statistics database and a leading global source for labour statistics, which harmonizes raw survey microdata using International Conference of Labour Statisticians definitions. Repackaged for machine learning readiness, it includes fields such as country codes, indicator values, years, and sex classifications, along with data quality caveats like annual frequency and best-source selection.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-mts-dsb-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口获取指标EMP_PIFL_SEX_MTS_DSB_RT的原始数据,并依据ISO3国家代码筛选出亚洲地区记录。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查等微观数据进行标准化协调,Electric Sheep Asia在此基础上重新打包为HuggingFace数据集,保留来源标识以保证可追溯性。
使用方法
用户可通过HuggingFace datasets库的load_dataset函数加载数据集,并转换为Pandas DataFrame进行灵活分析。例如,筛选特定国家(如印度尼西亚)、按指标和时间排序绘制时间序列图,或透视生成国家×年份矩阵,以支持跨国比较和趋势研究。
背景与挑战
背景概述
非正规部门就业在全球劳动力市场中占据显著份额,其规模与性别、婚姻状况及残疾状态等社会分层变量密切相关。国际劳工组织(ILO)长期致力于劳动统计的标准化与跨国可比性建设,其ILOSTAT数据库为监测体面劳动目标提供了权威数据基础。在此背景下,Electric Sheep Asia于2026年基于ILOSTAT REST API接口,将原始数据重新封装为面向机器学习工作流的HuggingFace数据集,涵盖2007至2024年间16个亚洲国家的4377条观测记录。该数据集聚焦于按性别、婚姻状况与残疾状态分类的非正规部门就业比例,为探究亚洲劳动力市场结构性不平等提供了细粒度的时间序列与横截面数据支撑,对劳动经济学、社会政策评估及可持续发展目标监测具有重要参考价值。
当前挑战
该数据集所回应的领域问题在于揭示非正规就业中的多重弱势叠加效应,即性别、婚姻状态与残疾身份如何交织影响劳动者进入正规部门的机会。这一问题的挑战在于,非正规就业本身边界模糊,不同国家对“非正规部门”的操作性定义存在差异,且残疾状态的测量标准在各国 labour force survey 中尚未统一,导致跨国比较面临概念一致性的严峻考验。构建过程中的挑战则体现为:原始数据由ILOSTAT从多源国家调查中协调汇编,观测值存在不可靠标记、序列断裂及非标准定义注释,时间覆盖不均衡,部分国家仅有一年数据,且分类变量仅在特定指标下非空。此外,数据以年频发布,无法捕捉季节性波动,这些因素共同构成了数据质量与建模适用性的现实约束。
常用场景
经典使用场景
在非正规经济与劳动力市场分割研究领域,该数据集构成了剖析亚洲地区就业非正规化程度的核心经验素材。依托国际劳工组织标准化采集的跨国可比数据,研究者得以按性别、婚姻状况与残疾状态等多重社会分层维度,系统测算2007至2024年间16个亚洲国家非正规部门就业份额的时序演变轨迹。其经典使用场景涵盖面板数据回归、跨国比较分析与时间序列预测等任务,尤其适用于检验非正规就业性别差距的收敛假说,以及评估婚姻与残疾身份对劳动者进入正规部门机会的调节效应。
解决学术问题
该数据集直面的关键学术议题在于,长期困扰发展经济学与劳动社会学的非正规就业度量碎片化难题。以往研究多受制于国别调查口径不一、指标定义歧异与时间断点频仍等障碍,难以开展严谨的跨国因果推断。本数据集借助国际劳工统计学家会议的定义框架与来源标注机制,为识别非正规就业的结构性决定因素、评估社会保障覆盖缺口以及追踪可持续发展目标第八项进展,提供了透明且可复现的量化基准,显著提升了相关实证研究的内部效度与外部可推广性。
实际应用
在政策制定与实务操作层面,该数据集为国际发展机构、各国劳工部门及社会保障研究者提供了监测非正规就业风险的预警工具。决策者可据此识别性别、婚姻状态与残疾身份交织下的脆弱就业群体,优化非缴费型养老金、医疗保险与职业技能培训的靶向投放。对平台经济与零工经济研究者而言,该数据有助于评估新型用工形态对传统正规就业统计边界的冲击,并为非正规部门劳动者转正政策的设计与成效评估提供基线参照。
数据集最近研究
最新研究方向
在全球非正规经济研究持续深化的背景下,该数据集为探究亚洲地区非正规就业的结构性差异提供了关键实证基础。前沿研究正利用其性别、婚姻状况与残疾状况的多维交叉分类,结合时间序列方法,揭示弱势群体在非正规部门中的过度代表现象及其动态演变。与非正规就业测度国际标准(ICLS)的修订进程相呼应,相关分析聚焦于残疾与婚姻状态的交互效应,推动了包容性劳动力市场政策的精准化。该数据集的ML就绪特性,亦促进了因果推断与预测建模在非正规经济监测中的应用,对实现体面劳动与减少不平等具有重要参考意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务