遇见数据集

electricsheepasia/asia-ilo-emp-xtru-sex-dsb-rt-time-related-underemployment-rate-by-sex-and-disab

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含624个观测值,涉及16个亚洲国家(1996年至2024年),专注于时间相关就业不足率按性别和残疾状况划分的指标(EMP_XTRU_SEX_DSB_RT)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家,涵盖就业、失业等劳动统计领域。数据集包括国家代码、年份、观测值、数据来源、性别分类等字段,适用于表格分类、回归和时间序列预测任务。数据以CC-BY-4.0许可发布,由Electric Sheep Asia重新打包,旨在为亚洲提供机器学习就绪的数据层。

This dataset contains 624 observations of time-related underemployment rate data across 16 Asia countries, spanning from 1996 to 2024, with a focus on the indicator EMP_XTRU_SEX_DSB_RT (Time-related underemployment rate by sex and disability status). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to Asian countries, covering labor statistics such as employment and unemployment. The dataset includes fields like country codes, years, observed values, data sources, and sex disaggregation, suitable for tabular classification, regression, and time-series forecasting tasks. Released under the CC-BY-4.0 license and repackaged by Electric Sheep Asia, it aims to provide a unified, ML-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-xtru-sex-dsb-rt-time-related-underemployment-rate-by-sex-and-disab 数据集图片
构建方式
该数据集源自国际劳工组织统计数据库(ILOSTAT),属全球劳动统计领域的权威数据源。构建过程依托ILOSTAT提供的REST API接口,直接提取指标为EMP_XTRU_SEX_DSB_RT的原始记录,并依据ISO3国家代码筛选出亚洲区域数据。原始调查微观数据由ILOSTAT依照国际劳工统计学家会议(ICLS)定义进行统一标准化处理,数据来源涵盖各国劳动力调查、家庭收入调查及行政记录,每项观测均标注来源以保障可追溯性。Electric Sheep Asia在此基础上完成重新打包,统一schema并发布为HuggingFace数据集。
特点
数据集覆盖亚洲16个国家,时间跨度为1996年至2024年,共包含624条年度观测记录。核心变量涵盖国家代码、来源标签、指标代码、性别分类(总计、男性、女性)及残疾状况分类,并附有观测状态标记和注释字段,便于识别临时性或不稳定数据。数据以表格形式组织,具备多语种元数据标签,适用于按性别与残疾状况交叉分析时间相关就业不足率。数据集体量精简,结构规整,兼顾时间序列与截面分析需求。
使用方法
研究人员可通过HuggingFace的datasets库直接加载数据集,调用load_dataset函数获取训练集并转换为pandas数据框进行后续处理。典型应用包括按国家代码筛选特定经济体的记录、针对单一指标构建时间序列趋势图,以及利用透视表生成国家与年份的二维矩阵。该数据集适用于表格分类、回归及时间序列预测任务,使用时需注意年度频率及部分观测状态标记所提示的数据可靠性差异,并遵循CC-BY-4.0许可协议引用原始来源与重新打包方。
背景与挑战
背景概述
就业不足作为劳动力市场结构性失衡的关键表征,长期受到国际劳工统计机构的持续追踪。国际劳工组织(ILO)依托其核心统计数据库ILOSTAT,整合各国劳动力调查与家庭收入调查等多源微观数据,依据国际劳工统计学家会议(ICLS)定义进行标准化调和,构建了覆盖200余个经济体的全球劳动统计体系。本数据集由Electric Sheep Asia于2026年从ILOSTAT REST API抽取并重新封装,聚焦亚洲16个国家1996至2024年间按性别与残疾状况分列的工时相关就业不足率,共624条观测记录,旨在为亚洲地区包容性就业政策评估与劳动力市场性别及残疾差距研究提供可机读的时序面板数据基础。
当前挑战
该数据集所应对的领域问题在于,工时相关就业不足率的跨国可比测量本身即面临统计口径异质性的根本困难,残疾状况分类标准在各国的操作化定义差异尤为显著,非标准定义、序列中断及不可靠观测标记在数据中反复出现,对跨国比较与趋势推断构成实质障碍。构建过程中的核心挑战则源于亚洲地区劳动统计基础设施的非均衡发展:16个国家的数据时间跨度从仅覆盖单一年份的9条记录至跨越十余年的百余条记录不等,多国观测值稀疏且年度断裂严重,ILO虽以最佳来源优先原则进行调和,但来源切换所引致的序列不连续性仍难以完全消除,加之就业不足现象本身受季节性波动与经济周期影响显著,年度频率数据的时序建模与因果识别因此面临较大局限。
常用场景
经典使用场景
在国际劳工统计领域,时间相关就业不足率是衡量劳动力未充分就业状态的核心指标,该数据集以性别与残疾状况双重维度对这一比率进行了系统化呈现。其经典应用场景主要聚焦于亚洲16国1996至2024年的面板数据分析,研究者可借助该数据集开展跨国别、跨性别的就业不足趋势比较,或运用时间序列建模方法预测特定国家未来劳动力市场的边缘化风险。例如,通过提取SEX_F与DSB_STATUS_TOTAL的交叉观测值,可以精确刻画亚洲女性残疾群体在就业市场中的相对弱势地位及其时序演变特征。
解决学术问题
该数据集有效回应了劳动力经济学中关于弱势群体就业质量不平等的长期学术争论,特别是残疾身份与性别身份交互作用下就业不足风险的量化评估问题。传统研究多受限于单一年度或单一国家数据的碎片化,难以在统一框架下进行跨区域比较,而该数据集凭借ILO标准化协调方法与624条带有源标签的观测记录,为检验结构性歧视假说、分解性别与残疾双重劣势的叠加效应提供了可靠的经验基础。其意义在于将残疾维度纳入主流就业不足分析,推动了包容性劳动力市场统计研究的方法论革新。
衍生相关工作
围绕该数据集已衍生出一系列具有影响力的后续研究。部分学者将其与ILOSTAT其他指标(如失业率、非正规就业率)进行多源融合,构建了亚洲劳动力市场脆弱性综合指数;另一些工作则采用机器学习方法,如随机森林与梯度提升树,对就业不足率进行高精度预测并识别关键驱动因子。在残疾研究领域,该数据集常被用于与世界卫生组织残疾统计数据进行交叉验证,催生了关于残疾测量标准不一致性的方法论讨论。这些衍生成果共同拓展了ILO统计资料在计算社会科学中的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务