遇见数据集

electricsheepasia/asia-ilo-emp-3tru-sex-age-geo-rt-youth-time-related-underemployment-rate-by-sex-age

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲26个国家从1996年至2025年的6,813个观测值,专注于“青年时间相关就业不足率(按性别、年龄和城乡地区划分)”这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至亚洲国家。数据集为表格格式,包含国家代码、年份、观测值、性别分类(总计、男性、女性)、年龄分组(15-29岁青年段)、地区类型(如全国)等列,适用于表格分类、回归和时间序列预测任务。数据经过ILO harmonisation处理,并标注了来源和质量状态(如“不可靠”)。数据集由Electric Sheep Asia重新打包,以方便机器学习使用。

This dataset contains 6,813 observations of youth time-related underemployment rate across 26 Asia countries, spanning 1996–2025, covering one distinct indicator: Youth time-related underemployment rate by sex, age and rural / urban areas (%). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asia ISO3 country codes. It is in tabular format with columns such as country code, year, observed value, sex disaggregation (total, male, female), age classification (youth bands 15-29), area type (e.g., national), and quality flags. The dataset is repackaged by Electric Sheep Asia for ML-ready use and is suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-3tru-sex-age-geo-rt-youth-time-related-underemployment-rate-by-sex-age 数据集图片
构建方式
该数据集由国际劳工组织(ILO)的ILOSTAT数据库精心构建,通过其REST API直接提取指标代码为EMP_3TRU_SEX_AGE_GEO_RT的原始数据,并依据亚洲ISO3国家代码进行地理筛选。数据来源涵盖各国劳动力调查、家庭收入调查及行政记录等,ILO统计部门依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调处理,确保跨国可比性。数据集共计6,813条观测记录,覆盖26个亚洲国家,时间跨度从1996年至2025年,所有数据均以整洁的表格形式呈现,每条记录均附带来源标签以便追溯。
特点
本数据集聚焦于青年与时间相关的不充分就业率,按性别、年龄及城乡地区进行精细化分层,包含3个性别分类(总计、男性、女性)和多种年龄分组。每个观测值均提供完整的元数据,如观测状态标志、指标说明及数据中断备注,便于研究者评估数据质量。数据呈现为年度频率,当同一国家年份存在多个来源时,采用ILO选定的最佳来源,确保了数据的一致性与权威性。整体数据规模适中,适合进行时间序列分析、面板数据建模及跨国比较研究。
使用方法
使用者可通过HuggingFace Datasets库中的load_dataset函数一键加载数据,将其转换为Pandas DataFrame格式后即可进行灵活操作。例如,可通过国家代码筛选特定国家的子集,或按时间排序以绘制特定指标的时间序列趋势图。还支持将数据透视为国家×年份的矩阵形式,便于进行面板数据分析或构建预测模型。数据集字段定义清晰,包括国家代码、指标名称、性别、年龄分组、观测值及质量标志,便于进行多维度的筛选、聚合与可视化分析。
背景与挑战
背景概述
在全球劳动力市场研究中,时间相关不充分就业率(Time-related underemployment)是衡量劳动力资源利用不充分、揭示隐性失业与就业质量缺陷的关键指标,尤其对于青年群体,其就业脆弱性在人口结构快速转型的亚洲地区更显突出。国际劳工组织(ILO)于2025年通过其ILOSTAT统计数据库发布了该数据集,由Electric Sheep Asia团队整理封装。数据集聚焦1996年至2025年间26个亚洲国家的青年时间相关不充分就业率,按性别、年龄及城乡区域予以细分,共包含6813条观测记录。该数据集填补了亚洲多国在工时利用不足细分维度上的数据空白,为跨国比较、政策评估以及机器学习模型面向劳动力流动性指标的训练提供了标准化、可重复的高质量素材,对推动亚洲区域体面劳动目标研究与宏观经济预警具有重要影响。
当前挑战
该数据集核心领域挑战在于,时间相关不充分就业率作为衡量隐性失业的复杂指标,长期受制于各国调查口径、问卷设计差异以及数据采集频率不均所导致的可比较性难题。ILOSTAT虽依据国际劳工统计学家大会定义对原始微观数据进行调和,但数据来源仍标注有劳动力调查、住户收入调查等不同字段,且部分记录存在脚注标注的方法论断层,增加了时序模型跨域泛化的噪声。构建过程中,数据清洗需处理年度频率与部分地区缺省的高龄细分数据,跨来源一致性校验和时空异质性的规范化表达亦是挑战。此外,城乡二元分类在不同国家界定不一,进一步加剧了多国面板数据在嵌入劳动力流动预测与地域维归因分析时的结构脆弱性,对模型鲁棒性提出更高要求。
常用场景
经典使用场景
在劳动经济学与社会科学研究领域,该数据集的核心应用场景聚焦于青年群体时间相关不充分就业率的跨国比较与时间序列分析。研究者可以借助ILO统一编纂的统计口径,对亚洲26个国家1996年至2025年的年度面板数据进行探索,揭示不同性别、年龄层及城乡地域间不充分就业现象的分布规律与演进趋势。数据集的精细分列维度(如性别、年龄组别和区域类型)为多因素分解研究提供了扎实的基础,尤其适用于构建固定效应模型或动态面板回归,以检验经济发展、产业结构变迁与青年劳动力市场脆弱性之间的关联。
实际应用
在实际应用层面,该数据集为国家劳动政策评估与国际发展项目的监测提供了量化工具。各国劳动统计部门及国际组织(如ILO、世界银行)可借助该数据追踪青年不充分就业率的动态变化,识别劳动市场中的弱势群体,并评估最低工资调整、技能培训计划或创业扶持政策的实际效果。对于亚洲新兴经济体而言,该数据集还可用于构建早期预警指标,辅助政府判断劳动力市场是否存在结构性失衡,从而优化教育与产业政策的衔接。非政府组织与社会研究机构同样能利用其面板结构,撰写具有区域纵深的劳动蓝皮书或专题报告,为公众与决策者呈现就业质量改善的真实图景。
衍生相关工作
围绕该数据集,研究者已衍生出多项具有影响力的工作。一方面,基于ILOSTAT系列数据的跨国面板分析多次出现在《World Development》《Journal of Development Economics》等期刊的实证研究中,用于探讨贸易开放、外商直接投资对发展中国家就业质量的异质性影响。另一方面,该数据集被集成进国际劳工组织的官方统计仪表盘与SDG指标监测系统,用于追踪目标8(体面工作和经济增长)的全球进展。在机器学习领域,类似的ILO结构化面板数据已被用于训练预测模型,以模拟不同经济情景下青年就业率的演变路径,或通过聚类分析识别亚洲劳动力市场的典型模式,为后续的因果推断研究提供了数据预处理的参考范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务