遇见数据集

electricsheepasia/asia-ilo-emp-3emp-sex-age-geo-nb-youth-employment-by-sex-age-and-rural-urban-areas

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含13,132个观测值,覆盖32个亚洲国家,时间跨度为1970年至2025年,专注于一个指标:青年就业按性别、年龄和城乡地区划分(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家,包括国家代码、年份、性别分类、年龄分组、城乡地区分类等列,适用于表格分类、回归和时间序列预测任务。数据集为英文单语,采用CC-BY-4.0许可。

This dataset contains 13,132 observations of employment data across 32 Asia countries, spanning 1970 to 2025, covering one distinct indicator: Youth employment by sex, age and rural/urban areas (in thousands). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to Asia countries, with columns including country codes, years, sex disaggregation, age groups, and rural/urban classifications. It is suitable for tabular classification, regression, and time-series forecasting tasks, is monolingual in English, and licensed under CC-BY-4.0.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-3emp-sex-age-geo-nb-youth-employment-by-sex-age-and-rural-urban-areas 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API直接提取标识符为EMP_3EMP_SEX_AGE_GEO_NB的指标,并依据亚洲国家ISO3代码进行地理筛选。原始数据来自各国劳动力调查、家庭收入调查及行政记录,经ILO依据国际劳工统计学家会议定义进行统一协调处理。数据经Electric Sheep Asia重新打包,以标准化Parquet格式发布,确保机器学习就绪。数据集包含13,132个观测值,覆盖1970年至2025年间亚洲32个国家的青年就业信息,按性别、年龄和城乡区域进行细分。
特点
数据集以青年就业为核心指标,观测值单位为千人,提供了丰富的维度分解,包括性别(男、女、总计及其他)和分类变量(如年龄组和地理覆盖类型)。数据列包含来源追踪标识、观测状态标记(如中断或临时数据)以及注释字段,便于用户评估数据质量。值得注意的是,数据仅包含年度频率,对于同一国家与年份的多来源情况,采用ILO筛选的‘最佳来源’。分解列在指标未发布对应分类时可能为空,确保了数据结构的严谨性。
使用方法
用户可通过HuggingFace Datasets库便捷加载数据:使用`load_dataset`函数获取训练集,并转换为Pandas DataFrame进行后续分析。代码示例演示了如何按国家过滤(如印度尼西亚)、绘制特定指标的时间序列图,以及通过数据透视表构建国家×年份矩阵。数据集适用于表格分类、回归及时间序列预测任务,研究人员可基于性别、年龄等维度进行精细化就业分析。建议引用原始ILO来源及Electric Sheep Asia的再包装版本,以符合cc-by-4.0许可要求。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT统计数据库整理发布,并由Electric Sheep Asia在HuggingFace平台上重新封装,旨在提供亚洲地区青年就业的精细结构化数据。数据集聚焦于32个亚洲国家在1970年至2025年间基于性别、年龄及城乡区域的青年就业人数(千人为单位),共包含13,132条观测记录。其核心研究问题在于填补亚洲地区青年劳动力市场微观数据的可获取性与标准化缺口,为发展经济学与劳动政策分析提供一致性的时间序列素材。作为全球劳动统计的权威来源,ILOSTAT的数据被广泛引用于联合国可持续发展目标(SDG)中的体面工作议题评估,该数据集的出现显著降低了研究者获取机器可读、跨国家可比就业数据的门槛,对区域劳动力研究具有基础性推动作用。
当前挑战
首先,数据集所解决的领域挑战在于亚洲青年就业统计的碎片化与不可比性问题,不同国家的调查方法、定义标准与数据发布频率差异巨大,ILO需要通过统一的ICLS定义对原始调查微观数据进行协调,但部分数据仍存在序列中断(break in series)与评估状态标记(如provisional、unreliable),这对时间序列分析中的因果推断构成扰动。其次,构建过程中面临的数据稀疏性与分类维度非穷举问题显著,例如性别、年龄带与城乡区域等分层变量仅能部分覆盖所有指标,且同一国家-年份组合可能对应多个数据源,ILO的“最佳来源”选择规则虽然保证了一致性,但牺牲了异构来源的互补信息,导致数据韧性降低。此外,该数据集仅收录年度频率,排除了月度或季度子系列,限制了高频率波动分析的可能性。
常用场景
经典使用场景
该数据集收录了国际劳工组织ILOSTAT数据库中亚洲32个国家1970年至2025年间青年就业的详细观测数据,包含性别、年龄分组以及城乡地理区域的交叉分类信息。研究人员常将其用于时间序列分析,以追踪亚洲各国青年就业率的长期演变趋势;或借助其多维度分层结构,构建面板数据模型,考察经济发展、教育普及与城镇化进程对青年劳动力市场表现的影响。
实际应用
在国际发展机构与政策研究领域,该数据集被广泛应用于青年就业政策的评估与设计。例如,通过比较不同亚洲国家在特定时段内按性别与城乡分类的就业率波动,可量化学校至职场过渡计划、技能培训项目及农村就业促进措施的实效。同时,企业人力资源部门可借助其历史数据预判特定区域青年劳动力供给变化,优化人才储备与区域布局决策。
衍生相关工作
基于该数据集,衍生出一系列关于亚洲青年就业动态的计量经济学与机器学习研究工作。经典工作包括利用固定效应模型识别城镇化进程中青年就业的结构性变化,运用聚类算法对亚洲国家就业模式进行类型学划分,以及构建混合效应模型剖析性别就业差距的时序演化。这些成果不仅验证了ILO统计框架的跨区域适用性,也推动了劳动经济学中面板数据方法论的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务