遇见数据集

electricsheepeurope/europe-ilo-pop-2wap-sex-age-nb-working-age-population-by-sex-and-age-un-estimates

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于欧洲39个国家1990年至2030年工作年龄人口(按性别和年龄分类)的联合国估计与预测数据集。数据集包含134,316个观测值,每个国家有3,444行数据,覆盖唯一指标POP_2WAP_SEX_AGE_NB,即按性别和年龄划分的工作年龄人口(以千为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过标准化处理,使用ICLS(国际劳工统计学家会议)定义进行协调。数据集包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类(总计、男性、女性)、年龄分类(15岁及以上)、观察年份和观测值等列。数据为年度频率,ILO选择的最佳来源用于同一国家×年份的多个来源情况。数据集适用于表格分类、回归和时间序列预测任务,旨在为欧洲提供统一的、机器学习就绪的数据层。

This dataset contains United Nations estimates and projections for the working-age population by sex and age across 39 European countries from 1990 to 2030. It includes 134,316 observations, with 3,444 rows per country, covering the single indicator POP_2WAP_SEX_AGE_NB (Working-age population by sex and age in thousands). The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via REST API, and harmonized using ICLS (International Conference of Labour Statisticians) definitions. The dataset features columns such as country code, country name, data source, indicator code, indicator name, sex classification (total, male, female), age classification (15+), observation year, and observed value. Data is annual in frequency, with the ILO-selected best source used for multiple sources per country-year. It is suitable for tabular classification, regression, and time-series forecasting tasks, and is part of a unified, ML-ready data layer for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-pop-2wap-sex-age-nb-working-age-population-by-sex-and-age-un-estimates 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT权威统计数据库,通过直接调用其REST API接口,获取编号为POP_2WAP_SEX_AGE_NB的指标数据,并依据欧洲39个国家的ISO3国别代码进行过滤筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义,对各国劳动调查、家庭收入调查及行政记录等原始微观数据进行协调与标准化处理,同时通过source.label字段标注数据来源,确保信息的可追溯性与可信度。
特点
该数据集囊括了1990年至2030年间欧洲39个国家的劳动年龄人口数据,共包含134,316条观测记录,覆盖了按性别(总、男、女)与年龄分类的单一核心指标。数据以年度频率发布,并支持通过性别、来源等维度进行细致拆解,使得研究者能够灵活分析人口结构的时空演变趋势。数据集采用CC-BY-4.0许可证开放共享,为劳动经济学、人口统计学及时间序列预测等领域的研究提供了坚实的数据基础。
使用方法
使用者可通过HuggingFace的`datasets`库轻松加载该数据集:`load_dataset("electricsheepeurope/europe-ilo-pop-2wap-sex-age-nb-working-age-population-by-sex-and-age-un-estimates")`,并转换为Pandas DataFrame进行后续分析。支持基于国别(如`ref_area`字段)筛选特定国家数据,通过`obs_value`列绘制单指标的时间序列曲线,亦可利用透视表功能构建国家×年份的矩阵,便于进行跨国家、跨年代的对比研究与模型训练。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2024年7月发布,经Electric Sheep Europe重新整合后呈现于HuggingFace平台。其核心研究问题聚焦于欧洲地区劳动年龄人口的结构性分布,涵盖1990年至2030年间39个欧洲国家的134,316条观测记录,按性别与年龄维度进行精细分解。作为ILOSTAT数据库的衍生成果,该数据集为劳动力市场分析、人口政策制定及可持续发展目标(SDG)监测提供了标准化的纵向基准。在人口统计学与劳动经济学领域,它是评估欧洲劳动力供给潜力、分析老龄化进程对经济影响的关键工具,被广泛运用于跨国家、跨时间序列的对比研究。
当前挑战
该数据集面临的核心挑战在于所解决的领域问题:如何精准刻画欧洲各地劳动年龄人口的性别与年龄异质性,以支撑劳动参与率预测、养老金可持续性评估等政策分析。数据构建层面,挑战包括多源数据整合的兼容性难题——ILO需从各国劳动力调查、行政记录等异构来源中,依据国际劳工统计学家会议(ICLS)定义进行标准化处理;时间序列的跨年一致性问题,因指标定义调整或调查方法革新引发的结构性断点需谨慎处理;以及高维分类变量(如性别与年龄组的组合)带来的稀疏性问题,可能影响下游建模的统计效力。此外,2024年更新版本纳入的联合国人口估算与预测,需平衡历史观测值与未来投影间的置信度差异。
常用场景
经典使用场景
在欧洲劳动力研究领域,该数据集作为国际劳工组织ILOSTAT官方统计资料的重构版本,汇聚了39个欧洲国家从1990年至2030年间按性别与年龄分层的劳动适龄人口数据,共计超过13万条观测值。其最为经典的应用场景在于支撑跨国劳动力供给的时序分析,研究者可依据性别与年龄组别对人口结构进行纵向拆解,并通过长跨度的面板数据识别人口红利的演变轨迹与劳动力老化趋势。数据以年度频率呈现,天然适配于时间序列预测任务,常被用于构建欧洲各国劳动参与率的回归模型或人口压力指数的基础变量。
解决学术问题
该数据集有效解决了欧洲劳动经济学研究中长期存在的数据碎片化与口径不统一难题,为跨国比较提供了经过ILO协调机制标准化的统一基准。学术上,它被广泛用于量化人口结构变迁对就业弹性、社会保障负担以及经济增长潜力的影响,通过性别与年龄的精细分组,学者能够精准识别不同亚群体在劳动力市场中的参与差异,进而探讨性别平等政策的实际效果。此外,数据集覆盖至2030年的预测值,使得前瞻性研究如劳动供给冲击模拟与老龄化社会政策评估成为可能,推动了人口经济学与公共政策分析的深度融合。
衍生相关工作
该数据集衍生出一系列经典研究工作,其中最具代表性的是基于ILO标准化框架构建的欧洲劳动力参与率预测模型,研究者常将其与欧盟统计局(Eurostat)的就业数据结合,用于验证不同经济周期下人口结构对就业弹性的调节作用。在此基础上,有学者开发了性别与年龄交互效应的面板回归模型,系统量化了女性劳动参与率随年龄增长的衰减曲线。此外,数据集的跨国面板特性催生了关于移民流入对本地劳动年龄人口替代效应的实证分析,以及利用时间序列分解方法对欧洲各国劳动力老龄化拐点的识别研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务