遇见数据集

electricsheepeurope/europe-ilo-eip-dwap-sex-age-rt-inactivity-rate-by-sex-and-age

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲43个国家在1946年至2025年期间的“按性别和年龄划分的不活动率(%)”指标数据,共有119,831个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并筛选至欧洲国家,涵盖了劳动力不充分利用的其他衡量标准。数据集为表格格式,包括国家代码、年份、性别分类、观测值等列,适用于表格分类、回归和时间序列预测等机器学习任务。数据经过ILO基于国际劳工统计学家会议(ICLS)定义进行标准化处理,并包含来源和质量注释。

This dataset contains 119,831 observations of Inactivity rate by sex and age (%) data across 43 Europe countries, spanning 1946–2025, covering other measures of labour underutilization. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via REST API and filtered to European countries. The dataset is in tabular format, including columns such as country code, year, sex disaggregation, observed values, and is suitable for tabular classification, regression, and time-series forecasting tasks. Data is harmonized by ILO using ICLS definitions and includes source and quality flags.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-dwap-sex-age-rt-inactivity-rate-by-sex-and-age 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,聚焦于欧洲地区劳动力利用不足的度量指标。数据通过ILOSTAT提供的REST API接口直接采集,原始地址为https://rplumber.ilo.org/data/indicator?id=EIP_DWAP_SEX_AGE_RT,并依据欧洲ISO3国家代码进行地理范围筛选。ILOSTAT本身基于各国劳动力调查、家庭收入调查、机构调查及行政记录等多元数据源,采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行标准化处理。数据集构建过程中,保留了标注数据来源的'source.label'字段以确保可追溯性,并由Electric Sheep Europe团队对原始数据进行重新封装,转化为统一Parquet格式,便于机器学习场景下的直接加载与使用。
特点
该数据集包含119,831条观测记录,时间跨度从1946年至2025年,覆盖43个欧洲国家,呈现了深刻的历史纵深与广泛的地理覆盖面。数据核心指标为'按性别和年龄划分的不活动率'(百分比),通过'sex'(性别)和'classif1'(年龄分组)两个关键维度进行精细化解构,其中性别维度包含总计、男性和女性三类。数据模式设计严谨,提供了ref_area、source、indicator、time、obs_value等标准化字段,并辅以obs_status及多项注释字段用于标识数据质量状态,如序列中断或方法修订。值得注意的是,数据为年度频率,且当同一国家与年份存在多个来源时,采用ILO选定的'最佳来源',确保了数据的一致性和权威性。
使用方法
该数据集通过HuggingFace Datasets库实现高效调用,用户仅需执行'load_dataset'函数即可完成加载,并可直接转换为Pandas DataFrame进行后续分析。典型使用场景包括国家层级过滤,例如通过'ref_area'字段筛选特定国家的数据子集;时间序列分析,按'indicator'和'time'字段排序并可视化观测值的变化趋势;以及构建国家×年份的透视矩阵,利用'pivot_table'方法将数据重新组织为便于面板数据分析的结构。数据集以cc-by-4.0许可协议发布,用户在使用时应同时引用ILO原始数据和Electric Sheep Europe的重新封装版本,以确保学术诚信与数据溯源。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的统计部门ILOSTAT于2025年整理发布,并由Electric Sheep Europe重新封装,旨在提供欧洲43个国家1946年至2025年间按性别与年龄划分的劳动力不活跃率(Inactivity rate)数据,共计119,831条观测记录。作为全球劳动统计领域的权威来源,ILOSTAT通过整合劳动力调查、家庭收入调查及行政记录等多元数据,采用国际劳工统计学家会议(ICLS)定义进行标准化处理,为劳动经济学、社会政策评估及劳动力市场研究提供了关键支撑。该数据集聚焦于劳动力未充分利用的度量,弥补了传统失业率指标的不足,有助于深入剖析劳动力市场的结构性特征与长期演变趋势。
当前挑战
该数据集所解决的领域问题在于,劳动力不活跃率能够揭示传统失业率无法涵盖的隐性劳动力资源,例如因家庭责任、教育或健康原因未参与就业的群体,从而为更全面的劳动力市场诊断提供依据。构建过程中面临的核心挑战包括:跨国家、长时间跨度内数据来源的异质性与一致性维护,如不同国家的调查方法、年龄分组定义及统计口径存在差异;部分历史数据存在序列中断(break in series)或方法论修订,导致时间序列的连续性与可比性受限;此外,需通过ILO选定的“最佳来源”策略处理同一国家年份内多源数据的冲突,确保数据的权威性与可靠性。
常用场景
经典使用场景
该数据集收录了1946年至2025年间43个欧洲国家按性别与年龄划分的非经济活动率(Inactivity rate)数据,总计近12万条观测记录,是劳动经济学与人口学交叉研究领域的重要基础资源。其经典使用场景包括:利用时间序列分析法描绘欧洲各国劳动参与结构的长期演变轨迹;借助面板数据模型探讨性别与代际差异对劳动力市场退出行为的影响机制;以及通过多国对比揭示不同福利体制与就业政策下非经济活动率的异质性表现。研究者可基于该数据集构建高精度的预测模型,评估经济增长、体制变迁或社会政策对劳动力供给的潜在冲击。
实际应用
在实际应用层面,该数据集为多类机构提供了关键决策依据。国家劳动与社会保障部门可依据不同性别与年龄组的非经济活动率变化,精准定位就业帮扶对象并评估现行劳务政策的施行成效;国际组织如欧盟委员会与欧洲统计局可依托该数据进行跨国劳动力市场绩效评估与联合政策制定。此外,金融研究机构借助该数据洞察劳动供给弹性,从而更准确地预测欧元区经济走势与潜在增长率;社会智库与NGO则利用其分析结果,倡导针对青年、女性或中老年群体的定向就业支持方案,优化公共资源的分配效率。
衍生相关工作
围绕该数据集已衍生出一系列具有影响力的学术与实践工作。在方法论层面,研究者利用其中详尽的性别与年龄分组信息,开发了适用于高维面板数据的缺失值插补算法与序列断裂调整技术。在实证方向,以该数据为核心的若干研究系统评估了2008年金融危机与COVID-19大流行对欧洲不同群体劳动参与率的非对称冲击,揭示了脆弱性在人口子群中的分布规律;同时,该数据集被纳入ILO与欧盟联合发布的劳动市场监测项目中,成为构建动态预警指标体系的底层数据来源。此外,基于该数据训练的机器学习模型已被用于生成跨国非经济活动率的短期预测,为前瞻性政策制定提供量化支持。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务