遇见数据集

electricsheepeurope/europe-ilo-emp-5emp-sex-age-nb-employment-by-sex-and-age-19th-icls-thousands

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲35个国家从2014年至2025年的就业数据,共4,632个观测值,核心指标为EMP_5EMP_SEX_AGE_NB,即按性别和年龄划分的就业人数(以千人为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并筛选为欧洲国家。数据集采用表格格式,包含国家代码、年份、性别分类(总计、男性、女性)、年龄组分类、观测值及数据质量标志等列,适用于机器学习任务如表格分类、回归和时间序列预测。数据经过ILO根据第19届国际劳工统计学家会议(ICLS)定义进行标准化处理,并注明来源和许可证信息(CC-BY-4.0)。

This dataset contains 4,632 observations of employment data across 35 European countries, spanning 2014 to 2025, with the core indicator EMP_5EMP_SEX_AGE_NB representing employment by sex and age in thousands. Sourced from the International Labour Organizations ILOSTAT database via REST API and filtered for Europe, it is presented in tabular format with columns including country code, year, sex disaggregation (total, male, female), age group classification, observed values, and data quality flags. Suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting, the data is harmonized using ICLS definitions and includes source attribution under a CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-5emp-sex-age-nb-employment-by-sex-and-age-19th-icls-thousands 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于欧洲地区就业人口的性别与年龄分布状况。数据通过ILOSTAT REST API接口直接获取,原始指标编码为EMP_5EMP_SEX_AGE_NB,代表基于第19届国际劳工统计学家会议(ICLS)定义的就业人数(单位:千)。在获取原始数据后,系统依据欧洲ISO3国家代码进行地域过滤,并保留了数据来源标识(source.label)以增强可溯源性与透明度。最终整合为涵盖35个欧洲国家、时间跨度从2014年至2025年的年度观测记录,共计4632条。
特点
该数据集的核心特点在于其精细的多维分类结构与权威的数据来源。数据不仅按性别(男性、女性、总计)进行分解,还包含了年龄组等分类变量,为研究者提供了深入分析欧洲劳动力市场结构性特征的契机。所有指标均遵循ILO官方统一的数据处理与质量标准,且标注了观测状态(如数据是否中断或修订),便于评估数据可靠性。此外,该数据集采用了整洁的表格化设计,每种分类维度(如性别、年龄)均以独立字段呈现,极大地方便了后续的筛选、聚合与建模操作。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,仅需一行代码即可获取完整的DataFrame对象。基于其结构化的特点,研究者能够利用Pandas等工具进行灵活的数据操作:例如,针对单个国家进行就业趋势的时间序列分析;或通过透视表功能构建以国家为列、年份为行的二维面板数据,便于开展跨国的比较研究。数据集支持分类任务、回归分析以及时间序列预测等多种应用场景,特别适合用于构建欧洲劳动力市场的预测模型或进行人口经济学的统计分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司创建,经由Electric Sheep Europe于2025年重新整理并发布在HuggingFace平台,聚焦欧洲35个国家2014至2025年间按性别与年龄划分的就业人数统计(单位:千人)。其核心研究问题在于提供基于第19届国际劳工统计学家会议(ICLS)标准定义的、经过统一规范的就业指标时间序列数据,为跨国劳动力市场分析、政策评估及经济建模提供可靠依据。作为ILOSTAT数据库的子集,该数据集在劳动经济学、社会科学及公共政策领域具有重要影响力,为研究者与决策者呈现了欧洲地区就业结构的长期演变趋势,弥补了原始官方数据在机器可读性与易用性方面的不足。
当前挑战
该数据集所解决的领域问题在于,欧洲各国就业统计数据在定义口径、调查方法及时间跨度上存在显著异质性,传统手动整合过程耗时且易出错,限制了跨区域比较分析的效率与可信度。构建过程中面临的关键挑战包括:1)从ILOSTAT API抽取原始数据后,需对35个国家数据进行一致性清洗与标准化,以消除因各国劳动调查体系差异导致的统计口径偏差;2)处理数据中的断点标记(如'Break in series')与来源变更注释,确保时间序列的连续性免受方法论修订的干扰;3)在保留性别、年龄组等细粒度分类维度的同时,平衡数据结构化程度与原始数据完整性的要求,避免过度聚合损失重要信息。
常用场景
经典使用场景
在劳动经济学与人口统计学交叉研究领域,该数据集最典型的应用场景是构建欧洲各国就业人口的分性别、分年龄结构的面板数据模型。研究者可借助其35个国家从2014年至2025年的年度观测值,进行横向跨国比较与纵向趋势分析。例如,通过按性别与年龄组别(如青年15岁以上、成年群体)拆解就业规模,学者能够精准捕捉不同人口群组在劳动力市场中的参与演变特征,为理解欧洲老龄化社会背景下的就业格局提供了可靠的数据基石。
解决学术问题
该数据集有效回应了劳动经济学中长期存在的两个关键学术难题:一是如何获取经国际劳工组织统一协调的、跨国家的细分就业统计指标,以消除各国统计口径差异带来的比较偏误;二是如何在时间序列框架下,量化性别与年龄结构变动对总体就业的差异化影响。其意义在于,基于19届国际劳动统计学家会议标准整理的数据,为检验人力资本理论、性别就业歧视假说以及代际劳动力替换效应等经典命题,提供了高可比性的实证基础,极大推动了欧洲劳动力市场研究的科学化。
衍生相关工作
围绕该数据集已衍生出多项标志性研究工作,涵盖了描述性统计与因果推断两大方向。一方面,研究者基于该数据构建了欧洲就业的基准预测模型,利用时序分解算法分离出周期性波动与结构性趋势。另一方面,部分经典工作将其与教育、工资等辅助数据集合并,深入探讨技术进步与自动化对不同性别年龄组就业的异质性冲击。此外,该数据还催生了多篇聚焦于新冠疫情后欧洲劳动力市场复苏路径的实证论文,成为评估后疫情时代就业恢复政策效果的核心数据支柱。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务