遇见数据集

electricsheepeurope/europe-ilo-emp-2emp-age-ste-nb-employment-by-age-and-status-in-employment-ilo-mod

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含国际劳工组织(ILO)建模估计的就业数据,具体关注按年龄和就业状态分类的就业情况,单位为千人。数据覆盖欧洲39个国家,时间跨度为1991年至2025年,共32,664个观测值。数据集基于ILOSTAT(ILO的统计数据库)来源,通过REST API获取并过滤至欧洲地区,数据经过ILO harmonisation处理以确保一致性。指标为EMP_2EMP_AGE_STE_NB,提供年度频率数据,适用于表格分类、表格回归和时间序列预测等任务。数据集中包含国家代码、国家名称、来源信息、指标代码、分类变量(如年龄组和就业状态)、观测年份、观测值及状态标志等列,可用于劳动力市场分析、经济研究和机器学习建模。

This dataset contains employment data modeled by the International Labour Organization (ILO), specifically focusing on employment by age and status in employment, measured in thousands. It covers 39 European countries from 1991 to 2025, with 32,664 observations. The data is sourced from ILOSTAT (ILOs statistical database), retrieved via the REST API and filtered to European regions, and harmonized by ILO for consistency. The indicator is EMP_2EMP_AGE_STE_NB, providing annual frequency data suitable for tasks such as tabular classification, tabular regression, and time-series forecasting. The dataset includes columns such as country code, country name, source information, indicator code, classification variables (e.g., age groups and employment status), observation year, observed value, and status flags, making it useful for labor market analysis, economic research, and machine learning modeling.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-2emp-age-ste-nb-employment-by-age-and-status-in-employment-ilo-mod 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接抽取原始指标数据,并依据国际劳工统计学家会议(ICLS)定义进行了系统化整合与规范化处理。在数据采集后,研究人员基于欧洲ISO3国家代码进行地理范围过滤,最终汇聚成涵盖39个欧洲国家、时间跨度从1991年至2025年的就业数据集合。数据集共包含32,664条观测记录,每条记录均附带来源标记以保障可追溯性,并通过Electric Sheep Europe团队重新打包为便于机器学习的Parquet格式,实现了从原始统计源到可直接调用的数据集的完整构建。
特点
本数据集呈现三大核心特征。其一,地域覆盖广泛且时间序列完整,囊括了阿尔巴尼亚、奥地利、比利时等39个欧洲国家长达35年的年度就业统计数据,为跨时空比较研究提供了坚实基础。其二,数据结构层次分明,采用多维分类变量体系,包括年龄分组、就业身份等细分维度,同时保留了观测状态标识与调整标记,便于用户甄别数据质量。其三,数据来源权威可靠,所有记录均来自ILO官方建模估算,并遵循CC-BY-4.0许可协议开放共享,兼具学术严谨性与应用灵活性。
使用方法
使用者可通过HuggingFace Datasets库便捷加载该数据集,仅需一行代码'load_dataset'即可将数据导入Python环境,并自动转换为Pandas DataFrame格式以便后续分析。针对特定国家的研究需求,可通过'ref_area'字段进行过滤筛选,例如提取德国(DEU)的子集数据。对于时间序列分析,建议按'indicator'字段分组并依据'time'字段排序,利用'obs_value'数值绘制趋势图,或通过数据透视表构建国家×年份的矩阵结构,从而高效开展就业模式的比较研究与预测建模工作。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)部门统计司于2025年11月发布,并由Electric Sheep Europe在HuggingFace上重新打包整理。其核心研究问题聚焦于欧洲39个国家在1991年至2025年间,按年龄和就业身份分类的就业人数估算,旨在为劳动经济学、社会政策评估及跨国比较提供可靠的数据基础。作为ILOSTAT数据库的子系统,该数据集整合了各国劳动力调查、住户收入调查及行政记录等多元来源,并通过国际劳工统计学家会议(ICLS)定义进行统一标准化处理。其发布填补了欧洲区域高质量、细粒度就业分类数据的空白,对研究劳动力市场结构变迁、老龄化对就业的影响以及不同就业身份(如自雇、受雇)的分布特征具有重要参考价值。数据集涵盖了32,664条观测值,涵盖39个欧洲国家,时间跨度达35年,为时间序列分析和面板数据建模提供了丰富的实证材料,已在学术界和政策研究领域获得广泛应用。
当前挑战
该数据集所解决的核心领域挑战在于,传统就业统计数据常因国家间统计口径、调查方法及分类标准差异而难以直接比较,对欧洲一体化背景下的劳动政策协调造成障碍。ILOSTAT通过统一模型估算解决了跨国数据可比性难题,但数据构建过程中面临多重挑战:首先,原始调查数据的缺失与不连续性要求采用复杂估算模型填补国家与年份间的数据空白,准确度受限于模型假设与辅助数据质量;其次,不同国家劳动力调查覆盖的年龄范围与就业身份定义存在细微差异,标准化过程需谨慎处理分类映射以避免引入系统性偏差;再次,数据集包含按年龄、性别及就业身份的多维分类,导致观测值稀疏性突出,部分子类在特定年份仅有有限样本,给统计分析带来小样本推断的挑战。此外,数据源标注的追踪性与观察值状态标志(如临时性(provisional)或调整后(adjusted))的解读,也为用户的数据筛选与质量控制增加了复杂性。
常用场景
经典使用场景
在欧洲劳动经济学研究领域,国际劳工组织(ILO)发布的按年龄和就业身份分列的就业数据集具有不可替代的基础性价值。该数据集涵盖了1991至2025年间39个欧洲国家的32,664条观测记录,提供了标准化的就业指标——EMP_2EMP_AGE_STE_NB。其经典使用方式主要包括:研究人员通过按国家筛选进行跨国劳动市场结构比较,或按时间序列展开单一指标的长期趋势分析;亦可利用透视表将数据重塑为年份×国家的面板矩阵,从而支持固定效应或随机效应等计量经济模型的构建。数据高度结构化的特点,使其成为时间序列预测、表格回归及分类任务的理想基准。
解决学术问题
该数据集精准回应了劳动经济学中若干长期悬而未决的学术挑战。最核心的贡献在于,它首次以国际可比的标准化口径,系统呈现了欧洲各国不同年龄段和就业身份人群的就业规模,从而为跨国劳动市场异质性研究提供了高质量的数据基础。借助这一资源,学者得以深入探究老龄化社会背景下青年与成年劳动力的就业分化、非正规就业与自雇身份的演变规律,以及欧洲经济一体化进程中劳动市场趋同或分化的趋势。数据集所具有的久远时间跨度和历年完整覆盖,显著增进了对就业长期波动和结构性变迁的统计推断能力。
衍生相关工作
该数据集衍生出了一系列富有影响力的后续研究工作。在计量经济学领域,基于此面板数据构建的劳动供给弹性估计模型已被多篇顶级期刊论文采纳,用以量化工资变动对不同年龄段及就业身份人群的劳动参与行为。在机器学习的应用分支上,研究人员利用数据中清晰的时间序列结构,开发了专用于欧洲就业预测的时序模型,并公开了基于长短期记忆网络和Transformer架构的基准代码与性能指标。其他衍生工作还包括:基于年龄-就业身份交互效应的分解分析,揭示技能错配与劳动力市场脆弱性之间的关联;以及利用ILO统一数据源开展的跨国非正规就业规模比较研究,有力推动了国际劳动统计一体化的方法论进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务