遇见数据集

electricsheepeurope/europe-ilo-ees-tees-sex-age-ocu-nb-employees-by-sex-age-and-occupation-thousands

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自39个欧洲国家从1991年到2025年的523,948条观测数据,核心指标为“按性别、年龄和职业划分的员工数量(以千计)”。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了员工统计信息,包括按性别(总计、男性、女性)、年龄组和职业分类的细分。数据集经过标准化处理,适用于表格分类、回归和时间序列预测等任务。数据以年度频率提供,并包含来源、观测状态和注释等元数据,确保可追溯性。

This dataset contains 523,948 observations from 39 European countries spanning 1991 to 2025, with the core indicator being Employees by sex, age and occupation (thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, covering employee statistics disaggregated by sex (total, male, female), age groups, and occupation classifications. It is standardized for tasks such as tabular classification, regression, and time-series forecasting. The data is provided at annual frequency and includes metadata such as source, observation status, and notes for traceability.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ees-tees-sex-age-ocu-nb-employees-by-sex-age-and-occupation-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口(https://rplumber.ilo.org/data/indicator?id=EES_TEES_SEX_AGE_OCU_NB)直接抽取原始数据,并依据ISO3国家代码筛选出39个欧洲国家。ILOSTAT采用国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查、机构调查及行政记录等微观数据进行统一化处理,以确保跨国可比性。数据集由Electric Sheep Europe重新打包发布,保留源标签列(source.label)以支持溯源。
使用方法
用户可通过HuggingFace的datasets库以一行代码加载数据集:`load_dataset("electricsheepeurope/europe-ilo-ees-tees-sex-age-ocu-nb-employees-by-sex-age-and-occupation-thousands")`,随后转换为Pandas DataFrame进行灵活操作。典型应用包括:筛选特定国家(如`df[df["ref_area"] == "DEU"]`)以分析国别趋势;提取单一指标的时间序列并绘制折线图;或通过透视表将数据重整为国家×年份矩阵。数据集遵循CC-BY-4.0许可,使用时需同时引用ILO原始来源与Electric Sheep Europe的重新打包工作。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳工统计的标准化与传播,其ILOSTAT数据库汇集了200余个经济体的劳动力调查数据,为就业、失业及职业结构研究提供了权威基准。在此背景下,Electric Sheep Europe于2026年对ILOSTAT原始数据进行再封装,发布覆盖39个欧洲国家、1991至2025年间逾52万条观察值的就业人员性别、年龄与职业分布数据集,旨在为劳动经济学、人口结构变迁及职业隔离等议题提供细粒度、可复现的分析基础。该数据集凭借其长时序、多维分解及国别可比性,已成为欧洲劳动力市场研究的重要基础设施。
当前挑战
本数据集所回应的核心领域问题在于:如何从异构国别调查中提取可比的就业人员职业分布,以揭示性别与年龄维度的结构性差异。构建过程中面临多重挑战:一是各国劳动力调查在抽样设计、职业分类及年龄分组上存在显著异质性,ILO虽以国际劳工统计学家会议定义进行协调,但部分国家仍保留非标准年龄组或方法学断点,导致时序比较需谨慎处理;二是数据中大量观测值附带‘不可靠’或‘临时’状态标志,对统计推断的稳健性构成威胁;三是职业分类仅提供技能层次的总量分解,缺乏细分职业类别,限制了职业隔离的精细测度;四是部分国家早期年份数据缺失,面板不平衡问题突出。
常用场景
经典使用场景
劳动力市场统计分析领域长期依赖跨国可比的就业结构数据,该数据集恰为这一需求提供了坚实支撑。其最经典的使用场景在于按性别、年龄组与职业分类对欧洲39国的雇员人数进行描述性统计与横向比较,研究者可借助其时间序列维度追踪1991至2025年间各经济体就业构成的演变轨迹,亦可利用其性别与年龄的多重交叉分类考察特定人群在职业层级中的分布特征,从而服务于劳动力供给结构变迁的实证刻画。
解决学术问题
该数据集有效回应了劳动经济学与社会分层研究中关于就业结构变迁的若干核心议题,诸如职业性别隔离的长期趋势、年龄组间职业分布差异随经济周期的调整、以及不同福利体制国家就业结构的收敛与分化等。其跨国可比性与长时序覆盖为面板数据分析、队列效应识别与政策评估提供了可靠的经验基础,对理解欧洲一体化进程中劳动力市场的结构性转型具有重要的实证意义。
实际应用
在实际应用层面,该数据集为国际组织与各国劳动行政部门监测就业结构变化、评估积极劳动力市场政策效果提供了量化依据;企业人力资源部门可借助其把握不同国家与职业类别的人才供需格局,为跨国招聘与用工规划提供参考;咨询机构与智库亦常将其用于撰写欧洲劳动力市场年度报告,支撑投资区位选择与产业布局决策。
数据集最近研究
最新研究方向
在全球化劳动力市场重构与人口结构转型的宏观背景下,基于ILOSTAT权威数据的研究正朝向高维面板数据的精细化建模演进。该数据集凭借其涵盖39个欧洲国家、逾52万条观测值的广度和1991至2025年的时间纵深,为劳动经济学与计量社会科学提供了独特的准实验场域。前沿研究聚焦于运用机器学习方法解析性别、年龄与职业技能层级之间的非线性交互效应,尤其关注后疫情时代欧洲劳动力市场的结构性断裂与复苏异质性。与此同时,欧盟性别平等战略与积极老龄化政策框架的推进,使得该数据集成为评估职业隔离演变、青年就业脆弱性以及技能供需错配等热点议题的关键实证基础。其标准化架构与多维度分类体系亦推动了可复现研究和跨国比较分析的方法论革新,对循证政策制定具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务