遇见数据集

electricsheepeurope/europe-ilo-ees-tees-sex-age-edu-nb-employees-by-sex-age-and-education-thousands

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别、年龄和教育程度划分的雇员(千人)| 欧洲(ILOSTAT)”,是一个表格型数据集,专注于欧洲地区的劳动力统计。它包含498,692条观察数据,覆盖39个欧洲国家,时间跨度为1987年至2025年。数据集的核心指标是“EES_TEES_SEX_AGE_EDU_NB”,即按性别、年龄和教育程度划分的雇员数量(以千人为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动力统计的主要来源,通过国家劳动力调查、家庭收入调查、机构调查和行政记录等收集数据。数据集经过Electric Sheep Europe重新打包,以Parquet格式发布,便于机器学习使用。数据结构包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、年龄和教育程度分类、观察年份、观察值(雇员数量)、观察状态标志以及相关注释列。数据按年度频率提供,并经过ILO的标准化处理,以确保一致性和可比性。数据集可用于表格分类、回归和时间序列预测等任务,适用于劳动力市场分析、经济研究和社会政策评估。

This dataset, titled "Employees by Sex, Age and Educational Attainment (Thousand Persons) | Europe (ILOSTAT)", is a tabular dataset focused on European regional labor statistics. It contains 498,692 observations spanning 39 European countries over the period from 1987 to 2025. The core indicator of this dataset is "EES_TEES_SEX_AGE_EDU_NB", which refers to the number of employees classified by sex, age and educational attainment, measured in thousand persons. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), a premier global source of labor statistics that collects data through national labor force surveys, household income surveys, establishment surveys and administrative records. This dataset was repackaged by Electric Sheep Europe and released in Parquet format to facilitate machine learning applications. The dataset's structure includes country code, country name, data source, indicator code, sex classifications (total, male, female), age and educational attainment categories, observation year, observed value (employee count), observation status flag, and relevant annotation columns. The data is provided at an annual frequency and has undergone standardization processing by the ILO to ensure consistency and cross-country comparability. It can be utilized for tasks including tabular classification, regression and time series forecasting, and is applicable to labor market analysis, economic research and social policy assessment.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ees-tees-sex-age-edu-nb-employees-by-sex-age-and-education-thousands 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的中央统计数据库ILOSTAT,通过其REST API接口(https://rplumber.ilo.org/data/indicator?id=EES_TEES_SEX_AGE_EDU_NB)直接抽取原始数据,并依据ISO3国家代码筛选出39个欧洲国家。ILOSTAT采用国际劳工统计学家会议(ICLS)的定义对各国劳动力调查等微观数据进行统一协调,数据来源在source.label列中予以标注,确保可追溯性。最终由Electric Sheep Europe重新打包为HuggingFace数据集,共计498,692条观测记录。
特点
该数据集覆盖1987至2025年间39个欧洲国家的雇员统计,包含近50万条观测记录,以性别、年龄和教育水平三个维度进行 disaggregation,提供男性、女性及总计三类性别分类,并涉及年龄组和教育层次的细分。数据结构包含20余个字段,涵盖国家代码、指标代码、观测值、数据来源及质量备注等元信息,支持表格分类、回归与时间序列预测等多类任务。
使用方法
研究者可通过HuggingFace的datasets库以一行代码加载数据:ds = load_dataset('electricsheepeurope/europe-ilo-ees-tees-sex-age-edu-nb-employees-by-sex-age-and-education-thousands'),随后转换为Pandas DataFrame进行灵活分析。典型操作包括按国家代码筛选特定国家数据、提取单一指标的时间序列并可视化、或透视生成国家×年份矩阵以支持面板数据分析。
背景与挑战
背景概述
伴随欧洲劳动力市场结构变迁与教育扩张,按性别、年龄与教育程度细分的就业数据成为实证研究的重要基础。国际劳工组织(ILO)统计部门长期承担全球劳动力统计的协调与标准化工作,依托各国劳动力调查与行政记录构建ILOSTAT数据库。该数据集由Electric Sheep Europe于2025年从ILOSTAT接口获取并重新封装,涵盖39个欧洲国家、1987至2025年间共498,692条观测。其核心研究问题在于揭示欧洲各国就业人口在性别、年龄与教育维度上的分布差异及演变趋势,为劳动经济学、人口学与教育政策研究提供可比数据支撑。
当前挑战
该数据集所回应的领域问题,在于跨国、跨期劳动力统计的可比性:不同国家调查口径、教育分类标准与年龄分组方式存在显著异质性,ILO需依据国际劳工统计学家会议定义进行协调,但仍难以完全消除断点。构建过程中的挑战亦不容忽视:原始数据源自抽样调查,存在缺失年份、观测状态标记为不可靠或临时值的情况,部分国家仅覆盖较晚时段;性别、年龄与教育分类并非所有指标均有完整发布,导致非空维度稀疏;教育层级聚合方式不一,进一步增加跨国比较的复杂度。
常用场景
经典使用场景
在劳动经济学与人口统计学的交汇处,该数据集以欧洲39国1987至2025年近50万条观测为基石,构筑了按性别、年龄与教育程度三维交叉的雇员规模时序面板。经典使用场景聚焦于拆分教育回报与人口结构变迁对就业总量的贡献,研究者可借助固定效应模型或队列分析,追踪不同教育层级劳动力在性别与代际间的分布演化,从而揭示欧洲一体化进程中就业结构的收敛与分化。
实际应用
在政策评估与商业决策层面,该数据集为欧盟技能议程、养老金改革及区域劳动力规划提供量化依据。国家统计部门可据此校准月度劳动力调查的年度基准;跨国企业借助国别×年龄×教育维度的雇员存量时序,优化欧洲市场的用工布局与人才储备策略;国际组织则利用其监测可持续发展目标中充分就业与体面劳动的进展,识别教育错配高风险群体。
衍生相关工作
基于该数据集,Electric Sheep Europe构建了标准化Parquet数据层,催生了一系列欧洲劳动力市场机器学习应用,包括雇员规模的多步时序预测、教育分组就业率的聚类分析以及性别就业差距的因果推断研究。相关衍生物还涵盖与Eurostat、OECD数据源的交叉验证工作,以及面向HuggingFace生态的表格分类与回归基准测试,推动了开放劳动统计数据的可复现研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务