遇见数据集

electricsheepeurope/europe-ilo-ees-tees-sex-edu-mts-nb-employees-by-sex-education-and-marital-status-thou

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是国际劳工组织(ILO)ILOSTAT数据库的欧洲子集,专注于按性别、教育程度和婚姻状况分类的雇员数量(千计)指标。它包含1987年至2025年期间39个欧洲国家的148,547个观测值,数据以年度频率提供,涵盖性别(总计、男性、女性)、教育程度(聚合总计)、婚姻状况(聚合总计)等维度。数据集用于表格分类、回归或时间序列预测任务,原始数据来自ILOSTAT REST API,经Electric Sheep Europe重新打包为Parquet格式,以支持机器学习应用。数据来源包括劳动力调查等国家统计,ILO负责根据国际劳工统计学家会议(ICLS)定义进行协调,确保跨国家可比性。

This dataset is a European subset of the International Labour Organization (ILO) ILOSTAT database, focusing on the indicator Employees by sex, education and marital status (thousands). It contains 148,547 observations across 39 European countries from 1987 to 2025, with annual frequency data disaggregated by sex (total, male, female), education (aggregate total), and marital status (aggregate total). The dataset is designed for tabular classification, regression, or time-series forecasting tasks, sourced directly from the ILOSTAT REST API and repackaged by Electric Sheep Europe into Parquet format for machine learning readiness. Data originates from national sources such as labour force surveys, harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions for cross-country comparability.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ees-tees-sex-edu-mts-nb-employees-by-sex-education-and-marital-status-thou 数据集图片
构建方式
该数据集立足国际劳工组织(ILO)长期构建的全球劳动力统计体系,以ILOSTAT中央数据库为唯一权威来源。构建过程依托ILOSTAT REST API,直接提取指标代码为EES_TEES_SEX_EDU_MTS_NB的原始观测记录,并依据ISO 3166-1 alpha-3国家代码筛选出39个欧洲国家。原始调查微观数据经国际劳工统计学家会议(ICLS)定义统一协调,来源信息保留于source.label字段以保障可追溯性。Electric Sheep Europe随后对数据进行模式规范化与Parquet格式封装,最终形成148,547条年度观测记录。
特点
数据集覆盖1987至2025年欧洲39国的雇员统计,共148,547条观测,规模介于十万至百万之间,属中等体量表格数据。其核心特征在于多维 disaggregation 结构:性别维度包含总计、男性与女性三类,教育程度与婚姻状况分别通过classif1与classif2字段编码,且仅当指标发布该细分时对应列才非空。数据附有来源标签、观测状态标志及分类注释,能够标识临时数据、不可靠估计或序列中断等质量信息。年度频率与单一指标设计使其适用于面板分析与趋势建模。
使用方法
研究者可通过HuggingFace datasets库以load_dataset函数直接加载该数据集,并转换为Pandas数据框进行后续分析。典型用法包括按ref_area字段筛选单一国家子集,或针对indicator字段提取特定指标后按时间排序绘制时间序列。若需构建国家与年份的二维矩阵,可使用pivot_table以time为索引、ref_area为列、obs_value为值进行重塑。数据亦可直接用于表格分类、回归或时间序列预测任务,使用时应遵循cc-by-4.0许可并同时引用ILO原始来源与Electric Sheep Europe的再封装工作。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计数据的系统化建设,ILOSTAT作为其核心数据库,为劳动经济学研究提供了权威的跨国比较基础。在此背景下,Electric Sheep Europe团队于2025年对该组织关于欧洲地区雇员性别、教育程度与婚姻状况的细分统计数据进行标准化重封装,形成覆盖39个欧洲国家、时间跨度自1987年至2025年、共计148547条观测记录的结构化数据集。该数据集回应了劳动经济学中关于教育回报与婚姻状态交互效应的长期研究需求,为跨国面板分析、性别差异研究和时序预测建模提供了高质量基础数据,其影响力体现在降低了欧洲劳动力市场微观实证研究的门槛。
当前挑战
该数据集所涉领域问题的挑战体现在:雇员特征与劳动力市场产出的关联分析中,教育程度、婚姻状况与性别之间存在复杂的交互效应,传统统计方法难以有效分离各维度独立贡献,且跨国比较需应对制度差异带来的测量不变性问题。构建过程中的挑战则包括:ILOSTAT原始数据源自各国劳动力调查与行政记录的异构汇集,不同国家在指标定义与调查方法上存在显著差异,虽经ILO依据国际劳工统计学家会议定义进行协调,但数据质量标志所揭示的方法论修订与序列断裂问题仍难以根除,部分观测因可靠性不足而被标注为不可用,制约了长时序分析的稳定性与跨国可比性。
常用场景
经典使用场景
在劳动经济学与人口统计学的实证研究中,该数据集常被用于构建跨国别、长时序的面板数据模型,以探究性别、教育程度与婚姻状况对雇员规模的交互影响。研究者借助其精细的分类维度,可实施多层级回归分析或双重差分设计,从而揭示欧洲各国劳动力市场中就业结构的演化规律。
实际应用
在政策实践中,该数据集为欧盟及各国劳工部门监测特定群体就业动态、评估教育扩张与家庭政策效果提供了量化依据。国际组织亦可借助其趋势分析,制定针对女性、高学历者或特定婚姻状态人群的就业促进策略,助力实现包容性增长与体面劳动目标。
衍生相关工作
基于该数据集,学界相继开展了劳动力市场性别隔离分解、教育错配与婚姻溢价估计等衍生研究,并催生了若干跨国就业结构比较的经典论文。部分工作进一步将其与欧盟收入调查数据链接,拓展至工资差异与就业质量评估领域,形成了一系列具有政策影响力的学术成果。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务