electricsheepeurope/europe-ilo-ees-tees-sex-eco-geo-nb-employees-by-sex-economic-activity-and-rural-urban
收藏数据链接:
官方服务:
资源简介:
这是一个关于欧洲国家雇员数据的表格数据集,包含101,062个观测值,覆盖39个欧洲国家,时间跨度为1992年至2025年。数据集聚焦于一个核心指标:按性别、经济活动和城乡地区分类的雇员数量(以千人为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,涵盖了就业、失业、工资等多个劳动统计领域。数据集经过Electric Sheep Europe重新打包,以Parquet格式提供,便于机器学习使用。
This is a tabular dataset on employee data for European countries, containing 101,062 observations across 39 European countries from 1992 to 2025. It focuses on one key indicator: employees by sex, economic activity, and rural/urban areas (in thousands). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), covering various labor statistics such as employment, unemployment, and wages. The dataset has been repackaged by Electric Sheep Europe in Parquet format for machine learning readiness.
提供机构:
electricsheepeurope搜集汇总
数据集介绍

构建方式
该数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,由Electric Sheep Europe通过REST API接口直接抽取指标EES_TEES_SEX_ECO_GEO_NB的原始记录,并依据ISO3国家代码筛选出39个欧洲国家,时间跨度为1992年至2025年。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、住户收入调查及行政记录等微观数据进行标准化调和,数据抽取后以Parquet列式格式重新封装,保留来源标签以确保可追溯性,最终形成逾十万条观测的即用型数据集。
特点
数据集涵盖39个欧洲国家、超过十万条年度观测,以员工人数(千人)为核心指标,按性别(总计、男性、女性)、经济活动大类及城乡区域进行多维分解。字段设计遵循整洁数据原则,包含国家代码、来源标识、指标编码、分类变量、时间、观测值及质量状态标志,便于筛选与建模。数据时间跨度长,覆盖多个国家数十年的连续序列,且附带来源与方法论变更注释,为劳动经济学与时序分析提供细粒度、可复用的面板数据基础。
使用方法
研究者可通过HuggingFace datasets库以load_dataset函数直接加载,返回的Dataset对象可转换为Pandas DataFrame进行后续操作。典型用法包括按ref_area字段筛选单一国家、按indicator字段提取特定指标并依时间排序绘制趋势图,或利用pivot_table将数据重塑为国家×年份矩阵以开展横截面或面板回归。数据集亦适用于表格分类、回归及时间序列预测任务,使用时应留意obs_status与note_indicator等字段所提示的数据质量与方法论断点信息。
背景与挑战
背景概述
劳动力市场统计是洞察经济社会结构变迁的基石。国际劳工组织(ILO)长期致力于构建全球可比性劳动统计体系,其ILOSTAT数据库汇聚了二百余个经济体的就业、失业与工资等核心指标。在此背景下,Electric Sheep Europe于2025年对ILOSTAT中“按性别、经济活动及城乡区域划分的雇员数据”进行重新封装,形成覆盖39个欧洲国家、跨越1992至2025年、逾十万条观测值的区域面板数据集。该数据集以性别、经济活动门类和城乡属性为多维 disaggregation 核心,为欧洲就业结构的时空演化研究提供了细粒度、可复用的标准化数据基础。
当前挑战
该数据集所直面的核心挑战在于跨国劳动力统计的异质性与可比性平衡。各国数据来源于劳动力调查、家庭收入调查及行政记录等多元渠道,调查口径、抽样框架与统计标准存在系统性差异,ILO虽以国际劳工统计学家会议(ICLS)定义进行调和,但观测状态标志中仍保留“不可靠”“系列中断”等质量注记。构建过程中的突出难题包括:城乡区域分类在不同国家间的操作化定义尚未统一,部分国家年份覆盖不完整,且性别与经济活动的交叉细分导致部分单元格样本量不足,需依赖统计模型进行插补估计,由此引入估计误差。这些因素共同构成使用者在跨国比较与趋势推断时必须审慎对待的方法论边界。
常用场景
经典使用场景
在劳动经济学与区域科学的交叉研究中,该数据集往往充当着性别维度的就业结构分析的基石。研究者惯常将其用于刻画欧洲各国在不同经济部门与城乡地域之间雇员数量的长期变迁轨迹,借助面板数据模型或时间序列分解技术,辨析性别参与率的收敛趋势与结构断裂。其经典场景涵盖了从宏观层面的跨国比较到微观层面的行业异质性探讨,为理解欧洲劳动力市场的性别分层与空间不均等提供了关键的数据支撑。
解决学术问题
该数据集有效回应了劳动统计领域长期存在的若干学术难题,诸如性别就业数据的跨国可比性不足、城乡就业统计口径悬殊以及经济部门分类与性别维度交织时的样本稀疏问题。通过ILO的统一协调与ICLS定义框架,它使得研究者能够在一致的统计口径下检验性别就业差距的时空演变,评估结构性转型对男女雇员的不同影响,进而深化对欧洲一体化进程中劳动力市场制度效应的实证认知。
衍生相关工作
围绕该数据集,学界与数据科学社区衍生了一系列经典工作。比较典型的包括基于ILOSTAT面板数据的性别就业差距分解研究、城乡就业弹性估计以及经济部门分类下的就业极化分析。此外,部分研究将其与Eurostat区域账户数据融合,构建更为精细的空间计量模型,探究基础设施与城镇化对女性就业参与的影响。Electric Sheep Europe的标准化封装亦促进了机器学习方法在劳动统计预测中的可复现性探索。
以上内容由遇见数据集搜集并总结生成



