遇见数据集

electricsheepeurope/europe-ilo-ees-tees-sex-eco-nb-employees-by-sex-and-economic-activity-thousands

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含122,805条观测数据,涉及43个欧洲国家从1969年至2025年的员工统计信息,核心指标为按性别和经济活动划分的员工数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖就业相关统计,并经过Electric Sheep Europe重新打包,以表格形式提供,适用于分类、回归和时间序列预测等任务。数据集包括国家代码、年份、性别分类、经济部门、观测值等字段,并包含数据来源和质量注释。

This dataset contains 122,805 observations of employees data across 43 Europe countries, spanning from 1969 to 2025, with the key indicator Employees by sex and economic activity (thousands). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), covering labor statistics, and repackaged by Electric Sheep Europe. The data is provided in tabular format, suitable for tasks like tabular classification, regression, and time-series forecasting, and includes fields such as country codes, year, sex disaggregation, economic activity, observed values, and source and quality notes.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ees-tees-sex-eco-nb-employees-by-sex-and-economic-activity-thousands 数据集图片
构建方式
该数据集源自国际劳工组织ILOSTAT数据库,通过REST API接口直接从官方端点获取原始指标数据,并限定欧洲ISO3国家代码进行筛选。ILOSTAT依据国际劳工统计学家会议定义对各国劳动力调查等微观数据进行标准化调和,数据保留了来源标签以确保可追溯性。最终由Electric Sheep Europe重新打包为Parquet格式发布,涵盖1969至2025年的观测记录。
特点
数据集包含122,805条观测,覆盖43个欧洲国家,时间跨度自1969年至2025年。核心指标为按性别和经济活动分类的雇员人数(千人),按性别维度分解为总计、男性和女性。模式包含国家代码、来源标识、指标代码、分类变量、观测年份、数值及多种状态注释列,规模介于10万至100万行之间,适用于表格分类、回归及时间序列预测任务。
使用方法
借助Hugging Face datasets库可通过load_dataset函数直接加载,并转换为Pandas DataFrame进行探索。用户可按ref_area筛选特定国家,按indicator过滤单一指标,或按时间排序绘制时间序列图。亦可利用pivot_table将数据重塑为国家与年份的交叉矩阵,便于开展跨国比较与面板分析。
背景与挑战
背景概述
在劳动力市场统计与性别平等议题日益受到全球关注的背景下,国际劳工组织(ILO)长期致力于构建跨国、可比且高频更新的就业数据体系,其核心数据库ILOSTAT被视为全球劳动统计的权威来源。该数据集由Electric Sheep Europe于2025年基于ILOSTAT REST API重新打包发布,涵盖1969至2025年间43个欧洲国家逾十二万条雇员观测记录,按性别与经济activity细分,旨在为劳动经济学、性别薪酬差距及产业结构变迁研究提供细粒度、可复现的ML-ready数据基础。其核心研究问题聚焦于性别维度的就业结构演化,对政策评估与国际比较研究具有重要支撑价值。
当前挑战
该数据集所回应的领域挑战在于:如何在全球范围内实现劳动力统计口径的统一与性别 disaggregation 的可比性,以支撑跨国面板分析与预测建模。构建过程中,数据源自各国家庭调查与行政记录,ILO虽依据ICLS定义进行调和,但原调查在抽样设计、经济activity分类标准及性别编码规范上存在显著异质性,导致系列断裂与观测状态标记(如provisional、unreliable)频现。此外,不同国家起始年份跨度大(1969至1993年不等),部分指标仅发布年度数据,且多源冲突时仅保留ILO甄选的'最佳来源',可能引入选择偏误。这些因素共同构成数据清洗、缺失值插补与时序建模中的实质性挑战。
常用场景
经典使用场景
在劳动经济学与就业结构分析的领域中,该数据集最为经典的使用场景在于依托其1969年至2025年、覆盖43个欧洲国家的纵向面板数据,构建按性别与经济活动部门分类的雇员人数时间序列。研究者可借助其细颗粒度的性别与行业维度,系统考察欧洲各国就业结构的演变轨迹,诸如女性劳动参与率在不同产业间的消长态势、经济周期波动对制造业与服务业雇员规模的差异化冲击,以及经济转型国家在融入欧洲一体化进程中的就业重构特征。
解决学术问题
该数据集有效回应了跨国劳动统计比较中长期存在的口径不一致与时间序列断裂问题。通过ILOSTAT基于国际劳工统计学家会议定义所实施的标准化调和流程,它使得不同欧洲国家、不同年份的雇员数据具备可比性,从而支撑关于性别就业差距、行业就业弹性以及结构性失业成因的实证检验。其观测状态标志与来源注释字段,更令研究者得以识别数据质量差异并处理方法学修订所致的序列断点,提升了比较劳动经济学研究的稳健性。
衍生相关工作
围绕这一数据资源,劳动经济学与计量社会科学领域已衍生出一系列经典工作,包括基于欧洲面板数据的性别就业差距分解研究、产业结构变迁对雇员规模影响的长期追踪分析,以及将ILOSTAT数据与欧盟劳动力调查微观数据相匹配的混合研究方法。Electric Sheep Europe的标准化封装亦促进了机器学习社区在多变量时间序列预测与表格分类任务上的基准测试开发,推动了劳动统计数据的可复现研究基础设施建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务