遇见数据集

electricsheepeurope/europe-ilo-emp-temp-sex-ind-ste-nb-employment-by-ilo-sector-and-sex-and-status-in-emp

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲16个国家从2001年至2025年的就业统计数据,具体指标为按ILO部门、性别和就业状况划分的就业人数(千)(EMP_TEMP_SEX_IND_STE_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动统计的主要来源,涵盖就业、失业、工资、工作时间、童工、非正规经济、社会保障、职业伤害和可持续发展目标体面工作指标等领域。数据集通过ILOSTAT REST API获取,并过滤为欧洲国家代码,使用国际劳工统计学家会议(ICLS)定义对原始调查微数据进行标准化处理。数据集包含41,691个观察值,每个观察值包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类(总计、男性、女性)、第一分类变量(如ILO部门)、第二分类变量(如就业状况)、观察年份、观测值、观测状态标志以及相关注释。数据以年度频率发布,部分国家数据可能包含不完整或不可靠的观测值。数据集旨在为研究人员和开发者提供机器学习就绪的欧洲劳动市场数据,可用于表格分类、回归和时间序列预测等任务。

This dataset contains employment statistics for 16 European countries from 2001 to 2025, specifically the indicator Employment by ILO sector and sex and status in employment (thousands) (EMP_TEMP_SEX_IND_STE_NB). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), a leading global source for labour statistics covering areas such as employment, unemployment, wages, working time, child labour, informal economy, social protection, occupational injuries, and SDG decent work targets. The dataset is obtained via the ILOSTAT REST API and filtered to European country codes, with raw survey microdata harmonized using International Conference of Labour Statisticians (ICLS) definitions. It includes 41,691 observations, each comprising country code, country name, data source, indicator code, indicator name, sex disaggregation (total, male, female), first classification variable (e.g., ILO sector), second classification variable (e.g., status in employment), observation year, observed value, observation status flag, and related notes. Data is published at annual frequency, with some country observations potentially incomplete or unreliable. The dataset is designed to provide machine learning-ready labour market data for Europe, suitable for tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-temp-sex-ind-ste-nb-employment-by-ilo-sector-and-sex-and-status-in-emp 数据集图片
构建方式
本数据集由Electric Sheep Europe团队基于国际劳工组织(ILO)的ILOSTAT数据库重新整理而成。数据通过ILOSTAT REST API接口直接获取,原始指标代码为EMP_TEMP_SEX_IND_STE_NB,随后筛选出欧洲16个国家的ISO3代码区域数据。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家计调查等原始微观数据进行标准化处理,并在source.label字段中标注数据来源以确保可追溯性。最终数据集以Parquet格式发布,支持通过HuggingFace Datasets库的load_dataset()函数一键加载。
特点
该数据集汇聚了2001年至2025年间欧洲16个国家的41,691条就业观测记录,涵盖按ILO行业、性别及就业身份划分的就业人数(千人为单位)。数据维度丰富,包括性别的三种分类(总、男、女)以及两级分类变量,允许研究者从行业总览到具体就业身份进行多粒度解析。数据集还提供了观测状态标志、指标注释与来源注释等元数据列,便于进行数据质量评估与断点序列识别,为跨国劳动经济学比较与时间序列分析奠定了坚实基础。
使用方法
研究者可通过HuggingFace Datasets库轻松加载数据:from datasets import load_dataset; ds = load_dataset('electricsheepeurope/europe-ilo-emp-temp-sex-ind-ste-nb-employment-by-ilo-sector-and-sex-and-status-in-emp')。加载后的数据集可直接转换为Pandas DataFrame进行后续分析,支持按国家代码筛选子集、针对单一指标进行时间序列可视化、以及通过透视表构建国家×年份的就业矩阵。该数据集适用于表格分类、回归及时序预测等任务,为欧洲就业趋势分析提供了便捷且标准化的数据接口。
背景与挑战
背景概述
在全球劳动力市场结构性转型与可持续发展目标(SDGs)推进的背景下,国际劳工组织(ILO)通过其核心统计数据库ILOSTAT,长期致力于收集与整合覆盖全球200余个经济体的劳动统计数据。该数据集由Electric Sheep Europe于2025年重新整理发布,聚焦欧洲16个国家2001至2025年间按产业、性别及就业身份划分的就业人数(单位:千)。数据源直接取自ILOSTAT的REST API,并经由国际劳工统计学家会议(ICLS)定义进行规范化处理,旨在为区域劳动力市场分析提供高颗粒度、跨时期与跨维度的标准化时序数据。这一数据集不仅深化了对欧洲各国就业结构差异的理解,也为劳动力政策评估与跨国产学研比较研究提供了可重复利用的基础数据资源。
当前挑战
该数据集所应对的核心领域挑战在于,欧洲各国就业数据来源多元(如劳动力调查、行政记录等),导致统计口径、时间跨度与分类标准存在异质性,进而制约跨区域比较与模型构建的准确性。构建过程中面临的主要困难包括:各国不同调查源间的数据融合与“最佳来源”的遴选规则制定,以确保时间序列的连续性与代表性;性别、产业分类及就业身份的多维交叉汇总带来的稀疏性与缺失值问题;以及来自ILOSTAT的年度频率数据无法捕捉季度或月度的短期波动,限制了高维时间序列预测的精细程度。同时,部分国家因政治或经济事件导致某些年份数据不可得,进一步增加了数据填补与模型泛化的复杂性。
常用场景
经典使用场景
在劳动经济学与跨国比较研究领域,该数据集因其按国际劳工组织(ILO)部门、性别及就业身份精细分层的欧洲就业统计数据而备受推崇。研究者常利用其覆盖2001至2025年跨度、囊括16个欧洲国家、总计超过四万条观测的丰富信息,进行时间序列分析与面板数据建模。例如,通过按性别和行业对就业趋势进行分解,可以揭示不同劳动市场的结构演变与周期性波动。
解决学术问题
该数据集有力支撑了欧洲劳动力市场中若干核心学术难题的实证研究。它助力学者剖析性别就业差异的长期演变轨迹,评估不同产业在就业创造中的角色与韧性,并深入探讨就业身份(如自雇与受雇)与经济周期之间的复杂互动。此外,通过提供标准化、跨国的可比数据,它解决了此前研究中因统计口径不一而导致的比较难题,为验证国际劳动标准与欧洲一体化对就业格局的影响提供了关键证据,对推动劳动经济学、性别研究与公共政策的量化分析具有深远意义。
衍生相关工作
基于该数据集已衍生出一系列具有影响力的经典工作。研究者以此为基础构建了欧洲就业预测模型,例如利用长短期记忆网络(LSTM)或Transformer架构,预测不同行业与性别在短期内的就业人数变动,服务于决策支持系统。另一类代表性工作是开发了针对劳动市场不平等的统计指标与可视化工具,如就业性别差距的分解分析图,使得复杂的数据洞见能以直观方式呈现给非专业用户。此外,该数据还常与宏观经济变量(如GDP、通胀率)等其他公开数据源联合使用,构建多变量回归模型,用以阐释就业变动的深层次驱动因素,推动了跨学科的计量经济学研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务