遇见数据集

electricsheepeurope/europe-ilo-emp-temp-sex-ind-edu-nb-employment-by-ilo-sector-and-sex-and-education-tho

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于欧洲16个国家2001年至2025年按国际劳工组织(ILO)部门、性别和教育水平划分的就业人数(以千计)的统计数据集。数据集包含63,789个观测值,涵盖一个核心指标(EMP_TEMP_SEX_IND_EDU_NB),数据来源于国际劳工组织的ILOSTAT数据库,并通过API获取后经过过滤和标准化处理。数据集提供了详细的列结构,包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、教育分类、观测年份、观测值及其状态标志等。该数据集适用于表格分类、表格回归和时间序列预测等机器学习任务,并遵循CC-BY-4.0许可协议。

This dataset contains 63,789 observations of employment statistics across 16 European countries from 2001 to 2025, focusing on the indicator Employment by ILO sector and sex and education (thousands) (EMP_TEMP_SEX_IND_EDU_NB). The data is sourced from the International Labour Organizations ILOSTAT database, retrieved via its REST API, and filtered for European countries. It includes detailed columns such as country codes, country names, data sources, indicator codes, sex disaggregation (total, male, female), education classifications, observation years, observed values, and quality flags. The dataset is designed for tabular classification, regression, and time-series forecasting tasks, and is released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-temp-sex-ind-edu-nb-employment-by-ilo-sector-and-sex-and-education-tho 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API直接采集了标识码为EMP_TEMP_SEX_IND_EDU_NB的就业指标数据,并依据欧洲ISO3国家代码进行地理筛选。数据历经ILO统计部门的标准化处理,基于国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等原始微观数据进行同质化校准。最终由Electric Sheep Europe团队重新打包为Parquet格式,共汇集16个欧洲国家从2001年至2025年的63,789条观测记录,每个记录均追溯至原始数据源标签,确保了数据链路的透明可复现。
特点
本数据集聚焦于按ILO部门、性别及教育程度划分的就业人数(单位:千),呈现出多维度的精细分层结构。其特色在于提供sex、classif1(部门分类)与classif2(教育分类)三个核心非空分组维度,能够灵活支持性别、行业与教育水平的交叉分析。数据囊括了覆盖近25年的长时序序列,且各观测值均附带状态标记(如临时值、不可靠值)及系列断裂、方法修订等备注,赋予研究者充分的数据质量判别能力。国家覆盖从西欧到巴尔干地区的广泛代表性,适用于跨区域比较研究。
使用方法
数据集可直接通过HuggingFace Datasets库的load_dataset()函数一键加载至内存,返回的train分片可转化为Pandas DataFrame进行后续操作。研究者可按ref_area字段筛选特定国家的子集,或以time列为索引绘制单一指标的时序趋势图。利用pivot_table可快速构建以年份为行、国家为列的指标矩阵,便于面板数据分析。数据中sex、classif1和classif2列提供了丰富的分组变量,用户可依据分析需求过滤特定性别、部门或教育层次后,进行描述性统计与计量建模。
背景与挑战
背景概述
在全球劳动力市场动态分析中,国际劳工组织(ILO)的统计数据库ILOSTAT作为劳动统计的核心权威来源,提供了跨越国家、时间与维度的系统性就业数据。于2025年由Electric Sheep Europe团队重新打包并发布的数据集europe-ilo-emp-temp-sex-ind-edu-nb-employment-by-ilo-sector-and-sex-and-education-tho,聚焦于欧洲地区,涵盖16个国家自2001年至2025年间共计63,789条观测值。该数据集的核心研究问题在于揭示欧洲各国就业状况在行业、性别与教育程度层面的结构性分布,为比较劳动经济学、社会分层及政策评估提供量化基础。其影响力体现在促进跨区域劳动力市场的可比分析,助力实现联合国可持续发展目标中的体面工作指标(SDG 8),并推动基于机器学习的时序预测与分类研究。
当前挑战
该数据集所解决的领域问题在于应对劳动统计中多维粒度数据整合的挑战,尤其是在欧洲多国经济体中,行业划分、性别差异与教育水平对就业模式的交互影响难以通过单一指标量化。研究人员需处理来自不同国家劳动调查的异质性,包括定义差异、计量单位不统一及数据质量标记(如观测状态为‘不可靠’的字段)。构建过程中,数据集面临的主要挑战包括:从ILOSTAT REST API获取原始数据时需依赖其‘最佳来源’选择逻辑,避免因多源冲突导致数据冗余;对16个欧洲国家按ISO3编码过滤后,需处理时间跨度不均衡(如乌克兰仅覆盖2018至2021年)及部分分类维度(如教育程度非标准水平)的缺失值;数据频率仅提供年度观测,限制了高频时间序列分析的普适性。
常用场景
经典使用场景
该数据集汇集了国际劳工组织ILOSTAT数据库中涵盖16个欧洲国家、时间跨度达25年的就业数据,按ILO产业部门、性别与教育水平三个维度进行精细分层。经典使用场景集中于利用该表格数据进行时间序列分析与面板数据建模,研究者可据此考察欧洲各国就业结构的演变趋势,例如通过混合效应模型或固定效应回归探究不同教育水平人群在各产业部门中的就业分布变迁,或借助性别维度剖析劳动力市场的性别差异及其动态变化。
解决学术问题
该数据集为解决劳动力经济学与社会科学中关于教育与就业回报率、产业结构转型对就业影响及性别就业不平等机制等核心学术问题提供了坚实的数据支撑。其分层统计特性使研究者能够精准识别教育水平提升对不同产业就业弹性的调节作用,同时借助跨国面板数据分析制度环境对性别就业差距的异质性影响,推动了人力资本理论与劳动力市场分割理论的实证检验与拓展。
衍生相关工作
围绕该数据集已衍生出一系列经典学术工作,包括基于ILOSTAT数据构建的欧洲就业预测模型、教育水平与产业部门交互效应下的就业弹性估计,以及运用多水平模型分解国家层面与个体层面因素对性别就业差异的贡献。此外,数据的高时间分辨率与标准化编码方式也催生了后续数据集,例如补充非正规就业或工资维度,形成更为全面的欧洲劳动力市场全景数据库,服务于可持续发展和体面劳动目标的量化评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务