遇见数据集

electricsheepeurope/europe-ilo-inj-work-eco-nb-workers-in-the-reference-group-by-economic-activit

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲职业伤害数据,具体指标为按经济活动划分的参考组工人数量(千)。数据集覆盖36个欧洲国家,时间跨度为1970年至2024年,共22,498条观测记录。数据通过ILOSTAT REST API获取,并经过筛选和规范化处理,包括国家代码、来源标签、指标分类等字段。数据集适用于表格分类、回归和时间序列预测等任务,重点关注劳动统计和职业安全领域。数据以年度频率发布,并包含数据质量说明,如来源选择和分类变量非空条件。

This dataset contains European occupational injury data sourced from the International Labour Organization (ILO) ILOSTAT database, with the specific indicator being the number of workers in reference groups (in thousands) categorized by economic activity. It covers 36 European countries, spans the time period from 1970 to 2024, and includes a total of 22,498 observational records. The data was acquired via the ILOSTAT REST API, and has undergone screening and standardization procedures, involving fields such as country codes, source labels, and indicator classifications. This dataset is suitable for tasks including table classification, regression, and time series forecasting, with a focus on the domains of labor statistics and occupational safety. It is released at an annual frequency, and also contains data quality explanations such as source selection criteria and non-null requirements for categorical variables.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-inj-work-eco-nb-workers-in-the-reference-group-by-economic-activit 数据集图片
构建方式
该数据集由国际劳工组织(ILO)旗下的ILOSTAT核心统计数据库提供,经由Electric Sheep Europe团队重新封装后发布于HuggingFace平台。构建过程首先通过ILOSTAT的REST API接口提取职业伤害相关的原始指标数据,随后将地理范围限定至欧洲36个国家的ISO3编码区域。ILOSTAT利用国际劳工统计学家会议(ICLS)定义的标准对各国劳动力调查、行政记录等微观数据进行统一协调与清洗,并在数据集中保留来源标识列(source.label)以确保可追溯性。最终数据集以22,498条观测记录呈现,覆盖1970年至2024年的时间跨度,所有数据遵循CC-BY-4.0许可协议。
特点
该数据集的核心特点在于其聚焦欧洲地区职业伤害领域中经济活动的参考组工人数量(以千计),单一指标INJ_WORK_ECO_NB贯穿始终,但通过丰富的分类维度(如经济活动的聚合分类)和来源标识实现了精细化分析。时间跨度长达54年,覆盖36个欧洲国家,其中芬兰、瑞典、西班牙等国的观测记录超过千条,而每个国家的数据年限分布各异,为纵向比较提供了充足样本。此外,数据集标注了观测状态(如不可靠、临时值)及多类注释信息,有助于研究者评估数据质量,同时其表格化架构兼容分类、回归及时间序列预测等多种任务场景。
使用方法
研究者可通过HuggingFace的datasets库直接加载该数据集,调用load_dataset函数即可获取训练集并转换为Pandas DataFrame进行后续操作。针对特定国家的分析,可利用ref_area列进行过滤,例如提取德国的全部记录。时间序列分析可通过按时间排序指标值并绘制折线图实现,结合obs_value列展示变化趋势。如需构建国家与年份的二维矩阵,使用pivot_table方法以时间为行、国家为列即可透视数据。该数据集支持灵活的分组、可视化与建模,适用于欧洲劳动力市场中职业伤害统计的深度挖掘与比较研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2024年整理发布,并经Electric Sheep Europe重封装,聚焦于欧洲36国1970至2024年间按经济活动划分的参考组工人数量(以千计),共计22,498条观测记录。作为ILOSTAT核心数据库的衍生成果,该数据集旨在系统刻画欧洲各国在不同经济部门中劳动者的分布格局,为劳动经济学、职业安全与公共政策研究提供标准化、跨时空的量化基础。其核心贡献在于整合了多元行政记录与调查数据,通过统一框架实现跨国可比性,从而支撑关于就业结构变迁、产业转型及职业伤害流行病学等方向的实证分析,已成为评估欧洲劳动力市场动态与可持续发展目标进展的重要数据基础设施。
当前挑战
该数据集面临的核心挑战源于领域问题与构建过程的多重复杂性。领域层面,需应对经济活动分类标准(如ISIC修订版)的历史演进与国别差异所导致的跨时间可比性困境,以及不同来源数据(如劳动力调查与行政档案)在统计口径、覆盖范围与质量控制上的异质性,这些因素直接影响了职业伤害分析中分母人群定义的精确性。构建过程中,ILO需通过复杂的数据协调机制从200余国原始资料中筛选“最佳来源”,但部分观测值(如标记为不可靠的条目)仍存在质量隐忧;同时,历史数据稀疏性与经济部门粒度不均衡加剧了时序建模的噪声风险,而国家级汇总数据难以捕捉区域内企业规模、行业细分等更精细维度的结构差异,限制了深度推断能力。
常用场景
经典使用场景
在欧洲劳动安全与健康研究领域,该数据集以其跨越半个世纪的时序深度和覆盖36国的地理广度,成为分析职业伤害发生率与经济结构变迁关系的基石。研究者常利用22,498条观测记录,按经济活动分类构建面板数据,追踪不同行业(如制造业、建筑业、农林渔业)中参考组工人数量的长期演变。经典使用场景包括:量化欧盟东扩后劳动力市场一体化对各国职业伤害风险的异质性影响,或结合宏观经济周期指标,揭示经济衰退期与扩张期工人暴露程度的变化规律。其标准化ILOSTAT分类体系(ECO_AGGREGATE_TOTAL等)使得跨年代跨国别的可比分析成为可能。
解决学术问题
该数据集有效回应了两个长期困扰比较劳动研究的学术难题:一是欧洲层面职业伤害统计标准的碎片化问题,ILO通过ICLS定义对原始调查数据进行协调,提供了统一的口径;二是发展中国家与转型经济体(如东欧诸国)在1970-2024年间职业伤害统计数据的稀疏性与不可比性。学者由此得以检验‘安全健康劳动’(SDG 8.8)目标在欧洲的实现路径,探究福利国家制度差异如何调节经济增长与工伤风险之间的关系。数据集的发布使宏观计量模型能够控制国家固定效应,辨识出行业转型、技术进步与劳动力保护政策对工人安全的真实贡献。
衍生相关工作
该数据集催生了一系列衍生工作,构成欧洲劳动计量研究的方法论生态。最具代表性的是面板数据因果推断研究,例如采用双重差分法评估欧盟《职业安全与健康战略框架》对特定国家行业工人暴露量的处理效应,或运用事件研究法分析2008年金融危机后南欧国家就业结构调整与工伤分布的同步变化。另一支经典工作聚焦于数据融合技术,学者将该时序数据与欧盟统计局(Eurostat)的GDP与就业率数据对齐,构建结构化向量自回归模型,量化经济冲击向职业伤害指标的传导时滞。此外,数据驱动的聚类分析被用于划分欧洲国家职业安全发展轨迹,识别出北欧预防型与南欧事后补偿型的治理模式差异。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务