遇见数据集

electricsheepeurope/europe-ilo-inj-nftl-sex-inj-mig-nb-cases-of-non-fatal-occupational-injury-by-sex-type

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲32个国家从1990年至2024年的非致命职业伤害案例数据,按性别、伤残类型和移民状况细分,共有7,424个观察值。数据源自国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Europe重新打包,用于表格分类、回归和时间序列预测等机器学习任务。数据集涵盖一个主要指标(INJ_NFTL_SEX_INJ_MIG_NB),提供国家代码、年份、观察值等列,并包含数据来源和质量说明。

This dataset contains 7,424 observations of non-fatal occupational injury cases across 32 European countries from 1990 to 2024, disaggregated by sex, type of incapacity, and migrant status. It is sourced from the International Labour Organization (ILO) ILOSTAT database and repackaged by Electric Sheep Europe for machine learning tasks such as tabular classification, regression, and time-series forecasting. The dataset includes one primary indicator (INJ_NFTL_SEX_INJ_MIG_NB) with columns for country codes, years, observed values, and metadata on data sources and quality.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-inj-nftl-sex-inj-mig-nb-cases-of-non-fatal-occupational-injury-by-sex-type 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API直接抽取指标INJ_NFTL_SEX_INJ_MIG_NB的原始数据,并依据ISO3国家代码筛选出欧洲32个国家的观测记录。ILOSTAT遵循国际劳工统计学家会议(ICLS)定义的标准,对各国劳动力调查、行政记录等多源微观数据进行统一协调,确保跨国的可比性。最终整合为7,424条年度观测,覆盖1990至2024年的时间跨度,由Electric Sheep Europe团队重新封装为HuggingFace上的机器学习就绪格式。
特点
该数据集聚焦于欧洲非致命性职业伤害的统计,按性别(男、女、总计)、伤残类型及移民身份三个维度进行精细拆解,核心指标唯一但分解维度丰富。数据涵盖32个欧洲国家,时间跨度达35年,部分国家如西班牙、匈牙利、法国的观测记录超过400条,保证了纵向分析的深度。来源列标记了每项观测对应的原始调查或行政数据源,增强了数据的可追溯性。数据结构以年度频率呈现,并附有观测状态标记,便于研究者评估数据的质量与可靠性。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据集,调用load_dataset()函数一键获取训练集格式的DataFrame。基于Pandas,可轻松按国家代码(ref_area)过滤特定国家的时间序列,或按指示器字段筛选非致命职业伤害数据后进行可视化分析。数据支持透视操作,能够快速构建国家×年份的观测值矩阵,适用于面板数据回归或时间序列预测任务。由于数据集采用标准化的表格结构,字段定义清晰,可直接用于机器学习模型的特征工程与训练流程。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)创建,经由Electric Sheep Europe于2024年重新打包并发布在HuggingFace平台上,旨在为欧洲职业伤害研究提供标准化、机器可读的时序数据。其核心研究问题聚焦于量化欧洲32个国家在1990至2024年间因性别、伤残类型及移民身份差异导致的非致命职业伤害案例分布。作为ILOSTAT数据库的分支,该数据集继承了ILO在劳动统计领域的权威性,为流行病学、劳动经济学及公共政策评估领域提供了关键数据支撑,尤其助力于追踪职场安全进展及评估移民劳工权益保护成效。通过对7424条观察值的结构化整合,它使得跨国比较与长期趋势分析成为可能,显著推动了职业健康领域的实证研究。
当前挑战
该数据集面临的领域挑战在于,职业伤害统计的跨国可比性受制于各国报告体系差异,例如伤残类型定义与移民身份识别标准的不统一,易导致数据偏差。构建过程中,ILO需从各国劳动力调查、行政记录等多源异构数据中,依据国际劳工统计学家会议(ICLS)定义进行归一化处理,但部分国家历史数据缺失或采用不同参考周期,如丹麦数据止于2015年,匈牙利数据始于1994年。此外,数据涵盖年度频率,但未包含部分国家发布的月度或季度序列,且当同一国家年份存在多源数据时需人为选定'最佳来源',这些取舍均可能削弱数据的粒度与完整性。
常用场景
经典使用场景
在职业健康与安全研究领域,该数据集为分析欧洲各国非致命性职业伤害的分布特征提供了标准化基础。研究者可依据性别、行动能力丧失类型及移民身份等多维分类维度,系统考察不同群体面临的职业伤害风险差异。通过对1990年至2024年间32个欧洲国家的7424条观测值进行时间序列分析,能够揭示职业伤害发生率的变化趋势及其在国别间的异质性。该数据集的经典用法包括构建面板数据模型,以探究经济周期、产业结构和劳动保护政策对职业伤害频次的影响。此外,它也是检验国际劳工组织职业安全标准执行效果的关键数据源。
实际应用
在实际应用中,该数据集为欧盟及各国劳动监察机构优化职业安全监管策略提供了量化工具。政策制定者可利用按性别和移民身份分层的伤害数据,识别高风险工人群体并设计针对性的防护措施。企业安全管理部门能够参照跨国基准值,评估本单位的安全绩效并改进操作规程。同时,该数据服务于职业伤害保险精算模型的校准,助力保险公司更精确地厘定保费率和准备金。医疗康复系统亦能依据伤害类型分布数据,合理安排康复资源与职业重返计划,提升工伤康复的社会经济效益。
衍生相关工作
该数据集衍生出的经典工作主要集中在对多维度分类特征的深度挖掘与建模上。已有研究利用该数据构建了基于性别和移民状态的分组时序预测模型,比较了不同群体非致命伤害率的长期演化路径。另一些工作将其与宏观劳动经济数据进行融合,开发了用于评估工作场所安全政策有效性的计量经济学框架。在计算社会科学领域,学者们借助该数据集验证了职业伤害风险在跨国劳动力流动中的空间传导效应。此外,该数据也成为训练机器学习模型以识别职业伤害预警因子的基准来源,催生了若干预测职业伤害发生概率的集成学习系统。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务