遇见数据集

electricsheepeurope/europe-ilo-inj-work-sex-mig-nb-workers-in-the-reference-group-by-sex-and-migrant

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别和移民身份划分的参考组工人数量(千计)| 欧洲(ILOSTAT数据),是一个关于欧洲职业伤害的表格数据集。它包含2,088个观测值,覆盖35个欧洲国家,时间范围为1970年至2024年,专注于一个核心指标:INJ_WORK_SEX_MIG_NB,即按性别和移民身份划分的参考组工人数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API获取并经过欧洲国家代码过滤。数据集包含多列信息,如国家代码(ISO 3166-1 alpha-3)、国家名称、数据来源代码和标签、指标代码和标签、性别分类(总计数、男性、女性)、移民状态分类、观测年份和观测值等。数据以年度频率发布,并经过ILO的协调处理,确保定义一致性。数据集适用于表格分类、回归和时间序列预测任务,可用于分析欧洲各国工人数量的趋势和差异。数据集由Electric Sheep Europe重新打包,以Parquet格式发布,便于机器学习使用,遵循CC-BY-4.0许可证。

This dataset, titled Workers in the reference group by sex and migrant status (thousands) | Europe (ILOSTAT), is a tabular dataset focusing on occupational injuries in Europe. It contains 2,088 observations across 35 European countries, spanning the years 1970 to 2024, and covers one distinct indicator: INJ_WORK_SEX_MIG_NB, which represents the number of workers in the reference group by sex and migrant status in thousands. The data is sourced from the International Labour Organization (ILO) ILOSTAT central statistics database, retrieved via REST API and filtered to Europe ISO3 country codes. The dataset includes columns such as country code (ISO 3166-1 alpha-3), country name, source code and label, indicator code and label, sex disaggregation (total, male, female), migrant status classification, observation year, and observed value. Data is published at annual frequency and harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions. It is suitable for tabular classification, regression, and time-series forecasting tasks, enabling analysis of trends and disparities in worker counts across Europe. Repackaged by Electric Sheep Europe in Parquet format for machine learning readiness, it is released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-inj-work-sex-mig-nb-workers-in-the-reference-group-by-sex-and-migrant 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT中央统计数据库,通过REST API接口直接抽取原始指标数据,筛选至欧洲35国,并经由Electric Sheep Europe团队进行重新封装与标准化处理。数据涵盖1970年至2024年间关于职业伤害的观测记录,依据国际劳工统计学家会议(ICLS)定义对调查微观数据进行协调,并在source.label列中标记数据来源以保证可追溯性。最终形成包含2088条观测、1项核心指标、支持按性别与移民身份等维度拆分的规范化表格数据集。
特点
数据集具备多维度拆解与高时间覆盖度的显著特征。其核心指标为“按性别和移民身份划分的参照组工人数(千)”,可通过sex字段拆分为总计、男性与女性三个子类,同时classif1字段进一步区分移民身份状态。数据覆盖35个欧洲国家,时间跨度长达54年,部分国家如西班牙、俄罗斯的观测记录超过百条。每条记录均携带详细的元信息,包括指标标签、来源说明、观测年份及数值,支持时间序列分析、面板数据建模等多元研究场景。
使用方法
数据集设计为可直接通过HuggingFace Datasets库加载使用,用户仅需调用load_dataset()函数即可获取Parquet格式的训练集并转换为Pandas DataFrame。后续分析可灵活采用多种操作:按国家代码过滤以实现国别聚焦,按时间排序绘制特定指标的单变量时间序列曲线,或通过透视表构建以年份为行、国家为列的面板数据矩阵,便于开展跨国比较、趋势预测与回归分析。数据以CC-BY-4.0许可发布,使用时需同时引用原始ILO数据及Electric Sheep Europe的封装来源。
背景与挑战
背景概述
在全球劳动统计领域,职业伤害数据的系统化收集与分析对于制定有效的职业安全政策至关重要。由国际劳工组织(ILO)统计部门创建并维护的ILOSTAT数据库,长期以来作为全球劳动统计的核心权威来源。在此基础上,Electric Sheep Europe于2024年重新整理并发布了该数据集,聚焦于欧洲35个国家、1970至2024年间按性别和移民身份划分的参考群体工作者数量(单位:千人),共计2088条观测值。该数据集旨在为研究者提供标准化的、可用于机器学习的时序表格数据,从而支撑职业伤害风险的人群异质性分析、劳工政策评估以及跨国比较研究。其发布显著提升了ILOSTAT精细微观数据在数据科学领域的可获取性,为理解欧洲劳动力市场中移民与非移民工作者的职业伤害分布格局奠定了数据基础。
当前挑战
该数据集面临的核心挑战源于其研究主题的复杂性。在领域问题层面,职业伤害的发生率在不同性别和移民身份群体间可能存在显著差异,但现有数据难以直接揭示社会结构性因素(如就业类型、行业隔离、工作条件)与伤害风险之间的因果机制,模型构建需谨慎处理混杂偏倚。在构建过程中,数据整合面临多重技术困难:ILOSTAT原始数据源自多国劳动力调查、行政记录等异构来源,国际劳工统计会议(ICLS)定义的统一化虽提升了可比性,却也带来了数据源的标志性差异(如source.label列所示);此外,部分指标仅以年度频率发布,而月度或季度序列未被纳入,导致时间分辨率受限;缺失值、不同国家间的报告标准差异以及时间序列的非平衡性(如俄罗斯覆盖1983-2024年,而捷克仅覆盖1994-2015年)进一步增加了建模与推断的难度。
常用场景
经典使用场景
该数据集汇集了1970年至2024年间35个欧洲国家的职业伤害统计数据,涵盖按性别和移民身份划分的参考群体劳动者人数(以千计)。其经典使用场景在于构建面板数据或时间序列模型,以分析欧洲各国职业伤害的长期趋势与结构性差异。研究者可借此探索性别、移民身份与职业伤害发生率之间的关联,或评估国家间劳动安全政策的效能差异。
解决学术问题
该数据集有效解决了欧洲职业伤害研究中长期存在的跨国可比性不足与数据碎片化问题。通过提供统一口径、跨越半个多世纪的标准化指标,它使学者得以开展劳动经济学、人口社会学与公共卫生领域的交叉研究。例如,精准量化移民劳动者在职业伤害中的脆弱性,或评估性别差异对工伤风险的影响,从而推动关于劳动权益保护与就业公平的学术讨论。
衍生相关工作
该数据集已在多个领域衍生出经典工作,包括基于时间序列分解的欧洲职业伤害预测模型、融合性别与移民维度的多层回归分析,以及利用面板数据检验贝弗里奇曲线在劳动安全领域的适用性。此外,它被整合进ILOSTAT宏观劳动统计的机器学习管道,用于自动识别异常值与填补缺失数据,提升了统计基础设施的鲁棒性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务