遇见数据集

electricsheepeurope/europe-ilo-inj-days-sex-mig-nb-days-lost-due-to-cases-of-occupational-injury-with

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于欧洲职业伤害的统计数据,具体涉及“因职业伤害导致暂时丧失工作能力的天数,按性别和移民状态分类”。数据集由国际劳工组织(ILO)的ILOSTAT数据库提供,覆盖37个欧洲国家,时间范围为1975年至2024年,共包含4,101个观测值。数据通过ILOSTAT REST API获取,并经过过滤以仅包括欧洲国家。数据集包含一个主要指标(INJ_DAYS_SEX_MIG_NB),该指标衡量因职业伤害导致的工作日损失天数,并按性别(总计、男性、女性)和移民状态进行细分。数据模式包括国家代码、国家名称、数据来源、指标代码、性别分类、年份、观测值等列。数据集适用于表格分类、回归和时间序列预测等任务,并以CC-BY-4.0许可证发布。

This dataset contains statistics on occupational injuries in Europe, specifically focusing on Days lost due to cases of occupational injury with temporary incapacity for work by sex and migrant status. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), covering 37 European countries from 1975 to 2024, with 4,101 observations. Data is pulled from the ILOSTAT REST API and filtered to European country codes. The dataset includes one primary indicator (INJ_DAYS_SEX_MIG_NB), which measures the number of days lost due to occupational injuries, disaggregated by sex (total, male, female) and migrant status. The schema comprises columns such as country code, country name, data source, indicator code, sex classification, year, observed value, and more. It is suitable for tabular classification, regression, and time-series forecasting tasks, and is released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-inj-days-sex-mig-nb-days-lost-due-to-cases-of-occupational-injury-with 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接提取指定指标(INJ_DAYS_SEX_MIG_NB)的原始数据,并依据欧洲ISO3国家代码进行地理范围筛选。ILOSTAT本身整合了各国劳动力调查、家庭收入调查、机构调查及行政记录等多种来源的微观数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集保留了原始数据中的来源标识列(source.label),以确保数据来源的可追溯性。最终,该数据集经过Electric Sheep Europe的重新封装,以Parquet格式发布,便于机器学习场景下的直接加载与使用。
特点
该数据集聚焦欧洲37个国家自1975年至2024年间因暂时性丧失工作能力的职业伤害案例所导致的损失天数,共计4,101条观测记录。核心指标单一明确,确保了数据聚焦性。数据按性别(SEX_T、SEX_M、SEX_F)和移民身份进行维度划分,提供了多维度分析的潜力。值得注意的是,当同一国家与年份存在多个数据来源时,ILOSTAT会采用其选定的“最佳来源”以保证数据一致性。此外,数据集以年度频率呈现,覆盖广泛的历史跨度,为长期趋势研究提供了坚实基础。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集至Python环境,并快速转换为Pandas DataFrame进行后续分析。典型应用包括筛选特定国家的数据以进行国别分析,利用时间列对单一指标进行时序排序和可视化,从而观察指标随年份的演变趋势。此外,可通过数据透视表操作,将数据重塑为国家与年份的矩阵形式,便于进行跨国比较或面板数据分析。数据集提供了清晰的列名和标签注释,降低了数据预处理的门槛,使研究者能够专注于劳动保护与职业安全领域的量化研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司创建,经Electric Sheep Europe于2024年重新封装并发布,收录了欧洲37个国家自1975年至2024年间因职业伤害导致暂时性工作能力丧失而损失的工时数据,共计4101条观测记录。ILOSTAT作为全球劳动统计领域的权威数据库,汇集了来自各国劳动力调查、行政记录等多源数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集聚焦于按性别与移民身份细分的职业伤害严重程度衡量,为评估欧洲地区职业安全健康状况、分析劳动力市场中的脆弱群体(如移民工人)所承受的工作风险提供了坚实的数据基础,对劳动经济学、职业流行病学及社会政策研究具有重要价值。
当前挑战
该数据集的核心挑战在于解决职业伤害严重程度量化评估的领域问题。传统职业伤害统计多聚焦于发生率,但损失工时指标更能反映伤害的真实经济与社会负担,然而其跨国家、跨年代的比较面临巨大的数据异质性挑战。构建过程中,ILO需协调37个国家在数十年间不同统计口径、调查方法及报告标准的数据,尤其是各国对“暂时性工作能力丧失”的定义及记录实践差异显著。此外,数据集整合了按性别与移民身份的分组信息,但移民状态分类本身在不同国家间缺乏统一标准,且部分年份或国家数据存在空缺,增加了时间序列分析与跨国对比的复杂性。数据来源的多样性要求严格的元数据追踪与质量标识,以确保研究结论的可靠性。
常用场景
经典使用场景
该数据集汇集了欧洲37个国家自1975年至2024年间因职业伤害导致暂时性工作能力丧失而损失的工作天数,按性别与移民状态进行细致分层。其经典使用场景集中于劳动经济学与职业健康领域的跨国家、长时序面板数据分析,研究者可借此探究欧洲各国职业伤害严重程度的演变轨迹,揭示性别与移民身份在工伤恢复时长上的差异,并为构建预测模型提供坚实的数据基础。
实际应用
在实际应用中,该数据为欧洲各国劳动监察机构、社会保障部门及跨国企业提供了量化基准。例如,可据此制定更精准的工伤预防策略,评估不同性别与移民背景群体的职业康复需求,优化工伤保险基金的风险储备。同时,数据驱动的国际比较有助于推动最佳实践在欧盟内部的迁移,促进区域职业安全标准的协同提升。
衍生相关工作
围绕该数据集,衍生出一系列以劳动经济学与公共健康交叉为特色的研究工作。经典方向包括:构建贝叶斯结构时间序列模型以识别工伤休工天数的结构性突变点;运用双重差分法评估各国工伤赔偿制度改革的效果;以及开发多层级线性混合模型拆解个体特征(性别、移民身份)与国家层面制度因素对工伤恢复时长的贡献。这些工作深化了对职业伤害社会决定因素的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务