遇见数据集

electricsheepasia/asia-ilo-inj-fatl-sex-mig-rt-fatal-occupational-injuries-per-100-000-workers-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲26个国家从1971年至2024年的927个观察值,重点关注“按性别和移民状况划分的每10万工人致命职业伤害”这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤到亚洲国家。数据集以表格形式组织,包含国家代码、指标代码、性别分类(总计、男性、女性)、移民状况分类、年份和观测值等列,用于分析职业安全趋势。数据经过ILO标准化处理,覆盖土耳其、乌兹别克斯坦、哈萨克斯坦等国家,适用于表格分类、回归和时间序列预测任务。数据集由Electric Sheep Asia重新打包,采用CC-BY-4.0许可证。

This dataset contains 927 observations of fatal occupational injuries per 100,000 workers, disaggregated by sex and migrant status, across 26 Asian countries from 1971 to 2024. It is sourced from the International Labour Organization (ILO) ILOSTAT database, filtered to Asia via API. The data is organized in tabular format with columns for country codes, indicator codes, sex classification (total, male, female), migrant status classification, year, and observed values, facilitating analysis of occupational safety trends. The dataset is harmonized by ILO and repackaged by Electric Sheep Asia, licensed under CC-BY-4.0, and suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-inj-fatl-sex-mig-rt-fatal-occupational-injuries-per-100-000-workers-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过调用其REST API接口(ID: INJ_FATL_SEX_MIG_RT)直接获取原始数据,并依据亚洲ISO3国家编码进行地理范围筛选。ILOSTAT本身对各国劳动力调查、住户收入调查、企业调查及行政记录等原始微观数据进行了统一协调与标准化处理,遵循国际劳工统计学家会议(ICLS)的定义框架。Electric Sheep Asia团队负责进一步的数据清洗、格式统一与重新打包,最终以Parquet格式发布,确保数据可供机器学习流水线直接加载使用。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,示例命令为:load_dataset("electricsheepasia/asia-ilo-inj-fatl-sex-mig-rt-fatal-occupational-injuries-per-100-000-workers-by"),加载后转换为Pandas DataFrame即可进行后续分析。支持按国家筛选、按指标进行时间序列绘图,以及将数据透视为国家×年份的矩阵形式。数据以Parquet格式存储,兼容主流数据处理框架,适合用于表格分类、回归分析及时间序列预测等机器学习任务。
背景与挑战
背景概述
在职业安全与健康研究领域,准确量化因工死亡风险是制定有效劳动保护政策的核心前提。该数据集由国际劳工组织(ILO)统计司于2024年发布,并经Electric Sheep Asia重新打包为机器学习友好格式,汇集了亚洲26个国家自1971年至2024年间关于致命性职业伤害的官方统计数据,共计927条观测记录。数据源自ILOSTAT数据库——全球劳动统计的权威枢纽,其整合了各国劳动力调查、行政记录等多源信息,并通过国际劳动统计学家会议定义进行标准化处理。数据集的核心研究问题聚焦于不同性别与移民身份劳动者的职业伤害致死率差异,为跨国比较和趋势分析提供了独特视角。作为亚洲地区迄今最系统的职业伤害时序数据集,它填补了该区域在劳动安全细分维度上的数据空白,对推动劳动经济学、公共卫生政策及可持续发展目标中的体面劳动指标研究具有重要影响力。
当前挑战
该数据集所应对的领域问题核心挑战在于:亚洲地区在职业安全统计长期存在数据碎片化、定义不统一以及报告覆盖率偏低的问题,尤其是对移民和女性劳动者等脆弱群体的伤害数据尤为稀缺,导致区域性劳动保护政策的制定缺乏定量依据。在构建过程中,研究人员面临多重困境:首先,各国数据采集标准差异显著,ILO需通过ICLS定义进行复杂的数据协调与缺失值插补,部分国家观测年份断层严重(如印度仅覆盖1971-2007年);其次,数据源标注的异质性增加了建模难度,同一国家不同年份可能对应不同的调查类型;此外,少数族裔与移民等群体的分类维度存在稀疏性,样本量不均衡(土耳其130条观测,而十余国不足30条)削弱了模型泛化能力。时间序列不连续性、分类稀疏性及指标解读的复杂性共同构成了该数据集在实际应用中的核心挑战。
常用场景
经典使用场景
该数据集记录了1971年至2024年间亚洲26个国家因职业伤害导致的致命事故率,按性别和移民状态进行了精细划分。经典的使用场景包括基于时间序列的致命职业伤害率趋势分析、跨国比较研究,以及利用分类和回归任务构建预测模型,探索经济发展水平、劳动保护政策等变量对职业安全的影响。研究者可借此剖析不同性别和移民群体在职业风险暴露上的差异,为劳动经济学与职业健康领域提供量化基础。
解决学术问题
数据集有效解决了亚洲地区职业伤害统计口径不一、跨国可比性不足的困境。它助力学术研究揭示劳动者性别与移民身份对职业安全风险的调节作用,探讨经济发展、产业结构与劳动保护制度如何共同塑造工伤致死率的时空格局。通过纵向与横向的对比分析,该数据推动了关于移民劳工权益保障、性别平等在劳动安全领域成效等前沿议题的实证检验,为国际劳动组织完善职业健康政策提供了数据支撑。
实际应用
在实际应用层面,该数据集是政府劳动部门、国际组织与职业安全机构开展风险评估与政策制定的核心工具。例如,可用于识别职业伤害高发的国家与行业,监测劳动安全干预措施的长期效果,或结合移民流动数据评估跨国劳工群体的脆弱性。企业亦可借鉴其分析结果优化安全生产管理,保险行业则能利用历史趋势完善工伤保险费率厘定模型,提升风险定价的科学性。
数据集最近研究
最新研究方向
当前,基于ILOSTAT框架整合的亚洲职业伤害致死率数据集,正引领劳动安全与移民健康交叉领域的前沿探索。研究者利用该数据集中按性别和移民身份分层的长期面板数据,聚焦于东亚和南亚快速工业化经济体,揭示出制造业、建筑业中移民工人面临的系统性高风险暴露。热点关注点包括新冠疫情后供应链重组带来的职业伤害波动,以及国际劳工组织(ILO)推动的“体面劳动”目标在亚洲进展的量化评估。该数据集为因果推断模型和时空预警系统提供了关键实证支撑,推动了从传统描述性统计向机器学习预测的范式迁移,对提升区域劳动保护政策制定的证据基础具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务