遇见数据集

electricsheepasia/asia-ilo-inj-nftl-sex-inj-mig-nb-cases-of-non-fatal-occupational-injury-by-sex-type

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于非致命性职业伤害案例的数据,按性别、伤残类型和移民状况进行分类,覆盖22个亚洲国家,时间跨度为1971年至2024年,共1,432个观测值,涵盖1个独特指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,主题为职业伤害,用于表格分类、回归和时间序列预测等任务。数据集包括国家代码、来源、指标、性别分类、分类变量、观测年份、观测值等列,并提供数据质量说明和使用示例。

This dataset contains 1,432 observations of Occupational injuries data across 22 Asia countries, spanning 1971–2024, covering 1 distinct indicator: Cases of non-fatal occupational injury by sex, type of incapacity and migrant status. It is sourced from ILOSTAT, the International Labour Organizations statistics database, and is designed for tabular classification, regression, and time-series forecasting tasks. The dataset includes columns such as country code, source, indicator, sex disaggregation, classification variables, observation year, and observed value, with notes on data quality and usage examples.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-inj-nftl-sex-inj-mig-nb-cases-of-non-fatal-occupational-injury-by-sex-type 数据集图片
构建方式
该数据集基于国际劳工组织(ILO)的ILOSTAT统计数据构建,通过调用ILOSTAT REST API直接提取指标代码为INJ_NFTL_SEX_INJ_MIG_NB的原始数据,并过滤出亚洲ISO3国家代码的观测值。ILOSTAT本身整合各国劳动力调查、家庭收入调查、机构调查及行政记录等多元来源,依据国际劳动统计学家会议(ICLS)定义进行数据协调与标准化。数据集以表格形式呈现,涵盖国家、年份、性别、伤残类型、移民身份等多维分类变量,每一观测值均附带来源标签以保障可追溯性,最终由Electric Sheep Asia重新封装为适用于机器学习的格式。
特点
本数据集独具匠心之处在于其聚焦亚洲地区非致命职业伤害的细分统计,覆盖22个亚洲国家、时间跨度从1971年至2024年,共包含1,432条观测记录。其核心指标按性别、伤残类型及移民状态三重维度进行分解,提供SEX_T(总计)、SEX_M(男性)、SEX_F(女性)三种性别分类,并结合伤残类型与移民身份的层级分类变量。数据质量经过严格把控,当同一国家年份存在多个来源时,采用ILO选定的“最佳来源”,且仅当指标发布相应分组时才填充分类列,确保了数据的一致性与可靠性。
使用方法
使用者可通过HuggingFace datasets库的load_dataset()函数一键加载数据集,并在Python环境中转换为Pandas DataFrame进行后续分析。典型操作包括:按国家代码筛选特定国家的子集以研究其职业伤害趋势;以时间为轴对单一指标进行排序并绘制时间序列图,观察非致命职业伤害的历史变化;亦可通过透视表将数据重塑为国家×年份的矩阵,便于进行跨国横向比较与面板数据分析。数据集支持表格分类、回归及时间序列预测等任务,为劳动经济学与职业安全研究提供了便捷的数据入口。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门(ILOSTAT)于2024年整理发布,并经Electric Sheep Asia重新封装后以HuggingFace数据集形式公开。核心研究问题聚焦于量化亚洲地区按性别、失能类型和移民状态划分的非致命职业伤害案例,旨在揭示劳动力安全与健康领域的长期趋势与结构性差异。数据集覆盖22个亚洲国家及地区,时间跨度从1971年至2024年,包含1,432条观测记录,为劳动经济学、职业流行病学及国际发展研究提供了稀缺的标准化多维度面板数据。其发布填补了亚洲区域内职业伤害统计碎片化、口径不统一的空白,推动了基于数据的跨国比较与政策评估,对ILO体面劳动议程及联合国可持续发展目标中健康与福祉指标的监测具有重要支撑作用。
当前挑战
该数据集所解决的领域挑战在于,职业伤害统计长期面临数据稀疏、分类标准不一及跨国可比性不足等困境,尤其是亚洲地区因经济发展阶段差异、数据采集能力不均及移民工人权益保障滞后,导致非致命伤害的系统性低估与性别、移民状态维度的断裂。构建过程中,ILOSTAT需整合各国依赖行政记录、劳动调查及社保数据库等异质性来源,并通过国际劳工统计学家会议(ICLS)定义进行统一标准化,但原始数据的时滞性、部分国家年度缺失以及隐性劳动者(如非正规就业与跨国流动人口)的覆盖不足构成显著瓶颈。此外,指标因多个来源并存时需人工裁决‘最佳来源’,以及失能分类细节的粗粒化,均可能影响时序分析的精度与因果推断的信度。
常用场景
经典使用场景
该数据集作为ILOSTAT官方统计的亚洲区域非致命职业伤害案例汇编,经典应用场景集中在劳动经济学与职业安全健康研究的交叉领域。研究者可依据性别、伤残类型及移民身份三个维度展开分层分析,探讨不同亚群在制造业、建筑业等高风险行业中的职业伤害分布特征。借助跨国家(22个亚洲经济体)与跨时域(1971年至2024年)的年频观测,能够构建面板数据模型,评估职业安全政策、经济周期波动或劳动法改革对非致命工伤发生率的动态影响。数据集规范的schema设计支持快速整合至机器学习流程,适用于多分类预警模型训练与回归分析,揭示亚洲地区职业伤害的演变规律与结构性差异。
解决学术问题
该数据集有效回应了学术界在职业伤害领域若干关键问题的研究瓶颈。首先,它弥补了发展中国家尤其是亚洲地区系统性、跨国别职业伤害数据的缺失,为人口学与劳动健康交叉研究提供了标准化叙事基础。其次,性别与移民身份维度的精细拆分,使得研究者能够突破传统‘总体工伤率’的扁平化视角,深入剖析隐性不平等问题,例如女性劳工或因移民身份而陷入弱势地位的群体在工伤事件中的脆弱性模式。此外,长达半个多世纪的时跨允许学术场域中关于‘安全投入滞后效应’与‘工业化进程中的伤患库兹涅茨曲线’等假说得到经验检验,对构建更具包容性的全球职业伤害理论体系具有深远方法论意义。
衍生相关工作
该数据集衍生出的经典工作涵盖多个前沿方向。在预测建模层面,研究者基于其时序结构开发了贝叶斯结构时间序列模型,用于预测印度、泰国等重点国家非致命工伤率的短期波动,并与ILO宏观就业指标耦合构建早期预警系统。在公平性分析领域,系列论文利用该数据的性别—移民交叉切面,检验拉丁美洲对比视角下职业伤害不均衡性的统计显著性,推动了标准化‘脆弱指数’的生成。此外,部分工作将该数据集作为迁移学习基准,将亚洲职业伤害模式微调至非洲或中东低资源场景下的伤害归因任务,验证了跨区域知识迁移的可行性。这些衍生成果不断拓展着劳动健康数据科学的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务