遇见数据集

electricsheepasia/asia-ilo-inj-work-eco-nb-workers-in-the-reference-group-by-economic-activit

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的职业伤害数据,具体指标为按经济活动分组的参考群体工人数量(千计)(INJ_WORK_ECO_NB)。数据覆盖23个亚洲国家,时间跨度为1971年至2024年,共包含7,447个观察值。数据集由Electric Sheep Asia重新打包,旨在提供统一、机器学习就绪的亚洲数据层,便于研究人员和开发者使用。数据包括国家代码、国家名称、数据源、指标、分类变量、观测年份、观测值、观测状态及相关注释等字段,适用于表格分类、回归和时间序列预测等任务。

This dataset contains Occupational injuries data from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator Workers in the reference group by economic activity (thousands) (INJ_WORK_ECO_NB). It covers 23 Asia countries, spanning the years 1971 to 2024, with 7,447 observations. The dataset is repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia on HuggingFace, facilitating use by researchers and developers. It includes fields such as country code, country name, data source, indicator, classification variables, observation year, observed value, observation status, and related notes, and is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-inj-work-eco-nb-workers-in-the-reference-group-by-economic-activit 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API接口获取指标INJ_WORK_ECO_NB的原始数据,并依据亚洲地区ISO3国家代码进行过滤与整合。Electric Sheep Asia团队对数据进行了标准化清洗、模式统一,并以Parquet格式打包发布,确保数据质量与可追溯性。数据集共包含7,447条观测记录,覆盖23个亚洲国家,时间跨度从1971年至2024年,聚焦于按经济活动划分的参考组工人数量(单位:千)。
特点
该数据集兼具时空广度与结构化深度,涵盖多国多年份的单一核心指标,但通过丰富的分类变量(如经济活动类别)、源数据标识及注释字段(如观测状态、就业定义差异)提供了精细的元数据支持。数据经过ILO依据国际劳工统计学家会议(ICLS)定义进行统一协调,每种观测均标注了最佳数据来源,便于用户评估可靠性。其列设计兼顾分析友好性与溯源需求,特别适合进行跨国家、跨时期的比较研究或时间序列建模。
使用方法
用户可通过Hugging Face的`datasets`库一步加载数据集,调用`load_dataset`即可获得可直接转换为Pandas DataFrame的格式。基于此,研究人员可便捷地按国家代码筛选特定国家数据,或利用时间列对单一指标进行时序分析。数据集的规范化结构支持将数据透视为国家×年份矩阵,便于构建面板数据或进行多国对比分析。Python生态中的常见可视化与建模工具均能无缝对接,极大降低了劳动统计学领域研究的工程门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于2024年构建,经Electric Sheep Asia重新打包并发布于HuggingFace平台。核心研究问题聚焦于亚洲地区按经济活动分类的参考组工人数量,旨在为职业伤害分析提供可靠的数据基础。数据涵盖1971年至2024年间23个亚洲国家的7,447条观测值,时间跨度超过半个世纪,为研究亚洲劳动力市场变化与职业安全提供了全景视角。凭借ILOSTAT作为全球劳动统计权威来源的声誉,该数据集在劳动经济学、职业流行病学及公共政策领域具有重要影响力,尤其促进了跨国比较研究与纵向趋势分析。
当前挑战
该数据集所解决的领域问题在于,亚洲地区职业伤害统计长期面临数据碎片化、定义不一与时间序列不完整等挑战,难以支撑系统性的区域研究。构建过程中的挑战尤为突出:ILOSTAT需从各国劳动调查、行政记录等多种源头整合数据,并依据国际劳动统计学家会议(ICLS)定义进行标准化,但各国在分类体系、调查方法及质量控制上存在差异,导致部分观测值标记为不可靠或存在分类注释。此外,数据集仅涵盖年度频率,而某些国家可能发布月或季度数据,这种粒度限制可能影响对短期波动与突发事件的捕捉能力。
常用场景
经典使用场景
该数据集涵盖了1971年至2024年间亚洲23个国家的职业伤害统计数据,记录了参照群体中按经济活动分类的工人数量(单位:千)。其最经典的用途在于构建时间序列模型,以分析各国职业伤害发生率的长期演变趋势。研究者通常借助该数据集进行面板数据分析,利用多国多年份的观测值,挖掘经济活动类型与职业安全之间的动态关联。此外,该数据还可用于分类与回归任务,通过构建预测模型来探究不同行业、不同时期下的职业伤害风险因子,为亚洲区域的劳动安全研究提供量化的数据基础。
解决学术问题
该数据集主要解决了亚洲地区职业伤害统计数据的碎片化与可比性问题。学术研究长期受困于各国统计口径不一、时间跨度过短或数据缺失等挑战,难以进行跨国的系统比较。该数据集通过ILOSTAT统一的数据标准与清洗流程,将原始调查数据规范化为可比较的格式,使研究者能够开展跨区域、跨年代的职业安全实证分析。其意义在于填补了亚洲发展中国家职业伤害长期追踪数据的空白,为劳动经济学、公共卫生和政策评估领域提供了关键的数据支撑,推动了基于证据的劳动力安全研究。
衍生相关工作
该数据集衍生出了多项具有影响力的研究工作。一方面,它被用于构建亚洲职业安全的预测模型,如基于机器学习的经济活动与伤害率相关性分析,识别出制造业、建筑业等高风险领域的特殊趋势。另一方面,学者们利用该数据开展了因果推断研究,评估经济周期、劳动力市场政策对职业伤害的影响。此外,该数据还被整合进更大的全球劳动统计数据库中,用于跨国面板回归分析,探索经济发展阶段与职业安全水平之间的库兹涅茨曲线关系,形成了劳动经济学领域一系列重要的学术贡献。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务