遇见数据集

electricsheepasia/asia-ilo-inj-days-sex-mig-nb-days-lost-due-to-cases-of-occupational-injury-with

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲24个国家从1975年至2024年间因职业伤害导致暂时丧失工作能力的天数统计信息,共849条观测记录。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,核心指标为INJ_DAYS_SEX_MIG_NB,即按性别和移民状态细分的职业伤害导致暂时丧失工作能力的天数。数据集覆盖土耳其、塞浦路斯、以色列、巴林、斯里兰卡、泰国、马来西亚、哈萨克斯坦、新加坡、菲律宾、乌兹别克斯坦、吉尔吉斯斯坦、亚美尼亚、印度、约旦等国家,并包含年份、国家代码、指标值、性别分类(总计、男性、女性)、移民状态分类等字段。数据经过ILO的标准化处理,适用于表格分类、回归和时间序列预测等任务,以支持劳动市场分析和政策研究。

This dataset contains 849 observations of days lost due to occupational injuries with temporary incapacity for work across 24 Asia countries from 1975 to 2024. It features the indicator INJ_DAYS_SEX_MIG_NB, which measures days lost disaggregated by sex and migrant status. Data is sourced from the International Labour Organization (ILO) ILOSTAT database, covering countries such as Turkey, Cyprus, Israel, Bahrain, Sri Lanka, Thailand, Malaysia, Kazakhstan, Singapore, Philippines, Uzbekistan, Kyrgyzstan, Armenia, India, Jordan, and others. The dataset includes columns for country codes, indicator values, sex breakdowns (total, male, female), migrant status classifications, and year, and is designed for tabular classification, regression, and time-series forecasting tasks in labor market analysis.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-inj-days-sex-mig-nb-days-lost-due-to-cases-of-occupational-injury-with 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API接口,直接获取原始指标数据(INJ_DAYS_SEX_MIG_NB),并依据亚洲ISO3国家代码进行地理范围过滤。数据经ILO依据国际劳工统计学家会议(ICLS)定义进行标准化处理,原始调查微观数据来源于各国的劳动力调查、住户收入调查、企业调查及行政记录。最终封装为849条观测记录,覆盖24个亚洲国家,时间跨度从1975年至2024年,由Electric Sheep Asia重新打包为便于机器学习使用的Parquet格式。
特点
数据集聚焦于“因暂时性丧失工作能力的职业伤害案例而损失的工作天数”这一单一指标,按性别和移民身份进行细粒度分层统计,包含性别(总、男、女)等分类维度。数据来源标记于source.label字段,确保可追溯性;当同一国家同年存在多个数据源时,采用ILO选定的‘最佳来源’。数据为年度频率,并附加注释字段说明就业定义、经济活动覆盖范围等质量信息,为研究者提供透明的数据质量参考。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载数据,返回的Dataset对象可直接转换为Pandas DataFrame用于分析。典型用法包括按国家代码过滤特定国家的时间序列数据、按指标排序后绘制观测值随时间变化的趋势图,以及利用pivot_table将数据重塑为以年份为行、国家为列的矩阵形式,便于进行跨国的比较分析或面板数据建模。数据集支持表格分类、回归及时间序列预测等任务场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于其ILOSTAT统计数据库中整理发布,并经Electric Sheep Asia于2024年重新封装至HuggingFace平台。核心研究问题聚焦于亚洲地区因职业伤害导致暂时性丧失劳动能力的天数,按性别与移民状态进行细致划分。数据集涵盖1975至2024年间24个亚洲国家的849条观测记录,为劳动经济学、职业安全与公共健康领域提供了珍贵的纵向数据资源。其影响力在于,通过标准化指标‘INJ_DAYS_SEX_MIG_NB’,支持研究者量化区域职业伤害的严重程度,并分析性别与移民身份对恢复时间的影响,为国际劳工标准的制定与亚洲各国职业安全政策的优化提供了实证基础。
当前挑战
数据集所解决的领域问题在于,亚洲地区职业伤害数据长期面临碎片化与可比性不足的挑战,缺乏按性别与移民状态分解的标准化时间序列。ILOSTAT通过整合各国劳动力调查、行政记录等多源数据并统一采用国际劳工统计学家会议(ICLS)定义,增强了跨国比较的可靠性。然而,构建过程中面临显著挑战:数据来源多样且标注不一致,需通过‘source.label’字段追溯原始调查或统计报告,以明确数据质量;部分国家仅提供年度数据,且因来源更迭导致同一国家同年份可能出现多个观测值,ILO虽择优选择但信息损失难以避免;此外,分类维度(如年龄、职业)仅在特定指标下存在,限制了更深入的分层分析。
常用场景
经典使用场景
该数据集的核心用途在于对亚洲地区因工伤导致暂时性工作能力丧失而损失的工作天数进行系统性分析。研究者可借助其覆盖24个国家、跨越近半个世纪的年度观测数据,构建时间序列模型以探查工伤严重程度的长期演变趋势。通过性别与移民身份的分类维度,该数据集支持开展差异化的比较研究,例如评估不同性别群体在工伤后果上的脆弱性差异,或揭示移民劳工与非移民劳工在职业伤害恢复时长上的潜在鸿沟。此外,该数据还可用于面板数据分析,结合国家层面的经济或政策变量,探究工业化进程、劳动法规变革对工伤事故严重性的影响。
衍生相关工作
该数据集衍生了一系列聚焦亚洲劳动安全的前沿研究工作。在经典应用中,学者以此为基础构建了贝叶斯分层模型,预测不同国家工伤损失天数的未来趋势,并识别出劳动力结构转型带来的新型风险。另一项重要工作将其与宏观经济指标相结合,运用因果推断方法验证了经济衰退期工伤严重程度反而上升的悖论现象。数据集的跨国面板特性也催生了运用机器学习算法进行国家间工伤模式聚类的研究,从而划分出不同劳动安全治理模式。此外,该数据集还被用于校准和验证职业伤害损失天数的估算模型,为国际劳工组织更新工伤统计指南提供了亚洲语境下的实证支撑。
数据集最近研究
最新研究方向
当前,该数据集在职业伤害与劳动保护研究领域的前沿方向聚焦于利用长时间序列(1975–2024年)和跨国面板数据(覆盖24个亚洲国家),深入剖析因工伤导致暂时性失能的工作日损失在性别与移民身份维度上的演变规律。结合国际劳工组织(ILO)推动的体面劳动目标及亚洲地区快速工业化进程,研究者正借助此数据集量化劳动力迁移、性别不平等与职业安全风险之间的动态关联,为制定基于证据的工伤预防政策及区域劳动标准协调提供关键数据支撑。这一方向不仅回应了全球对包容性经济增长和可持续工作环境的迫切关注,更通过揭示隐蔽的劳动伤害负担,助力后疫情时代亚洲劳动力市场的韧性重建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务