遇见数据集

electricsheepasia/asia-ilo-inj-work-sex-mig-nb-workers-in-the-reference-group-by-sex-and-migrant

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的职业伤害相关数据,具体指标为按性别和移民身份划分的参考组工人数量(千)。数据集涵盖22个亚洲国家,时间跨度为1971年至2024年,共包含807个观测值。数据通过ILOSTAT REST API获取,并经过亚洲国家代码过滤,包含国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、移民状态分类、观测年份和观测值等字段。数据已由Electric Sheep Asia重新打包为机器学习就绪格式,遵循CC-BY-4.0许可协议。

This dataset contains Occupational injuries data from the ILOs ILOSTAT database, specifically the indicator Workers in the reference group by sex and migrant status (thousands). It covers 22 Asia countries from 1971 to 2024, with 807 observations. Data is pulled from the ILOSTAT REST API and filtered to Asia ISO3 country codes, including fields such as country code, country name, data source, indicator code, sex classification (total, male, female), migrant status classification, observation year, and observed value. Repackaged by Electric Sheep Asia into ML-ready format under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-inj-work-sex-mig-nb-workers-in-the-reference-group-by-sex-and-migrant 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,是亚太地区职业伤害领域的重要统计资源。构建过程中,数据通过ILOSTAT REST API直接获取,并基于ILO统一的国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行标准化处理。Electric Sheep Asia团队进一步将数据范围限定至亚洲22个国家的ISO3国家代码,保留了source.label字段以追溯数据来源,最终打包为可复用的HuggingFace数据集格式。
特点
数据集涵盖1971年至2024年间的807条观测记录,聚焦于按性别和移民身份划分的参考群体工人数量(千人)这一核心指标。其独特之处在于提供了涵盖22个亚洲国家的长期时间序列数据,并支持按性别(男性、女性、总计)进行细分分析。数据质量方面,ILO优先选用多源交叉时的'最佳来源',且所有观测均为年度频率,确保了统计口径的一致性与可比性。
使用方法
用户可通过HuggingFace datasets库的load_dataset()函数一键加载该数据,并转换为Pandas DataFrame进行后续处理。典型应用包括按国家筛选特定子集、对单个指标进行时间序列的可视化分析,或利用pivot_table构建国家×年份的截面矩阵。数据集预置了清晰的列模式,包含ref_area、time、obs_value等标准化字段,便于直接接入机器学习或统计分析工作流。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其ILOSTAT数据库发布,经Electric Sheep Asia在2024年重新整理并托管于HuggingFace平台,聚焦亚洲22个国家1971至2024年间按性别和移民身份划分的参考组工人数量(单位:千)。核心研究问题在于揭示亚洲地区职业伤害风险的分布特征,特别是性别与移民身份如何影响工人群体的构成与暴露程度。作为全球劳动统计的权威来源,ILOSTAT的数据整合了劳动力调查、行政记录等多源信息,为劳动经济学、公共卫生及移民政策研究提供了关键支撑。该数据集对理解亚洲劳动力市场的结构脆弱性具有重要意义,尤其为职业伤害预防、社会保障覆盖及可持续发展目标(SDG)中体面工作的监测提供了基础实证数据。
当前挑战
该数据集面临的领域挑战主要在于:其一,职业伤害统计数据在亚洲各国间的收集标准、定义口径(如ICLS定义的差异)与统计方法不一,导致跨国比较时存在系统偏差;其二,劳动市场中性别和移民身份的交互效应复杂,非正规就业及移民工人的隐蔽性常导致数据低估或遗漏,难以准确刻画脆弱群体的真实风险。在构建过程中,挑战体现在:数据来源多样(来自不同国家的劳动力调查、行政记录等),需经ILO统一协调与质量校验;时间跨度长达50余年,部分早期数据存在缺失或连续性中断(如印度仅覆盖1971-2007年);此外,对多源数据的清洗、归并以及与ILOSTAT API的对接要求严谨的数据工程流程,以确保时间序列的连贯性和地理覆盖的完整性。
常用场景
经典使用场景
该数据集汇集了国际劳工组织ILOSTAT数据库中关于亚洲22个国家、跨越1971至2024年的职业伤害统计数据,核心指标为按性别与移民身份分类的参考组工人数(单位:千)。在社会科学与劳动经济学研究中,它常被用于构建面板数据模型,以分析亚洲各国劳动力市场中职业伤害风险的长期变迁趋势,并考察性别与移民身份在职业安全暴露中的差异化影响。研究者可结合国家-年份固定效应模型,识别经济转型、产业政策或劳动法规对特定人群工伤发生率的作用路径。
解决学术问题
该数据集有效解决了跨国职业伤害数据长期缺乏统一性、细粒度与时间跨度的问题。在学术层面,它使研究者能够实证检验亚洲背景下移民劳工在职业伤害中的脆弱性假说,量化性别不平等在劳动安全领域的具体表现,弥补了以往研究多聚焦欧美而忽视亚洲区域职业伤害异质性的不足。其数据来源的权威性与ILO的统计协调标准,为严谨的因果推断和时间序列分析提供了可靠支撑,推动了全球劳动安全比较研究的深化。
衍生相关工作
基于此数据集,衍生出了多项具有影响力的研究工作。例如,学者们结合该数据与ILO同期发布的其他劳动指标,构建了亚洲职业伤害风险指数,用于预测经济周期对工伤发生率的影响。另有一些研究将该数据与各国移民政策变量相匹配,探讨移民身份合法性与职业伤害报告率之间的关联。此外,数据驱动的时间序列模型被应用于预测未来五年特定亚洲国家的工伤趋势,为政策前瞻提供了量化依据,并催生了一系列关于数据标准化与跨国可比性的方法论讨论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务