遇见数据集

bd-arsa-road-safety-visual-audit

收藏
Hugging Face2026-06-16 更新2026-06-17 收录
官方服务:

资源简介:

BD-ARSA是一个用于孟加拉国道路安全视觉审计的多任务视觉语言数据集,遵循当地政府工程部(LGED)的审计方法。该数据集包含21,947条记录,每条记录将道路图像与结构化安全审计结果配对。数据来源于三个层次:expert_gold(343条)- 来自LGED审计报告的人工专家危险裁剪图像,每条仅包含单一危险;expert_silver(707条)- 道路场景照片与专家审计结果配对,经过标准化重写和人工审核;streetview(20,897条)- 使用VLM教师模型生成完整审计的道路场景图像。数据集采用12类LGED危险分类法,涵盖道路标线、路肩状况、路边严重性、行人设施、视线障碍、交通标志、速度管理、交叉口、路堤安全、公交站点、排水和防滑性等类别。每条记录包含图像、位置描述、道路类型、土地利用、关键安全问题列表、危险详细列表(含名称、类别、观察结果和严重性)、总体风险等级(低/中/高)以及附加建议等字段。数据集支持三个多任务学习任务:危险生成(所有记录)、总体风险评估(所有记录)和建议生成(21,635条记录)。数据按位置不相交原则划分为训练集(16,082条)、验证集(2,418条)和测试集(3,447条),风险类别存在不平衡(训练集中低风险仅占约1.4%)。数据集附带微调提示模板和类别权重文件,适用于视觉语言模型训练、道路安全审计自动化、多任务学习研究等应用场景。

BD-ARSA is a multi-task vision-language dataset for road safety visual auditing in Bangladesh, following the audit methodology of the Local Government Engineering Department (LGED). The dataset contains 21,947 records, each pairing a road image with structured safety audit results. Data sources include three tiers: expert_gold (343 records) - manually curated hazard-cropped images from LGED audit reports, each containing only a single hazard; expert_silver (707 records) - road scene photos paired with expert audit results, standardized and human-reviewed; and streetview (20,897 records) - road scene images with full audits generated using a VLM teacher model. The dataset employs a 12-class LGED hazard taxonomy, covering categories such as road markings, shoulder conditions, roadside severity, pedestrian facilities, sight obstructions, traffic signs, speed management, intersections, embankment safety, bus stops, drainage, and skid resistance. Each record includes fields such as image, location description, road type, land use, key safety issues list, detailed hazard list (with name, category, observation, and severity), overall risk level (low/medium/high), and additional recommendations. The dataset supports three multi-task learning tasks: hazard generation (all records), overall risk assessment (all records), and recommendation generation (21,635 records). Data is split into training (16,082 records), validation (2,418 records), and test (3,447 records) sets based on location-disjoint principles, with risk class imbalance (low risk accounts for only about 1.4% in the training set). The dataset comes with fine-tuning prompt templates and class weight files, suitable for applications like vision-language model training, automated road safety auditing, and multi-task learning research.

创建时间:
2026-06-07
原始信息汇总

数据集概述:BD-ARSA: Road Safety Visual Audit Dataset

  • 许可证: CC BY 4.0
  • 语言: 英语 (en)、孟加拉语 (bn)
  • 任务类别: 图像到文本 (image-to-text)、视觉问答 (visual-question-answering)
  • 标签: 道路安全、孟加拉国、LGED、视觉语言模型、多任务
  • 数据集大小: 10K < n < 100K (总计 21,947 条记录)
  • 配置: 默认配置,包含训练集 (train)、验证集 (validation)、测试集 (test),数据以 Parquet 格式存储。

数据来源与结构

数据集由三个来源组成,按图像与危险标注的对应确定性分为三级(金 > 银 > 街景):

  • expert_gold (343 条):来自 LGED 审计报告的人类专家危险裁剪图像,每张图像标注一个危险。覆盖 72 个审计地点。
  • expert_silver (707 条):道路场景照片,配有人工审核并重写的 LGED 专家审计结果。
  • streetview (20,897 条):街景图像,由 VLM 教师模型生成并验证的全审计标注。

数据模式(每条记录)

  • record_id (字符串): 全局唯一标识符
  • source (字符串): "expert_gold" | "expert_silver" | "streetview"
  • district (字符串 | null)
  • location_id (字符串)
  • image (PIL.Image): 解码后的图像
  • location_description (字符串 | null): 场景描述
  • road_type (字符串 | null)
  • land_use (字符串 | null)
  • critical_safety_issues (列表[字符串]): 简短的“类别 - 问题”短语
  • hazards (列表[{ hazard_name, hazard_category, observation, severity }]): 危险列表
  • overall_risk_level (字符串): "Low" | "Medium" | "High"
  • additional_recommendations (字符串 | null)
  • tasks_available (子集): {"hazard_generation", "overall_risk", "recommendation"}
  • split (字符串): "train" | "validation" | "test"
  • source_expert_finding (字符串 | null): 仅 expert_silver 记录有,记录来源

hazard_category 为 12 个 LGED 标准类别之一:road_markingsshoulder_conditionroadside_severitypedestrian_facilitiesvision_obstructiontraffic_signsspeed_managementintersectionembankment_safetybus_stoppagedrainageskid_resistance

粒度说明

  • expert_gold: 单危险裁剪图像,hazards 只有一个条目(无 observation/severity),场景字段为 null。
  • expert_silverstreetview: 全场景图像,多危险审计(平均每条约 5.5 和 4.2 个危险),包含 per-hazard 的 observation 和 severity。

多任务监督 (tasks_available)

  • hazard_generation: 所有 21,947 条记录
  • overall_risk: 所有 21,947 条记录
  • recommendation: 21,635 条记录(全部 streetview + 全部 707 expert_silver + 31 expert_gold)

数据划分

  • 划分原则: 按 location_id 划分,同一 location_id 不会出现在多个划分中。
  • overall_risk_level 分布:
划分 High Medium Low 总计
train 9,517 6,340 225 16,082
validation 1,241 1,100 77 2,418
test 1,964 1,381 102 3,447
  • 各来源在划分中的数量:
划分 expert_gold expert_silver streetview 总计
train 107 507 15,468 16,082
validation 78 96 2,244 2,418
test 158 104 3,185 3,447

类别不平衡

  • Low 类别在训练集中占比约 1.4%。
  • EG-ARSA 模型采用训练集特有的 logit 调整(τ=1)处理;同时提供训练集的逆频率权重:{ "Low": 23.83, "Medium": 0.85, "High": 0.56 }。

微调提示

  • 数据集包含 prompts/finetune_prompts.py 文件,提供无泄漏的微调提示和 JSON 目标序列化器。
  • prompts/generation_provenance.md 文件记录了生成银标签的教师提示(用于可复现性,不建议直接用于微调)。

快速开始

python from datasets import load_dataset ds = load_dataset("Thamed-Chowdhury/bd-arsa-road-safety-visual-audit") sample = ds["train"][0] print(sample["record_id"], sample["overall_risk_level"]) print(sample["hazards"]) sample["image"] # PIL.Image

许可与引用

  • 许可证: CC BY 4.0
  • 引用格式: 参见 README 中的 BibTeX 条目(作者:Chowdhury, Md Thamed Bin Zaman 和 Hossain, Moazzem;年份:2026;代码仓库:https://github.com/Thamed-Chowdhury/EG-ARSA)
  • 专家数据来源: 来自孟加拉国事故研究所(ARI, BUET)的现场道路安全审计,由世界银行资助的 RTIP-II 项目委托 LGED 执行。
搜集汇总
数据集介绍
bd-arsa-road-safety-visual-audit 数据集图片
构建方式
该数据集基于孟加拉国地方政府工程局(LGED)的道路安全审计规范构建,融合了多元数据来源以扩展覆盖范围与标注精度。核心层级包含专家人工标注的expert_gold子集,提供源自LGED审计报告的单一风险要素图像与整体风险等级;expert_silver子集则将现场道路场景照片与结构化审计结论配对,经人工审核后形成标准化多风险标注;streetview子集利用视觉-语言大模型进行大规模自动审计,并依据LGED的12类风险分类体系进行后验验证。三者在图像与风险要素对应确定性上形成金、银、街景三级递进结构,确保标注质量与数据规模间的平衡。整体数据集包含21,947条记录,按地点无重叠原则划分为训练、验证与测试集。
特点
该数据集最显著的特点在于其多任务视觉-语言监督架构与层次化风险标注体系。每条记录不仅包含道路场景图像及结构化12类LGED风险要素列表(涵盖标线、路肩、行人设施、排水等),还提供整体风险等级与补充建议,支持风险要素生成、风险等级预测与建议生成三项子任务。特别值得关注的是,expert_gold子集采用单风险裁剪图像,适用于细粒度视觉风险识别;而expert_silver与streetview则呈现全场景多风险评估,平均每记录包含4至5个风险项。此外,数据集中低风险类别存在显著不平衡(训练集中仅占1.4%),研究者可直接使用提供的一类权重文件以缓解偏差。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集,调用`load_dataset`函数即可获取包含图像(已解码为PIL格式)与结构化标签的完整记录。数据集已预设`train`、`validation`、`test`三个无地点重叠的分割,支持按来源类型或风险等级进行高效筛选。对于多任务微调,数据集中包含`tasks_available`字段指示每条记录支持的任务子集,训练时需对不支持任务进行损失掩码处理。此外,该数据集附带了专用微调提示模板与目标序列化函数,确保输入-输出格式与视觉-语言模型任务对齐;并明确区分了教师模型生成伪标签时所使用的外部上下文提示,避免在学生模型训练中引入信息泄露。
背景与挑战
背景概述
道路安全审计是发展中国家交通安全治理的关键环节,然而传统人工审计方法受限于高昂的专家成本与有限的覆盖面,难以实现大规模部署。BD-ARSA数据集由孟加拉国地方工程部(LGED)与BUET事故研究所的专家团队于2024年创建,旨在推动视觉语言模型在低资源环境下的道路安全自动化审计。该数据集包含21,947张道路图像,每张图像均按照LGED的12类危险分类体系进行结构化标注,覆盖标线、路肩、行人设施等关键安全要素。数据集采用三级质量层次(金标、银标、街景),其中343张金标图像来自真实审计报告中的危险区域裁剪,确保了标注的可靠性。BD-ARSA的问世填补了发展中国家道路安全领域高质量多模态数据集的空白,为视觉语言模型在基础设施评估中的应用提供了重要基准。
当前挑战
BD-ARSA数据集面临的挑战主要体现在三个层面。首先,道路安全审计本质上是一个视觉推断问题,部分危险类别如抗滑性(skid_resistance)和排水性(drainage)主要依赖专家经验,仅在明显缺陷时才具有视觉可辨识性,导致这些类别的标注置信度较低。其次,数据集存在严重的类别不平衡问题,高风险样本占比远超低风险样本(训练集中低风险仅为1.4%),需采用对数几率调整等方法缓解偏差。此外,数据构建过程中,银标和街景样本依赖大语言模型生成标注,再经人工审查,这种半自动流程虽然提升了规模,但引入的噪声与金标专家标注之间存在质量差距,如何有效利用多层级标注进行模型训练仍是待解决的挑战。
常用场景
经典使用场景
在低资源环境下的道路安全视觉审计领域,BD-ARSA数据集为多任务视觉-语言模型提供了结构化的训练与评估基石。其经典使用场景聚焦于利用道路场景图像,联合预测12类LGED危险类别(如路面标线、路肩状况、行人设施等)及其严重程度,同时输出整体风险等级和改善建议。通过集成专家黄金标注、专家银级标注与街景教师标注三个层次的数据,该数据集支持危险生成、风险分级与推荐生成三项联合任务,尤其适用于监督微调视觉-语言模型以完成结构化道路安全审计报告。
解决学术问题
该数据集系统性地解决了低资源地区道路安全审计中专家数据匮乏、标注成本高昂以及多任务联合建模的学术难题。传统方法依赖昂贵的人工现场审计,难以规模化;而BD-ARSA通过构建分层标注体系(黄金/银级/街景),弥合了专家知识与大规模数据之间的鸿沟。它使研究者能够探索视觉-语言模型在结构化安全审计中的迁移学习与知识蒸馏策略,并针对类别极度不平衡(低风险仅占1.4%)提出对数几率调整等有效解决方案,推动了欠发达地区交通基础设施评估的智能化研究。
衍生相关工作
基于BD-ARSA数据集,衍生出了EG-ARSA这一开创性视觉-语言模型,其采用Qwen3VL-8B架构并通过LoRA高效微调,在危险生成与风险分级任务上展现了卓越性能。该工作配套开源了完整的代码库与微调提示模板,为低资源场景下的道路安全审计提供了可复现的基准。此外,数据集的层次化标注策略(黄金/银级/街景)启发了知识蒸馏与多源数据融合的后续研究,其类别不平衡处理技术(对数几率调整)也为相关数据集的建模提供了方法论参考,推动了跨国、跨文化背景下的交通视觉智能研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务