Colon-Bench
收藏资源简介:
Colon-Bench是一个全面的、经过人工验证的多任务视频基准,用于结肠镜检查理解。它涵盖14种病变类别(包括息肉、溃疡和出血),超过300,000个边界框,213,000个分割掩码和133,000字的临床描述。
Colon-Bench is a comprehensive, human-validated multi-task video benchmark for colonoscopy comprehension. It covers 14 lesion categories (including polyps, ulcers, and bleeding), over 300,000 bounding boxes, 213,000 segmentation masks, and 133,000 words of clinical descriptions.
Colon-Bench 数据集概述
数据集简介
Colon-Bench 是一个用于结肠镜视频理解的多模态大语言模型(MLLMs)综合基准。它是一个经过人工验证的多任务视频基准,涵盖14种病变类别(包括息肉、溃疡和出血),包含超过30万个边界框、21.3万个分割掩码和13.3万个临床描述词汇。
数据集规模与构成
| 统计项 | 数值 |
|---|---|
| 视频总数 | 1,597 |
| 视频总大小 | ~81 GB |
| 边界框数量 | 300,000+ |
| 分割掩码数量 | 213,000+ |
| 病变类别数 | 14 |
| VQA问题数(prompted) | 1,485 |
| VQA问题数(unprompted) | 2,740 |
| 分类样本数 | 790 |
| 分割样本数 | 264 |
核心任务
- 视觉问答:包含
prompted和unprompted两种划分。 - 二元病变分类:对病变进行分类。
- 分割:基于 EdgeTAM 的分割流程。
数据访问与使用
- 访问方式:数据集托管于 Hugging Face Hub,为公开但受控访问(gated)。需申请访问权限并获取
HF_TOKEN。 - 数据集地址:https://huggingface.co/datasets/ajhamdi/colon-bench
- 加载方式:可通过
datasets库加载不同任务的数据。 python from datasets import load_dataset vqa_prompted = load_dataset("ajhamdi/colon-bench", "vqa-prompted", split="test") vqa_unprompted = load_dataset("ajhamdi/colon-bench", "vqa-unprompted", split="test") cls = load_dataset("ajhamdi/colon-bench", "classification", split="test") seg = load_dataset("ajhamdi/colon-bench", "segmentation", split="test")
评估工具包
此代码库 colon-bench-eval 是一个用于复现主要基准结果的紧凑工具包,包含:
- 基准 JSON 文件与规范结果文件。
- 绘图脚本。
- 交互式 Streamlit 查看器。
- 可运行的多模态大语言模型基线。
支持模型
API 模型(通过 OpenRouter)
支持多种模型进行 API 评估,包括 GPT-4o、GPT-5.2、GPT-5.4、Claude Opus 4.6、Molmo 2-8B、Seed 1.6、GLM-4.6V、Qwen 系列、Gemini 系列等。部分模型支持视频输入,不支持视频的模型使用基于帧的评估。
本地模型(GPU)
视觉问答任务支持通过 --local 参数进行本地推理,主要支持 Qwen3-VL 系列模型(如 8B、32B、235B),需要 HF_TOKEN。
评估基线运行
工具包提供了运行基线评估的脚本,涵盖视觉问答、分类和分割任务。运行前需设置 OPENROUTER_API_KEY 和 HF_TOKEN 环境变量。
结果与排行榜
数据集提供了规范的公开结果 JSON 文件和预生成图表。附带的排行榜展示了多个模型在各项任务上的性能指标,包括视觉问答准确率、分类的准确率/精确率/召回率/F1分数,以及分割的 IoU 和 Dice 分数。
数据来源与引用
- 原始视频来源:基于 REAL-Colon 数据集。
- 分割方法基础:基于 EdgeTAM。
- 引用格式: bibtex @misc{hamdi2026colonbench, title={Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos}, author={Abdullah Hamdi and Changchun Yang and Xin Gao}, year={2026}, eprint={2603.25645}, archivePrefix={arXiv}, primaryClass={eess.IV}, url={https://arxiv.org/abs/2603.25645} }
相关链接
- 论文:https://arxiv.org/abs/2603.25645
- 项目主页:https://abdullahamdi.com/colon-bench
- 数据集:https://huggingface.co/datasets/ajhamdi/colon-bench
- 代码库:https://github.com/ajhamdi/colon-bench-eval
- 许可证:CC-BY-4.0




