C3-Bench
收藏资源简介:
C3-Bench是一个用于上下文感知变化字幕生成的综合基准数据集,包含4,996个人工标注的图像对,每个图像对都配有变化字幕和上下文特定标准。该数据集覆盖51个真实世界变化上下文和4个视觉领域:自然场景、遥感影像、图像编辑和异常。它还包括人类对齐的LLM-as-a-Judge评估,用于细粒度语义和可逆性分析,并对32个模型进行了全面基准测试。
C3-Bench is a comprehensive benchmark dataset for context-aware change captioning. It contains 4,996 manually annotated image pairs, each paired with change captions and context-specific criteria. This dataset covers 51 real-world change contexts and four visual domains: natural scenes, remote sensing imagery, image editing, and anomalies. It also includes human-aligned LLM-as-a-Judge evaluations for fine-grained semantic and reversibility analysis, as well as a comprehensive benchmarking of 32 models.
数据集概述
C3-Bench 是一个面向上下文感知变化描述的综合基准数据集,旨在解决传统变化描述任务中因缺乏上下文而导致描述歧义的问题。每个图像对的变化都基于特定的上下文和标准进行定义,以明确变化背后的语义。
数据集规模与构成
- 4,996 个人工标注的图像对,每个图像对包含变化描述和上下文特定的标准。
- 51 个真实世界的变化上下文。
- 4 个视觉领域:
- 自然场景
- 遥感影像
- 图像编辑
- 异常检测
评估方法
- 采用LLM-as-a-Judge 评估方式,与人类对齐,支持对细粒度语义和可逆性进行评估。
基准测试模型
对以下 32 个模型进行了全面基准测试:
- 6 个传统变化描述模型(如 DUDA)
- 9 个领先的商业多模态大语言模型(如 GPT-5.2、Gemini 3)
- 17 个开源多模态大语言模型(如 Qwen3、InternVL3.5)
主要发现
- 人类仍保持上限:人类评估者在聚合分数上领先最强多模态大语言模型 GPT-5.2 1.73 分,可逆性分数达到 0.93,表明当前模型与人类水平之间存在明显差距。
- 流畅性不等于理解:传统变化描述模型虽能生成流畅句子,但在多样化的真实世界上下文中性能急剧下降,表明语言质量并不能保证正确的变化推理。
- 上下文至关重要:传统模型的失败揭示了以往基准的局限:在狭窄、特定数据集定义下训练的模型,当目标变化语义跨上下文转移时表现不佳。
- 多模态大语言模型重塑格局:商业多模态大语言模型整体表现最强,GPT-5.2 领先基准,展示了在明确上下文条件下大规模多模态推理的优势。
- 开源模型快速追赶:Qwen3-VL-32B 取得了极具竞争力的结果,接近商业模型,在聚合分数上仅落后 GPT-5.2 0.35 分。
数据集获取
- 数据集可通过填写申请表获取:https://docs.google.com/forms/d/e/1FAIpQLSfCYYIX-rUoZZb7vEKbCd8Iy7RsjKyJUprb68zP1kXbsIqrGw/viewform?usp=dialog
相关论文
- 论文发表于 ECCV 2026,标题为 “C3-Bench: A Context-Aware Change Captioning Benchmark”。
- arXiv 链接:https://arxiv.org/abs/2606.25445




