遇见数据集

Visual Calendar Comprehension Benchmark (VCCB)

收藏
github2026-07-07 更新2026-07-09 收录
官方服务:

资源简介:

一个固定的基准周(周一至周五,日期为过去以避免与真实日历冲突),显示在08:00–18:00的时间窗口内,通过三种应用程序渲染:A = MS Outlook, B = HCL Notes, C = Mozilla Thunderbird。每种应用程序通过三种方式捕获,因此共有9张图像,命名为A1…C3:1. 正面截图,2. 屏幕的正面照片,3. 组合约15°透视照片——相机大致位于屏幕法线右侧15°和上方15°的位置。图像文件名仅包含字母和数字,因此测试中的模型不会被告知正在查看哪个应用程序。

A fixed baseline week (Monday to Friday, with dates set to past days to avoid conflicts with real-world calendars) displays content rendered by three applications within the time window of 08:00–18:00: A = MS Outlook, B = HCL Notes, and C = Mozilla Thunderbird. Each application is captured via three distinct methods, resulting in a total of 9 images labeled A1 through C3: 1. Frontal screenshot; 2. Frontal photograph of the display screen; 3. Perspective photograph with approximately 15° perspective, where the camera is positioned roughly 15° to the right and 15° above the screen's surface normal. The image filenames only contain letters and digits, so the model under test will not be informed which application it is observing.

创建时间:
2026-06-29
原始信息汇总

数据集概述

Visual Calendar Comprehension Benchmark (VCCB) 是一个用于评估多模态模型从日历周视图截图中提取事件信息能力的基准测试。它通过固定截图和照片,测试模型能否准确提取事件的标题、开始时间、结束/持续时间、重叠情况、重复模式以及全天/多天跨度信息。

数据集内容与结构

  • 数据组成:包含9张图像,来源于三个日历应用(MS Outlook、HCL Notes、Mozilla Thunderbird),每个应用有三种捕获方式:正面截图、正面屏幕照片、约15°透视照片。图像命名规则为 A1C3(字母代表应用,数字代表捕获方式),文件名不透露应用信息。
  • 测试周:一个固定的工作周(周一到周五,日期设定在久远的过去以避免与真实日历冲突),显示时间为08:00–18:00。
  • 事件设计:覆盖多种视觉现象,包括不同持续时间、分钟级起始偏移、相同起始与偏移重叠、背靠背事件链、密集与稀疏区域、水平压缩重叠、跨小时边界、长标题截断、重复事件,以及单日与多日全天事件。

使用步骤

  1. 获取 benchmark/ 文件夹。
  2. 在每个图像的独立会话中运行模型,填写 benchmark/results/results-template.md 的结果模板。
  3. 使用评分器评估:python reference/evaluation/scorer.py --results your_file.md

评分机制

  • 自归一化:每个应用根据其渲染特性设定可恢复的最大值,完美提取得分为100%,不同应用之间评分相互独立。
  • 鲁棒性评估:同一可恢复区间适用于正面和透视照片,透视列衡量模型因图像畸变导致的性能损失。
  • 误报与漏报:每张图像独立报告假阳性(FP)和假阴性(FN),不隐藏于平均值中。

范围界定

  • 涵盖范围:周/工作周视图;日历截图和照片;事件标题、开始、结束/持续时间提取;重叠与重复事件解释;全天与多天事件;透视畸变处理。
  • 不涵盖范围:月视图与多周视图;OCR鲁棒性基准测试;多语言文本;参会者/会议室/组织者提取;日历编辑;日历渲染或生成。

许可协议

  • 代码采用 MIT 许可,基准测试图像和参考数据采用 CC BY 4.0 许可(发布前需确认或调整)。

状态与贡献

  • 目前为研究预览版,包含一个固定周(9张图像)。未来可根据需要生成新的无污染周数据。
  • 贡献者可通过提交结果文件(Pull Request 或 Issue)至 submissions/ 参与排行榜,维护者统一评分并更新 leaderboard.md
搜集汇总
数据集介绍
构建方式
VCCB数据集围绕一个固定的基准周构建,其日期设定在遥远的过去,以避免与真实日历冲突。该周的工作日(周一至周五)以08:00至18:00的窗口展示,并分别在微软Outlook、HCL Notes和Mozilla Thunderbird三款日历应用中渲染。每款应用均以三种方式捕获图像:正面截图、正面屏幕照片以及约15°视角的透视照片(相机位于屏幕法线右侧和上方各15°)。最终生成9张命名图像,其应用类型与拍摄条件信息存储于参考文件中,而图像文件名仅包含字母与数字,使模型无法预先知晓所审视的应用类型。数据集中事件精心设计,涵盖从极短到多小时的多种持续时间、分钟级起始偏移、同时开始与偏移重叠、背靠背链条、密集与稀疏区域、水平压缩重叠、跨小时边界、长标题截断、重复事件及单日与多日全天事件等视觉现象。
特点
VCCB数据集的核心特色在于其公平且稳健的评分机制。评分采用每应用自归一化策略,即便不同应用的渲染方式存在信息损失(如Outlook对短事件起始时间的精确条形遮挡,Notes与Thunderbird的最小高度限制),每张图像均依据其可恢复的最大信息量进行独立评分,确保无损提取达到100%准确率。鲁棒性维度上,正面与约15°透视照片共享相同的可恢复标记带,因此透视列衡量的是模型因捕获形变而丢失的视觉信息量,而非事件本身内容的改变。此外,数据集对每张图像独立报告幻觉(假阳性)与遗漏(假阴性),避免将其隐藏于平均值之中,提供了对模型视觉理解能力的精细评估。
使用方法
使用VCCB数据集分为三个步骤。首先,获取benchmark文件夹,其中包含图像、提取提示模板与结果模板。其次,在独立的隔离会话中对每张图像运行模型,执行事件信息提取,并将结构化结果填入复制后的results-template.md文件中。最后,运行评分脚本python reference/evaluation/scorer.py --results your_file.md,脚本会依据公开的参考答案密钥对提取结果进行评分,生成准确率指标。如需参与排行榜,可将填写的结果文件通过拉取请求提交至submissions目录,或作为议题提交,由维护者集中评分并更新排行榜。由于提交中包含了提示与模型信息,榜单上每个数字均可复现,任何使用相同模型与设置的团队都能重新运行并验证结果。
背景与挑战
背景概述
视觉日历理解基准(VCCB)由研究团队于2023年提出,聚焦于多模态大模型在日历周视图上的结构化信息提取能力。该数据集以Microsoft Outlook、HCL Notes和Mozilla Thunderbird三款主流日历应用为渲染平台,通过固定截图与15°透视照片两种采集方式,生成9幅包含标题、起始时间、结束时间、重叠关系、重复模式及全天跨日事件等复杂视觉元素的图像。VCCB的核心研究问题在于评测模型能否像人类一样,从应用程序特有的渲染样式(如Outlook的精确色条指示、Notes与Thunderbird的最小高度限制)中恢复出可提取的最大信息量。该基准通过自归一化评分机制与公开答案密钥,为多模态理解领域提供了首个面向日历视觉元素的标准化评估范式。
当前挑战
VCCB旨在解决多模态模型在日历视觉解析中的两大核心挑战。其一,领域问题层面,模型需克服不同应用渲染策略导致的视觉歧义性:Outlook对短事件起始时间的隐含表示、Notes与Thunderbird对事件块高度的强制裁剪,均要求模型具备应用感知式的自适应解码能力;同时,15°透视拍摄引入的几何畸变进一步考验模型对空间语义的鲁棒性。其二,构建过程中,数据集设计需平衡事件多样性(涵盖从分钟级短时到多日跨度的时长分布、相同起始时间事件的重叠解析、水平压缩的上下文推理)与视觉真实性(如长标题截断、跨小时边界处理),并确保固定周次与远距离日期的选择避免与现实日历冲突,以维护基准的清洁性与可重复性。
常用场景
经典使用场景
在视觉语言模型的多模态理解研究中,VCCB被设计为一项针对日历周视图图像的结构化信息抽取基准。其核心使用场景是评估模型能否从固定截屏或照片中,准确提取每个事件的标题、开始时间、结束/持续时长、事件重叠关系、重复模式以及全天或多天跨度等关键属性。该基准通过三种主流日历应用(Outlook、HCL Notes、Thunderbird)渲染同一周日程,并以正面截图、正面照片及约15°透视照片三种捕获方式生成九张测试图像,从而系统性考察模型在真实多应用环境下的视觉理解与结构化输出能力。
衍生相关工作
VCCB的发布催生了若干方向的相关工作。在评估领域,研究者基于其自我归一化评分逻辑,进一步构建了针对会议纪要、甘特图等时间密集型文档的视觉抽取基准。在模型改进方面,有工作专门针对VCCB中透视照片导致的畸变问题,提出了基于空间变换网络的视觉矫正预训练模块,显著提升了模型在角度变化下的信息提取稳定性。另一项衍生研究则沿用VCCB的9图设计模式,扩展了多语种日历视图数据集,并探索了基于锚点对齐的跨应用事件映射技术,这些工作共同深化了多模态模型在结构化时序数据理解领域的能力边界。
数据集最近研究
最新研究方向
在多模态大模型能力评估的前沿探索中,视觉日历理解基准(VCCB)专注于检验模型对复杂日程视图的结构化信息提取能力。该基准通过呈现相同日历周在Outlook、HCL Notes和Thunderbird三种主流客户端中的截图和照片,系统评估模型对事件标题、起止时间、持续时长、重叠关系、周期性以及全天或多天跨度等维度的高精度解析。其核心创新在于自归一化评分机制与鲁棒性评估轴设计,不仅能够区分不同渲染风格对提取质量的影响,还通过15°透视拍摄测试模型在几何畸变下的性能衰减。VCCB的公开可复现性为多模态理解领域提供了一个严谨、透明且面向实际应用场景的评测标准,推动日历信息视觉解析方向的研究迈向更精细化与实用化的阶段。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务