遇见数据集

VisDocAgentBench

收藏
arXiv2026-08-18 更新2026-08-20 收录
官方服务:

资源简介:

VisDocAgentBench是一个面向视觉丰富文档的智能体检索基准,由北京大学等机构创建,用于评估静态检索与智能体检索在共享排名输出合约下的表现。该数据集包含来自100篇科学论文的2,375页图像和120个唯一目标查询,查询按证据结构均衡分为直接、一跳桥和二跳桥三类,每类40个。数据集构建采用关系保持的流程,包括角色描述符提取、有向关系构建、语义对齐、全文档审查以及硬负样本验证,确保查询的语义、关系和视觉条件严格可溯。该基准旨在揭示从单次查询-页面匹配到迭代证据获取的文档排序瓶颈,推动视觉文档表示与搜索策略的协同发展。

VisDocAgentBench is an intelligent retrieval benchmark tailored for visually-rich documents, developed by Peking University and other affiliated institutions. It is designed to assess the performance of both static retrieval and intelligent retrieval under a unified ranking output evaluation protocol. This dataset contains 2,375 page images from 100 scientific papers, alongside 120 unique target queries. The queries are evenly categorized into three categories based on their evidence structure: direct, one-hop bridge, and two-hop bridge, with 40 queries in each category. The dataset construction follows a relation-preserving workflow, which encompasses role descriptor extraction, directed relation construction, semantic alignment, full-document review, and hard negative sample validation. This pipeline ensures that the semantics, relational constraints, and visual conditions of all queries are strictly traceable. This benchmark aims to reveal document ranking bottlenecks spanning from single query-page matching to iterative evidence acquisition, and to facilitate the collaborative development of visual document representation and search strategies.

创建时间:
2026-08-18
原始信息汇总

VisDocAgentBench 数据集详情

数据集概览

VisDocAgentBench 是一个面向视觉丰富文档检索的智能体基准测试数据集,旨在对比静态检索与智能体检索在统一排名输出契约下的表现。

核心规模

项目 数量
渲染页面 2,375 页
文档数量 100 篇
唯一目标查询 120 条
证据结构 40 × 3(直接、单桥接、双桥接各 40 条)

设计特点

  • 检索契约统一:所有系统接收相同查询和语料库,返回排名前 10 的页面列表,使静态检索与交互式检索可直接对比。
  • 证据条件相关性:单桥接和双桥接查询需要语料库证据才能解释哪个视觉端点满足请求。
  • 可审计交互:通过不透明句柄、声明工具和固定动作预算,暴露智能体搜索、检查、验证和排名页面的过程。

构建流程

基准构建采用关系保持构建方法,将候选证据关系跨页面对齐、组合成路径、独立审查,并针对困难负样本进行验证。构建流程连接可观察描述符,通过有向关系和跨页面语义桥接,再进行查询编写和审计。

主要评估结果

静态检索器表现(R@1)

  • Nemotron ColEmbed(视觉):40.00%
  • Qwen3 Embedding(视觉):20.83%;OCR文本:1.67%
  • BM25(OCR文本):6.67%

智能体检索器表现(视觉 R@1)

  • Claude Opus 5:67.50%(最佳)
  • Claude Fable 5:62.50%
  • GPT-5.6-sol:61.67%
  • GPT-5.5:60.00%

智能体检索器表现(OCR-Text R@1)

  • Claude Opus 5:37.50%(最佳)
  • GPT-5.6-sol:36.67%
  • Claude Fable 5:35.00%

关键发现

  1. 强晚期交互视觉检索器在直接项上 Recall@1 达 97.50%,但在双桥接项上仅 2.50%,暴露了纯查询-目标匹配的局限性。
  2. 智能体可恢复大部分性能损失,但规划器选择和检索表示仍然至关重要。
  3. 所有规划器在使用视觉检索时表现更好(最佳 R@1 为 67.50%,对比 OCR 文本的 37.50%)。
  4. 消融实验表明迭代搜索页面检查是关键能力;提供完整支持上下文可提升两条路线的排名表现。
  5. 轨迹分析将剩余损失定位在目标发现、候选检查和证据角色整合三个环节。

引用信息

论文标题:VisDocAgentBench: Benchmarking Agents for Visually Rich Document Retrieval

作者:Lexiang Hu, Yanzhao Zhang, Mingxin Li, Dingkun Long, Yikang Li, Fuwei Zhang, Yisen Wang, Zhouchen Lin

机构:北京大学通用人工智能国家重点实验室、阿里巴巴集团

arXiv:arXiv:2608.17889(2026)

搜集汇总
数据集介绍
VisDocAgentBench 数据集图片
构建方式
VisDocAgentBench的构建遵循一套严谨且富有创新性的流程。该基准从100篇2026年发表的arXiv论文中采样,构成包含2,375页图像的闭集语料库。其核心在于构建关系保持的证据路径,通过角色特定的描述符(查询锚点、语义桥、视觉目标描述符)和有向关系,组合出直接、一桥、二桥三种证据结构的查询。整个构建过程包含全文档审查、约束式查询撰写与硬负样本验证,确保查询与目标页面的唯一对应关系,最终形成包含120个独特目标查询的基准集。
特点
VisDocAgentBench的突出特点在于其对视觉丰富文档检索中上下文依赖组合相关性的精细刻画。不同于传统单一查询-页面匹配,该基准通过一桥与二桥结构显式引入语料上下文证据,挑战检索系统对跨页面关系推理的能力。基准还统一了静态检索与智能体检索的输出契约,并配备完整的过程审计追踪,能够深入剖析智能体在目标发现、候选检查、证据角色整合等环节的瓶颈,为视觉文档检索研究提供了多维度的评测维度。
使用方法
使用VisDocAgentBench时,研究者需遵循其统一的排名输出契约(R@1等指标)。静态检索器通过编码查询与页面图像计算相似度直接排序;智能体检索则利用提供的工具(如视觉搜索、页面检查、区域裁剪)进行迭代式证据收集并最终提交排名。基准支持对检索策略进行受控消融,例如禁用迭代搜索或页面检查,以及提供完整支持上下文的干预实验,从而系统评估不同能力模块对最终检索性能的贡献。
背景与挑战
背景概述
VisDocAgentBench由北京大学通用人工智能国家重点实验室的Lexiang Hu等人于2026年提出,旨在填补视觉丰富文档检索在智能体(agent)范式下的评估空白。该基准构建了一个包含100篇科学论文、2375页视觉丰富文档的封闭语料库,并设计了120个具有直接、单桥、双桥证据结构的检索查询。通过引入角色特异性描述符和关系保持的构建流程,VisDocAgentBench统一了静态检索与智能体检索的评估合同,成为首个严格评估跨页证据组合检索的基准。其发布为视觉文档检索领域提供了新的衡量标准,推动了检索系统从单轮匹配向迭代证据获取的范式转变。
当前挑战
VisDocAgentBench所应对的核心挑战在于视觉丰富文档的相关性常蕴含于文本、布局、结构元素及语料上下文的交互中,而传统检索仅以用户输入单次匹配文档,无法应对跨页证据的分布式关联。尤其在多桥证据结构下,静态检索的Recall@1从直接查询的97.50%骤降至双桥查询的2.50%,凸显了组合推理的困难。此外,构建过程中,确保查询与目标页的关联具有唯一性并剔除潜在硬负例,同时平衡语义、关系与视觉条件的复杂度,也是一项精细而繁琐的工程,需要人工与AI的协同审查及多轮验证。
常用场景
经典使用场景
VisDocAgentBench作为视觉丰富文档检索领域的开创性基准,其设计初衷在于构建一个封闭语料库环境,以统一契约评估静态检索与智能体检索的排名性能。该基准包含2375页科学文献图像与120条精心构造的查询,每条查询均融合语义、关系与视觉条件,并依据证据结构分为直接、单桥与双桥三个层级。经典使用场景聚焦于对比不同检索范式在复杂证据链下的表现,尤其强调迭代式证据获取对最终文档排名的影响,为视觉文档检索研究提供了标准化的评测平台。
解决学术问题
此基准精准回应了现有检索评估体系中的关键缺憾——传统一次性查询-页面匹配难以捕捉依赖语料上下文的相关性结构,而智能体检索的既有基准又多以问答或报告生成为导向,忽略了文档排序本身。VisDocAgentBench通过引入平衡的证据结构、关系保持的构造流程及硬负样本验证,解决了跨证据路径检索评估缺失的学术问题。其揭示出晚期交互视觉检索器在直接项目上近乎完美、却在双桥项目上大幅衰退的现象,有力地论证了分布式证据整合的必要性,激发了关于融合视觉保留发现与证据导向验证的检索智能体的研究浪潮。
衍生相关工作
受VisDocAgentBench启发,一系列后续工作得以衍生。其一是针对证据结构建模的检索模型开发,旨在通过显式编码跨页语义对齐来增强长链查询的响应能力。其二是智能体策略的优化研究,包括迭代搜索决策、页面检查序列及证据角色整合的训练方法。此外,该基准亦催生了多模态检索增强生成系统中的交互式证据评估框架,以及针对视觉文档的硬负样本挖掘技术。这些衍生工作共同推动了检索领域从静态匹配向动态、上下文感知范式的转型,尤其强化了视觉布局与结构化元素在证据推断中的权重。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务