NJU-LINK/TVIR-Bench
收藏官方服务:
资源简介:
TVIR-Bench是一个全面的多模态深度研究基准,包含100个由专家策划的任务,涵盖10个领域和2种语言(中文和英文)。该基准旨在支持文本-视觉交错报告生成,任务设计基于角色驱动、需求导向、深度研究、前沿聚焦和多模态集成等原则。它用于评估深度研究智能体在多步骤信息检索、推理和长格式报告生成方面的能力,特别强调多模态元素的整合。
TVIR-Bench is a comprehensive multimodal deep research benchmark with 100 expert-curated tasks spanning 10 domains and 2 languages (Chinese/English). It is designed for text-visual interleaved report generation, with task principles including role-driven, demand-oriented, deep research, frontier-focused, and multimodal integration. The benchmark supports evaluation of deep research agents in multi-step information retrieval, reasoning, and long-form report generation, emphasizing the integration of multimodal elements.
提供机构:
NJU-LINK搜集汇总
数据集介绍
构建方式
TVIR-Bench是一个面向文本—视觉交错报告生成的深度智能体评测基准。该数据集由领域专家精心构建,涵盖10个专业领域与中英双语环境,总计包含100项多模态深度研究任务。每项任务遵循角色驱动、需求导向、深度研究、前沿聚焦与多模态融合五大设计原则,确保任务扎根于真实用户需求并具备实质性的分析综合价值。
特点
TVIR-Bench的特色在于其双重路径评估体系:文本评估(TA)与视觉评估(VA)并行,全面衡量生成报告的语言质量与视觉元素合理性。数据集覆盖广泛领域,每个任务均要求模型在检索、推理与生成过程中明确整合图像与表格等视觉资产,从而实现对多模态理解与生成能力的深度检验。
使用方法
使用者可将TVIR-Bench作为评测工具,加载提供的query.json文件获取任务查询。通过运行TVIR-Agent或其他深度研究系统,对每个任务生成包含交错文本与视觉元素的长篇报告。最终利用双路径评估框架对报告进行打分,以衡量模型在多步信息检索、推理及跨模态内容组织方面的综合能力。
背景与挑战
背景概述
在深度研究代理(Deep Research Agents)迅速发展的背景下,现有基准与系统仍以纯文本报告生成为主导,缺乏对图文交织报告这一真实应用场景的充分探索。TVIR-Bench由南京大学LINK实验室联合多位研究人员于2026年提出,旨在弥补这一空白。该基准涵盖100个经专家精心设计的跨模态深度研究任务,横跨10个领域及中英双语,核心聚焦于多步信息检索、推理与图文交织的长文报告生成。凭借其角色驱动、需求导向、前沿聚焦的设计原则,TVIR-Bench为评估多模态深度研究代理提供了高标准参考,对推动智能体从纯文本向多模态综合报告能力进化具有里程碑式的影响。
当前挑战
TVIR-Bbench所解决的领域核心挑战在于,现有深度研究基准多局限于文本输出,无法有效评估代理在真实场景中生成图文交织报告的能力,尤其缺乏对视觉元素(如图表检索、数据可视化)与文本内容有机融合的综合评测。在构建过程中,面临多重难题:如何定义跨越10个领域且兼具前沿性与实用性的百项任务;如何设计兼具文本与视觉评估的双路径评价体系,以合理量化视觉与文本部分的协同质量;以及如何确保跨语言(中英)任务在文化表达与信息检索上的公平性。此外,多代理框架中图像搜索器与图表生成器的协调、不同大语言模型对视觉元素理解的差异,均为系统设计与基准构建增添了复杂性。
常用场景
经典使用场景
TVIR-Bench作为一项开创性的多模态深度研究基准,其核心使用场景在于评估和推动深度研究代理在文本-视觉交织报告生成任务上的能力。该基准精心设计了100个来自10个不同领域的中英文专家审核任务,每个任务都强调角色驱动、需求导向、深度分析、前沿话题及多模态融合等原则。研究者可以利用TVIR-Bench对各类深度研究系统进行全面的性能测试,系统性地衡量其在复杂信息检索、跨模态推理以及长文本与视觉元素有机融合的报告撰写方面的综合表现。通过该基准提供的文本评估与视觉评估双路径评价体系,能够更精细地剖析模型在多模态信息处理中的优势与不足,从而为下一代多模态深度研究代理的研发提供坚实的实验平台。
实际应用
在实际应用层面,TVIR-Bench所评测的核心能力与众多现实场景高度契合。例如,在金融分析领域,分析师需要生成融合图表、趋势图与文字解读的市场研究报告;在学术科研中,研究者需要编写包含实验数据可视化、示意图和文献综述的综合性论文;在教育领域,教师需要创建图文并茂的教学材料与知识图谱。此外,在商业情报分析、医疗诊断报告撰写以及新闻多媒体叙事等场景中,TVIR-Bench所关注的文本-视觉交织生成能力同样至关重要。该基准推动的深度研究代理技术,有望最终赋能于自动化的综合报告生成系统,显著提升各行业在复杂信息环境下进行高效、精准、多模态汇报的质量与效率。
衍生相关工作
TVIR-Bench的提出催生了一系列值得关注的衍生研究。其一,围绕该基准,研究者开发了TVIR-Agent层次化多智能体框架,该框架包含了研究导向规划、视觉资产实例化、上下文感知顺序写作及全局索引精炼四个阶段,为多模态报告生成提供了系统化的解决方案。其二,TVIR-Bench的双路径评价体系启发了后续工作在视觉评估维度上的深入探索,推动了更精细化的图像检索、图表生成与文本-视觉对齐质量的评价指标设计。其三,该基准的跨语言和多领域设计为多模态深度研究的域适应和语言迁移研究提供了新的测试床。此外,该工作也促使学界开始关注深层次的多模态推理、事实性与视觉一致性的联合评估等更具挑战性的前沿问题。
以上内容由遇见数据集搜集并总结生成



