ReportBench
收藏资源简介:
ReportBench是一个全面的基准数据集,用于评估深度研究代理的事实质量和引用行为。该数据集利用专家撰写的调查论文作为真实基准,通过反向工程生成领域特定的提示,并提供自动化工具来评估引用和非引用内容。数据集包含600篇高质量的同行评审调查论文,并构建了100个任务的基准测试集,涵盖十个应用领域
ReportBench is a comprehensive benchmark dataset dedicated to evaluating the factual quality and citation behavior of deep research agents. This dataset uses expert-authored survey papers as the ground-truth benchmark, generates domain-specific prompts through reverse engineering, and provides automated tools to assess both cited and uncited content. The dataset contains 600 high-quality peer-reviewed survey papers, and constructs a benchmark test set with 100 tasks spanning ten application domains.
ReportBench 数据集概述
数据集简介
ReportBench 是一个用于评估深度研究代理(Deep Research agents)事实质量和引用行为的综合基准。该基准利用专家撰写的综述论文作为真实参考,通过逆向工程生成领域特定的提示,并提供自动化工具来评估引用和非引用内容。
基准构建
1. 综述论文识别
- 基于 arXiv 元数据快照(2020年后)
- 通过标题/摘要筛选包含“survey”或“review”的论文
- 通过元数据和LLM分类确认出版状态
- 保留600篇高质量的同行评审综述论文
2. 细粒度参考文献提取
- 下载并解析LaTeX源码以提取所有文内引用命令
- 构建反映每篇综述真实引用模式的金标准参考文献集
3. 提示生成
- 通过LLM逆向工程生成三个级别的提示(句子、段落、细节丰富)
- 强制执行与每篇论文出版截止时间匹配的时间约束
- 添加明确指令以避免引用原始综述本身
4. 应用领域分布
- 使用LLM将综述分类到十个领域
- 通过下采样调整分布以实现平衡,并采样三种提示类型之一形成100个任务的基准
评估框架
内容质量评估
- URL提取:从报告中提取所有URL引用
- 标准化和检索:标准化和去重URL,检索每个网页内容
- 文档类型分类:使用LLM确定URL是否对应学术文章并提取标题
- 标题匹配:比较提取标题与专家撰写报告的金标准参考文献,计算重叠率
引用语句评估
- 语句提取:识别生成报告中所有包含明确引用的句子
- 来源检索:抓取每个引用来源的全文
- 语义匹配:使用LLM定位支持段落并验证一致性
- 评分:计算每个报告的引用对齐分数
非引用语句评估
- 语句提取:提取无引用的事实主张,过滤常识内容
- 网络连接事实检查:查询多个网络连接的LLM独立验证每个主张
- 投票机制:通过多数投票聚合判断计算事实准确性
评估结果
| 测试模型 | 精确率 | 召回率 | 平均引用数 | 引用匹配率 | 引用语句数 | 非引用准确率 | 非引用语句数 |
|---|---|---|---|---|---|---|---|
| OpenAI Deep Research | 0.385 | 0.033 | 9.89 | 78.87% | 88.2 | 95.83% | 38.9 |
| Gemini Deep Research | 0.145 | 0.036 | 32.42 | 72.94% | 96.2 | 92.21% | 49.6 |
| gemini-2.5-flash | 0.237 | 0.012 | 5.47 | 44.88% | 12.1 | 98.52% | 11.5 |
| gemini-2.5-pro | 0.269 | 0.010 | 4.27 | 59.24% | 6.58 | 96.08% | 9.35 |
| o3 | 0.299 | 0.031 | 12.26 | 31.43% | 16.16 | 82.22% | 11.51 |
| claude4-sonnet | 0.337 | 0.021 | 6.74 | 73.67% | 14.93 | 92.64% | 17.07 |
数据集结构
- ReportBench Release v1.1:包含主数据集文件(JSON Lines格式)和地面真实参考数据
- Core Processing Scripts:核心处理脚本,包括OpenAI和Gemini处理器、语句评估器等
- Configuration & Utilities:配置和工具文件
- Evaluation Modules:评估模块,包括语句提取、内容抓取、语义匹配等
- Scripts & Templates:脚本和模板文件
使用要求
- Python 3.8+
- 必要的Python包:pandas, pyyaml, langchain-openai, tenacity, tqdm, requests, pathlib, beautifulsoup4, firecrawl-py, python-dotenv
- API密钥配置:OpenAI、Azure OpenAI、Firecrawl、SERPAPI
引用信息
bibtex @software{Li_ReportBench_Evaluating_Deep_2025, author = {Li, Minghao and Zeng, Ying and Cheng, Zhihao and Ma, Cong and Jia, Kai}, license = {Apache-2.0}, month = aug, title = {{ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks}}, url = {https://github.com/ByteDance-BandAI/ReportBench}, version = {1.1.0}, year = {2025} }




