遇见数据集

apodex/Deep-Research-Benchmarks

收藏
Hugging Face2026-06-08 更新2026-06-14 收录
官方服务:

资源简介:

Deep Research Benchmarks是一个用于深度研究评估的基准数据集集合,主要用于在AgentHarness框架中以标准ReAct模式评估Apodex-1.0模型。该数据集包含多个公开的深度研究基准,例如BrowseComp、BrowseComp-ZH、XBench-DeepResearch-202510、DeepSearchQA、WideSearch、FrontierScience-Research、FrontierScience-Olympiad和SUPERChem-Text。其中,FrontierScience-Research和FrontierScience-Olympiad由Apodex团队构建。数据集以密码保护的形式分发,以防止网络爬虫和训练数据管道索引其答案内容,这旨在避免数据污染而非安全控制。数据集不包括Humanitys Last Exam(HLE),因为其许可证禁止重新分发。

Deep Research Benchmarks is a collection of public deep-research benchmarks used to evaluate the Apodex-1.0 model in standard ReAct mode within the AgentHarness framework. The dataset includes multiple benchmarks such as BrowseComp, BrowseComp-ZH, XBench-DeepResearch-202510, DeepSearchQA, WideSearch, FrontierScience-Research, FrontierScience-Olympiad, and SUPERChem-Text, with FrontierScience-Research and FrontierScience-Olympiad constructed by the Apodex team. It is distributed as a password-protected bundle to prevent web crawlers and training-data pipelines from indexing the answers, serving as contamination protection rather than a security measure. The dataset does not include Humanitys Last Exam (HLE) due to licensing restrictions that prohibit redistribution.

提供机构:
apodex
搜集汇总
数据集介绍
apodex/Deep-Research-Benchmarks 数据集图片
构建方式
Deep-Research-Benchmarks 数据集是由 Apodex 团队精心整合的公共深度研究基准测试集合,旨在为 AgentHarness 框架评估 Apodex-1.0 模型在标准 ReAct 模式下的性能提供标准化测试平台。该数据集以密码保护的压缩包形式发布,涵盖了 BrowseComp、BrowseComp-ZH、XBench-DeepResearch-202510、DeepSearchQA、WideSearch、FrontierScience-Research、FrontierScience-Olympiad 以及 SUPERChem-Text 等多个子基准。其中 FrontierScience-Research 与 FrontierScience-Olympiad 由 Apodex 团队自主构建,其余子基准则遵循各自上游来源的许可协议。数据集文件在解压后遵循 benchmarks/datasets/<Name>/standardized_data.jsonl 的目录布局,便于 AgentHarness 直接读取。
使用方法
使用该数据集时,用户需首先通过 wget 命令下载压缩包,并利用单引号包裹的密码 'apodex*()_2026' 进行解压。解压后的文件自动归置于 benchmarks/datasets/ 目录下,每个子基准拥有独立文件夹,内含 standardized_data.jsonl 文件,此格式为 AgentHarness 的标准化输入模式。若需纳入 HLE 基准,用户需先接受 cais/hle 的许可协议,将数据转换为包含 task_id、task_question、ground_truth 及 answer_type 字段的标准化结构,并存放于指定路径。该数据集专为 AgentHarness 框架设计,可直接用于自动化评估流程。
背景与挑战
背景概述
Deep-Research-Benchmarks数据集由Apodex团队于2026年创建,旨在评估高级人工智能代理在复杂深度研究任务中的表现。该数据集整合了多个公开的基准测试,包括BrowseComp、XBench-DeepResearch-202510、DeepSearchQA等,覆盖多语言、多学科的研究查询,专注于检验AI在信息检索、推理与证据综合方面的能力。作为AgentHarness评估框架的核心组成部分,该数据集填补了现有基准测试在开放域、纵深研究场景中的空白,对推动AI代理从简单问答向自主探索式智能进化具有重要示范意义。
当前挑战
该数据集面临的核心挑战在于模拟真实深度研究任务的复杂性,即AI代理需在大量异构信息中自主导航、验证来源可信度并形成严谨结论。构建过程中的挑战包括防止基准测试答案被公开索引或用于模型训练,故采用密码保护措施避免数据泄露;同时需协调多个上游来源的许可协议,如HLE因版权限制无法直接整合。此外,跨语言(如中英文)、跨学科(如科学、竞赛、化学)的评估设计对数据标准化和一致性提出更高要求,确保公平比较不同模型在多元场景下的实际研究能力。
常用场景
经典使用场景
Deep-Research-Benchmarks数据集汇聚了多个高难度、多模态的深度研究评测基准,涵盖BrowseComp、XBench-DeepResearch、FrontierScience-Research等经典测试集,专为评估具备复杂推理与信息检索能力的智能体Agent而设计。在标准ReAct模式下,研究者通过该数据集可系统性地检验Agent在开放域问答、多步信息追踪、跨语言理解及科学问题求解等维度的表现,尤其适用于衡量模型在真实研究场景中的自主探索与证据整合能力。
解决学术问题
该数据集有效解决了当前大语言模型评测中缺乏高难度、防污染、任务链复杂的标准化评估基准的困境。传统问答数据集多聚焦于事实知识检索,而Deep-Research-Benchmarks通过引入需多步推理与动态信息追踪的深度研究式问题,推动学术界从“记忆型评测”向“推理型评测”转变。其密码保护机制从源头阻断训练数据污染,为智能体系统的鲁棒性验证提供了可信基石,深刻影响了Agent能力评估的方法论演进。
实际应用
在实际产业环境中,Deep-Research-Benchmarks可被部署于金融研报自动生成、科研文献综述辅助、法律案例回溯分析等需要跨源信息综合与深度推理的知识密集型场景。企业级智能体系统利用该基准可快速诊断其在动态搜索、多轮验证与矛盾信息消解上的能力短板,从而优化产品在复杂任务中的决策质量。此外,教育科技领域亦可借助该基准评估智能辅导系统在开放性问题上的应答精确度与逻辑严谨性。
数据集最近研究
最新研究方向
Deep-Research-Benchmarks数据集代表了当前大语言模型评估领域的前沿方向,聚焦于验证型智能体在深度研究任务中的表现。该数据集整合了BrowseComp、DeepSearchQA、FrontierScience-Research等多个跨领域基准,特别针对模型在复杂多跳推理、知识检索与验证能力上的评估需求。密码保护机制借鉴了OpenAI的防护策略,有效防止训练数据污染。这一标准化评估框架的建立,为衡量自主智能体在科学探索和复杂问答任务中的表现提供了关键基准,对推动具备深度研究能力的AI系统发展具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务