遇见数据集

FORT

收藏
arXiv2026-06-10 更新2026-06-12 收录
官方服务:

资源简介:

FORT数据集是由中国人民大学、智源研究院等机构联合构建的用于训练深度搜索智能体的抗捷径训练数据合成框架。该数据集通过控制证据共覆盖、单线索选择性、暴露常数和先验知识绑定四种捷径风险,生成了迫使模型进行长程证据获取的高质量搜索任务。其构建过程涵盖实体选择、证据图构建、问题表述和对抗性精炼等多个阶段,旨在解决现有搜索数据集因结构性捷径而无法有效训练智能体进行多步规划和信息合成的核心问题,主要应用于深度搜索智能体的监督微调与能力评估。

The FORT Dataset is a shortcut-robust training data synthesis framework jointly constructed by Renmin University of China, Zhiyuan Research Institute, and other institutions for training deep search AI agents. This dataset generates high-quality search tasks that force models to conduct long-range evidence acquisition by controlling four types of shortcut risks: evidence co-coverage, single-cue selectivity, exposure constant, and prior knowledge binding. Its construction process covers multiple stages including entity selection, evidence graph construction, question formulation, and adversarial refinement. It aims to address the core issue that existing search datasets fail to effectively train AI agents for multi-step planning and information synthesis due to structural shortcuts, and is mainly applied to supervised fine-tuning and capability evaluation of deep search AI agents.

创建时间:
2026-06-10
原始信息汇总

数据集概述:FORT-Searcher

FORT-Searcher 是一个专注于训练深度搜索智能体的数据集合成框架,旨在生成“抗捷径”(shortcut-resistant)的搜索任务,避免智能体通过简单线索而非完整搜索过程找到答案。

核心问题

传统方法通过增加图结构复杂度来提升任务难度,但结构复杂性并不保证真正的搜索难度——智能体可能通过成本更低的“捷径”路线(如单页面信息、先验知识等)直接得出答案。

四大捷径风险(Shortcut Risks)

FORT 框架识别并控制以下四类风险:

  • 证据共现(Evidence Co-coverage):多个线索同时出现在同一个页面,提供捷径。
  • 单线索选择性(Single-clue Selectivity):仅凭单个线索即可确定答案。
  • 暴露常量(Exposed Constants):问题表面出现的精确字符串可直接用于下游查询。
  • 先验知识绑定(Prior-knowledge Binding):求解者无需检索,仅凭参数化知识即可回答。

数据构建流程

FORT 通过以下步骤生成高质量训练数据:

  1. 实体选择:选取不易通过单一信息源识别的实体。
  2. 证据图构建:设计多步搜索所需的证据依赖关系。
  3. 问题生成:确保问题无法通过捷径直接解答。
  4. 对抗性优化:进一步消除潜在的捷径漏洞。

性能表现

数据集配套的实验结果表明,基于 FORT 框架训练的模型(FORT-Searcher)在深度搜索任务上取得了显著性能提升(详见论文图例)。

计划发布内容

  • SFT 训练数据:包含搜索轨迹的监督微调数据(即将发布)。
  • 模型权重:FORT-Searcher-30B-A3B(即将发布)。
  • 评估代码:用于复现实验的评估脚本(即将发布)。

引用信息

对应论文为《FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents》,发表于 arXiv,论文 ID:2606.12087,作者包括 Jia Deng, Yimeng Chen 等。

搜集汇总
数据集介绍
FORT 数据集图片
构建方式
FORT数据集的构建基于一套名为FORT(Framework of Shortcut-Resistant Training-Data Synthesis)的框架,旨在生成抗捷径的深度搜索训练数据。构建过程始于从Wikidata中选取长尾根实体,以降低先验知识绑定的风险。随后,通过循环结构初始化种子图,避免下游实体在问题中过早暴露。在证据图构建阶段,系统从异构来源收集原子事实,并构造派生事实以减少证据共覆盖。通过选择通用事实和进行事实验证,进一步控制单一线索的选择性风险。最后,在问题表述阶段采用名称隐藏和精确值模糊化策略,并经过对抗性精炼修复易受捷径攻击或模糊不清的问题,确保最终合成的问题具备预期的搜索难度。
使用方法
FORT数据集主要用于训练深度搜索智能体的搜索行为。使用者可通过监督微调(SFT)对基础推理模型(如Qwen3-30B-A3B)进行训练,利用FORT生成的搜索轨迹(包含多轮交互记录)使模型学会在承诺答案前进行充分的证据获取。训练时采用序列打包优化长上下文利用率,并使用Adam优化器与余弦学习率调度。在推理阶段,建议采用上下文管理协议:保留所有工具调用结果,当达到预设轮次限制(如BrowseComp为300轮)时清空历史并重新启动搜索。该方法已在BrowseComp、BrowseComp-ZH等基准测试中验证有效,显著提升了同等规模模型的多跳搜索能力。
背景与挑战
背景概述
FORT(Framework of Shortcut-Resistant Training-Data Synthesis)是由中国人民大学、阿卜杜拉国王科技大学、IQuest Research 以及上海交通大学的研究人员于2026年联合提出的数据集。该数据集的核心研究问题在于,如何为深度搜索代理(deep search agents)提供高质量的训练数据,以迫使模型在回答前进行充分的证据收集与多步推理,而非依赖捷径或先验知识。在传统多跳问答数据集(如HotpotQA)中,问题往往不能强制代理进行长距离证据采集,而现有合成方法虽通过增加图结构复杂度来提升表面难度,却未能有效阻止搜索过程中的捷径行为——例如单一证据节点同时验证多个线索、问题表面暴露可直接检索的常量等。FORT 通过系统的捷径风险控制,在实体选择、证据图构建、问题生成与对抗性精炼四个阶段消除这些漏洞,显著提升了训练数据的实际搜索难度。该数据集在 BrowseComp、BrowseComp-ZH 等强基准测试中表现出色,训练出的 FORT-Searcher 模型在同类开源搜索代理中取得最佳综合性能,推动了深度搜索代理训练范式的发展。
当前挑战
FORT所解决的领域挑战包括三个方面。首先,在深度搜索任务中,传统数据合成方法仅追求表面结构复杂化(如增加跳数或图宽度),却无法保证代理实际执行时遵循预期的多步证据采集路径,导致训练效果有限。其次,模型在搜索过程中容易利用四种捷径风险:证据共覆盖(单条检索结果验证多个线索)、单线索选择性(少量线索即可锁定答案)、暴露常量(问题表面泄露可直接检索的关键词)以及先验知识绑定(模型凭记忆作答而非搜证)。这些捷径使得看似复杂的任务在真实搜索中快速崩塌。在数据集构建过程中,FORT面临的挑战包括:如何从维基数据中选取长尾实体以降低先验绑定风险,如何通过多源异构证据收集与衍生事实构造提升证据分散度,如何在问题表述中隐蔽中间实体名称并模糊精确数值,以及如何通过对抗性精炼自动识别并修复仍存在捷径的草案问题。这些措施共同确保了合成数据的实际搜索难度与预期的推理要求相匹配。
常用场景
经典使用场景
FORT数据集的核心应用场景在于训练深度搜索智能体,使其能够在复杂、多跳的开放网络环境中执行持久性的证据发现。其经典使用方式是通过合成具有抗捷径特性(shortcut-resistant)的训练数据,迫使智能体在回答问题前必须历经多轮检索、证据评估与信息整合,而非依赖单一线索、共现证据或先验知识直接命中答案。该数据集特别适用于需要长程推理与跨来源信息融合的检索任务,例如在广泛开放的Web环境中定位长尾实体、验证多约束条件或解析隐晦的关联线索。
解决学术问题
FORT数据集直面当前深度搜索训练数据中普遍存在的捷径(shortcut)问题,系统性地解决了四项关键学术挑战:证据共覆盖(evidence co-coverage)导致的多线索被单一片段同时验证、单线索选择性(single-clue selectivity)引发的少量线索即可锁定答案、暴露常量(exposed constants)造成的下游查询过早可执行、以及先验知识绑定(prior-knowledge binding)导致的模型未检索即作答。通过提出捷径感知的难度框架并引入轨迹特征签名(如求解成本、答案命中时间与先验捷径率),FORT为评估与生成真正需要深度搜索的高质量训练数据提供了理论依据与可操作的方法论。
实际应用
在实际应用中,FORT数据集及其训练的FORT-Searcher智能体可部署于需要深度信息采集与验证的各类场景,包括但不限于专业领域的文献综述与事实核查、企业竞争情报的跨源聚合、科研工作中的长程推理查询、以及法律或医疗等需高置信度证据支持的信息检索任务。凭借其抗捷径的合成策略,该框架能有效降低智能体依赖表面线索或记忆性知识作答的概率,提升搜索行为在真实开放环境中的鲁棒性与可靠性,尤其适用于那些需要多步证据链验证才能得出可靠结论的复杂问题。
数据集最近研究
最新研究方向
当前,深度搜索代理的训练数据合成领域正经历从表面结构复杂度向实际搜索难度的范式转变。FORT数据集的提出标志着这一前沿方向的重要突破,其核心创新在于系统性地识别并规避了四种关键捷径风险——证据共覆盖、单线索选择性、暴露常量与先验知识绑定。该研究通过构建抗捷径的训练数据,迫使搜索代理在真实环境中进行更长的预答案搜索,而非依赖早期答案暴露或参数化先验。这一进展不仅为训练高难度深度搜索代理提供了可量化的难度框架,更通过仅监督微调即实现开源搜索代理最优性能,显著推动了搜索代理从结构复杂化向真实认知负荷的演进,对构建真正具备持久证据发现能力的自主智能系统具有里程碑式意义。
相关研究论文
  • 1
    FORT-Searcher: Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents中国人民大学·高瓴人工智能学院; 阿卜杜拉国王科技大学; 智源研究院; 上海交通大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务