遇见数据集

TELBench

收藏
github2026-06-02 更新2026-06-05 收录
数据链接:
官方服务:

资源简介:

TELBench是一个包含1,000个实例的基准数据集,用于在真实深度研究代理轨迹中进行跨度级错误定位。它要求仅根据问题和有序的原始语义跨度,预测有害错误跨度的ID,从而将最终答案准确性转化为过程级任务。

TELBench is a benchmark dataset comprising 1,000 instances, tailored for span-level error localization in real-world deep research agent trajectories. It requires predicting the IDs of harmful error spans solely based on the provided question and ordered original semantic spans, thereby transforming the task of evaluating final answer accuracy into a process-level task.

创建时间:
2026-05-28
原始信息汇总

数据集概述:DRIFT / TELBench

  • 数据集名称:TELBench
  • 所属框架:DRIFT(Claim-Centric Auditing Framework)
  • 研究机构:南京大学 NJU-LINK 团队 & JIUTIAN Research
  • 核心任务:面向深度研究型代理轨迹的跨度级错误定位(Span-Level Error Localization)

数据集规模与构成

  • 实例数量:1,000 条
  • 数据内容:来自真实深度研究代理任务轨迹,每条实例包含:
    • 任务问题
    • 按序排列的原始语义跨度(raw semantic spans)
    • 标注信息:有害无依据跨度的黄金标签、跨度类型、人工注释、判断结果、生成的摘要等
  • 数据格式:JSONL(具体 schema 见 data/README.md
  • 访问方式:通过 Hugging Face 数据集 NJU-LINK/TELBench 下载(加密文件,需使用提供的解密脚本)

核心特性

  • 过程级评估:不再仅检查最终答案正确性,而是定位代理在轨迹中首次提出、复用或最终确定有害无依据主张的语义跨度。
  • 跨度级标签:提供细粒度的有害错误跨度 ID 作为黄金标准。
  • 评估指标:通过 drift-eval 工具对比预测结果与黄金标签,计算定位性能。

框架组件(DRIFT)

DRIFT 将代理轨迹建模为主张图,包含三个核心模块:

  1. Claim Keeper:记录决策关键性主张及其变得重要的时刻。
  2. Support Seeker:通过图搜索原始跨度,检查主张是否有轨迹证据支持。
  3. Dependency Tracer:定位无依据主张变为有害承诺的跨度。

使用说明

  • 推理方式:提供 bare(全上下文预测)和 drift(完整主张中心流水线)两种可比较的设置。
  • 运行环境:Python,通过 pip install -e . 安装,依赖 huggingface_hub。
  • 快速开始
    • 从 Hugging Face 下载加密数据集并解密。
    • 配置 API 端点(.env 文件)。
    • 运行 drift 命令进行推理,再用 drift-eval 进行评估。
  • 详细文档:见 docs/USAGE.mddata/README.md

相关链接

引用信息

bibtex @misc{wang2026deepresearchagentswrongspanlevel, title={Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories}, author={Jiaming Wang and Ziteng Feng and Jiangtao Wu and Ruihao Li and Qianqian Xie and Yuxiang Ren and He Zhu and Xueming Han and Fanyu Meng and Junlan Feng and Jiaheng Liu}, year={2026}, eprint={2606.02060}, archivePrefix={arXiv}, primaryClass={cs.AI}, url={https://arxiv.org/abs/2606.02060}, }

搜集汇总
数据集介绍
TELBench 数据集图片
构建方式
TELBench的构建源于对深度研究型智能体轨迹中错误根源的精细化剖析需求。研究团队收集了1000个真实世界的深度研究轨迹实例,每个实例均包含原始的语义跨度序列。通过人工与自动化工具相结合的方式,标注出其中首次出现、复用或最终形成有害无依据声明的语义跨度ID作为错误定位金标准。轨迹数据在预处理中剥离了模型无关信息,仅保留任务问题与有序原始跨度文本,确保评测聚焦于过程级错误诊断能力。
特点
TELBench的特点在于其首创的跨度级错误定位视角,超越了传统仅检验最终答案正确性的评估范式。每个实例包含丰富的跨类型标注,如决策关键声明、支撑证据检索结果以及依赖关系追踪路径,能够全面刻画智能体在长轨迹中的推理缺陷。数据集规模达1000例,覆盖多样化的搜索、工具使用与答案综合场景,且所有标签均经过严格校验,为深度研究智能体的可靠性审计提供了高质量的基准平台。
使用方法
使用TELBench时,需首先从Hugging Face下载加密的数据文件,并通过提供的解密脚本完成解压缩。随后,利用DRIFT框架的drift命令加载数据,选择bare或drift两种评估模式之一运行,其中drift模式会执行完整的声明中心管线。评估结果通过drift-eval命令对比模型预测与金标准标签自动生成,支持多worker并行加速。完整的API调用参数、输入输出格式及评价指标细节详见项目文档和代码仓库中的使用指南。
背景与挑战
背景概述
随着大规模语言模型与工具调用机制的深度融合,深度研究型智能体(deep-research agent)在复杂多步推理任务中展现出卓越的能力,但其长程轨迹中蕴藏的细粒度错误定位问题日益凸显。现有评估体系多聚焦于最终答案的正确性,难以揭示推理过程何时、何处引入不可靠的未支撑主张。在此背景下,南京大学NJU-LINK团队联合JIUTIAN Research于2026年提出DRIFT框架与TELBench基准集,该工作由王嘉铭、冯子腾等研究者共同完成,发表于arXiv预印本。TELBench包含1000个精心标注的真实深度研究轨迹实例,开创性地将错误定位从答案级细化为语义跨度级,为揭示智能体推理过程中的隐性问题提供了关键评估工具,对提升智能体的可信度与鲁棒性具有重要推动意义。
当前挑战
TELBench所解决的领域核心挑战在于,深度研究智能体的长程轨迹中错误传播具有隐蔽性与累积性,传统的终局准确率指标无法定位具体失效步骤,导致模型调试与安全审计缺乏精准依据。构建过程中面临的挑战包括:如何从开放域、多工具交互的真实轨迹中精确划分语义跨度,并标注每个跨度对最终结论的支持性或损害性;如何设计claim-centric的标注体系以区分首次引入、重复使用与最终固化的未支撑主张;以及如何在保证数据隐私的前提下,构造包含千例高保真标注轨迹的基准集,并配套可复现的评估框架与加密分发机制。
常用场景
经典使用场景
在深度研究智能体的长程推理轨迹中,错误往往潜伏于复杂的多步交互过程,而传统的最终答案正确性评估难以精准定位错误的根源。TELBench将这一挑战转化为一项细粒度的语义跨度级错误定位任务,要求模型仅依据原始问题与按序排列的语义跨度序列,预测其中包含有害性错误或未支撑声明的跨度标识。该基准涵盖1000条真实深度研究智能体的执行轨迹,每条轨迹均经过人工标注,旨在评估不同方法在复杂工具链、多轮检索与推理链条中对早期错误承诺、错误复用与最终错误固化等跨度的识别能力。这一设定为深度研究智能体的过程级诊断与鲁棒性改进提供了标准化的评测平台。
实际应用
在实际产业环境中,TELBench驱动的DRIFT审计框架能够用于金融研报生成、医学文献综述、法律案例分析等高风险知识密集型场景,帮助开发者系统性地检测智能体在事实性信息提取、逻辑推理与证据整合环节中的有害错误。例如,在智能投研系统中,该框架可以精准定位智能体在搜索阶段错误采信了具有偏见的财务数据,或在推理过程中产生了未经证实的市场预测;在辅助医疗决策系统中,则能发现智能体在整合临床指南时是否出现支撑证据不足的危险主张。通过这些细粒度的错误定位,工程师可以高效回溯并修正智能体的局部推理模块,从而显著提升应用系统的整体可靠性与可审计性。
衍生相关工作
TELBench的发布催生了一系列围绕智能体过程级审计与错误归因的经典工作,包括基于图结构的声明追踪方法、面向令牌级错误定位的序列标注模型、以及利用对比学习增强错误跨度感知能力的预训练范式。部分研究进一步拓展了DRIFT框架,将其应用于多智能体协作场景中的错误传播分析与责任归因,探索了在角色分工与信息交接过程中错误是如何跨智能体蔓延的。此外,也有工作将TELBench与博弈论中的夏普利值相结合,量化每个语义跨度对最终答案错误的边际贡献,提升了错误定位的可解释性。这些衍生工作共同丰富了深度研究智能体的可信评估生态,推动了过程监督学习在该领域的理论深入与方法创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务