TELBench
收藏资源简介:
TELBench是一个包含1,000个实例的基准数据集,用于在真实深度研究代理轨迹中进行跨度级错误定位。它要求仅根据问题和有序的原始语义跨度,预测有害错误跨度的ID,从而将最终答案准确性转化为过程级任务。
TELBench is a benchmark dataset comprising 1,000 instances, tailored for span-level error localization in real-world deep research agent trajectories. It requires predicting the IDs of harmful error spans solely based on the provided question and ordered original semantic spans, thereby transforming the task of evaluating final answer accuracy into a process-level task.
数据集概述:DRIFT / TELBench
- 数据集名称:TELBench
- 所属框架:DRIFT(Claim-Centric Auditing Framework)
- 研究机构:南京大学 NJU-LINK 团队 & JIUTIAN Research
- 核心任务:面向深度研究型代理轨迹的跨度级错误定位(Span-Level Error Localization)
数据集规模与构成
- 实例数量:1,000 条
- 数据内容:来自真实深度研究代理任务轨迹,每条实例包含:
- 任务问题
- 按序排列的原始语义跨度(raw semantic spans)
- 标注信息:有害无依据跨度的黄金标签、跨度类型、人工注释、判断结果、生成的摘要等
- 数据格式:JSONL(具体 schema 见
data/README.md) - 访问方式:通过 Hugging Face 数据集
NJU-LINK/TELBench下载(加密文件,需使用提供的解密脚本)
核心特性
- 过程级评估:不再仅检查最终答案正确性,而是定位代理在轨迹中首次提出、复用或最终确定有害无依据主张的语义跨度。
- 跨度级标签:提供细粒度的有害错误跨度 ID 作为黄金标准。
- 评估指标:通过
drift-eval工具对比预测结果与黄金标签,计算定位性能。
框架组件(DRIFT)
DRIFT 将代理轨迹建模为主张图,包含三个核心模块:
- Claim Keeper:记录决策关键性主张及其变得重要的时刻。
- Support Seeker:通过图搜索原始跨度,检查主张是否有轨迹证据支持。
- Dependency Tracer:定位无依据主张变为有害承诺的跨度。
使用说明
- 推理方式:提供
bare(全上下文预测)和drift(完整主张中心流水线)两种可比较的设置。 - 运行环境:Python,通过
pip install -e .安装,依赖 huggingface_hub。 - 快速开始:
- 从 Hugging Face 下载加密数据集并解密。
- 配置 API 端点(
.env文件)。 - 运行
drift命令进行推理,再用drift-eval进行评估。
- 详细文档:见 docs/USAGE.md 和 data/README.md。
相关链接
- 项目主页:https://nju-link.github.io/DRIFT/
- 数据集下载:https://huggingface.co/datasets/NJU-LINK/TELBench
- 论文地址:https://arxiv.org/abs/2606.02060
- 代码仓库:https://github.com/NJU-LINK/DRIFT
引用信息
bibtex @misc{wang2026deepresearchagentswrongspanlevel, title={Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories}, author={Jiaming Wang and Ziteng Feng and Jiangtao Wu and Ruihao Li and Qianqian Xie and Yuxiang Ren and He Zhu and Xueming Han and Fanyu Meng and Junlan Feng and Jiaheng Liu}, year={2026}, eprint={2606.02060}, archivePrefix={arXiv}, primaryClass={cs.AI}, url={https://arxiv.org/abs/2606.02060}, }




