NJU-LINK/TELBench
收藏官方服务:
资源简介:
TELBench是一个包含1,000个实例的基准测试,用于深度研究代理轨迹中的跨度级错误定位。每个实例包含一个任务问题、有序的语义跨度以及专家验证的错误跨度标签。
TELBench is a 1,000-instance benchmark for span-level error localization in deep-research agent trajectories. Each instance contains a task question, ordered semantic spans, and expert-verified error span labels.
提供机构:
NJU-LINK搜集汇总
数据集介绍

构建方式
TELBench是一个面向深度研究智能体轨迹中跨度级错误定位的基准测试集,包含1000个精心构造的实例。每个实例均由任务问题、按序排列的语义跨度以及专家验证的错误跨度标签三部分构成。为确保数据集的完整性与可验证性,整体采用AES-256-CBC加密存储于JSONL文件中,并通过公开的密码短语进行解密,同时提供加密文件与解密后文件的SHA256校验和以保障数据完整性。该基准专门用于评估模型在复杂研究轨迹中精准识别错误语义跨度的能力。
使用方法
使用TELBench时,研究者需首先通过Hugging Face下载加密文件及密码短语,利用OpenSSL工具执行AES-256-CBC解密以获取原始JSONL数据。评估过程中,模型仅接收任务问题与按序排列的原始跨度文本作为输入,gold标签、注释、元数据及人工笔记等信息均不提供给模型,从而确保评估的公正性。解密后的数据可直接由Python程序读取,每条JSON记录即构成一个独立的评估实例,便于灵活开展各类基线方法与新模型的性能对比实验。
背景与挑战
背景概述
在深度研究型智能体(deep-research agent)高速发展的背景下,对其执行轨迹进行细粒度错误定位(span-level error localization)成为评估与改进系统可靠性的关键。TELBench数据集由南京大学LINK实验室于2025年创建,专注于研究智能体在多步骤复杂任务中产生的语义级错误。该基准包含1,000个精心标注的实例,每个实例涵盖任务问题、有序语义片段以及专家验证的错误标签,旨在推动深度研究智能体在轨迹层级上的错误检测与诊断研究。TELBench的发布为智能体可解释性与鲁棒性评估提供了标准化参照,尤其对自动化错误定位领域产生了积极的推动力。
当前挑战
TELBench所解决的领域核心挑战在于深度研究智能体轨迹中语义级错误的自动精准定位,区别于传统全局正确性判断,该任务需要对每个语义片段进行细粒度的异常判定,且错误类型涵盖约束语义错误等多种复杂模式。在构建过程中,研究者面临两重显著挑战:其一,需从海量智能体执行轨迹中筛选并有序切分语义片段,确保其边界与任务逻辑自洽;其二,由专家手工标注错误标签需应对高维度语义空间中的歧义性,并通过多轮验证确保标注一致性。此外,为防止基准泄露,数据集采用加密保护机制,同时公开解密口令以平衡开放性与完整性管控。
常用场景
经典使用场景
TELBench作为细粒度跨度级错误定位基准,广泛应用于深度研究智能体轨迹的错误检测与定位评估。研究者借助该数据集,可系统性地衡量智能体在复杂多跳任务中识别语义异常span的能力,尤其适用于验证错误定位框架的召回率与精确度。其1,000个精心标注的实例覆盖了从检索到推理的完整阶段,为剖析智能体行为中的潜在故障提供了标准化测试平台。
解决学术问题
该数据集精准回应了深度研究智能体可解释性与鲁棒性评估中长期存在的细粒度误差定位难题。传统方法多停留在任务级正确性判断,难以揭示中间步骤的语义偏差。TELBench通过专家校验的span级错误标签,使得学术界得以定量分析智能体在约束语义理解、信息检索偏差等维度的脆弱环节,显著推进了智能体可靠性评价体系的理论构建。
实际应用
在实际研发场景中,TELBench直接服务于智能体系统的质量保证与迭代优化。开发团队可依托其标准化测试流程,自动检测复杂智能轨迹中的逻辑矛盾或信息误用,从而针对性改进agent的推理管线设计。该数据集已被集成至DRIFT评估框架,支持对前沿模型的系统性压力测试,为智能体在金融决策、科研辅助等高风险领域的落地提供了关键验证手段。
数据集最近研究
最新研究方向
TELBench作为首个聚焦深度研究智能体轨迹中语义级错误定位的基准数据集,填补了细粒度错误检测与归因评估的空白。当前前沿研究方向集中于通过构建层次化语义表征与跨步骤上下文建模,实现对抗性错误模式的精准捕捉。该数据集与GAIA等复杂推理任务相结合,推动智能体从任务执行正确性向过程可靠性进化,尤其在大模型驱动的自主研究场景中,为错误根因分析和可解释性提升提供了标准化评测框架。
以上内容由遇见数据集搜集并总结生成



