遇见数据集

huangjh16/BenchTrace

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

BenchTrace是一个用于评估大型语言模型(LLM)代理自我进化能力的基准测试集。它提供了一个包含1,821个带注释事件的快照-反思数据集,涵盖六个代理任务:ALFWorld具身家庭任务、BabyAI网格世界导航、捆绑式网络购物、ScienceWorld交互式科学、Jericho文本冒险游戏和团体旅行规划。数据集包括两个评估套件:反思评估和进化评估。每个事件包含唯一标识符、环境/游戏实例、任务类型、代理模型、成功状态、快照(用于反思的轨迹上下文)以及带注释的失败实例(包括检测、定位和诊断标签)。数据来源于多个代理环境,遵循各自的许可证,原始注释基于CC-BY-4.0发布。

BenchTrace is a benchmark for evaluating the self-evolution ability of LLM agents. It provides a snapshot–reflection dataset of 1,821 annotated episodes spanning six agentic tasks: ALFWorld embodied household tasks, BabyAI grid-world navigation, bundled web shopping, ScienceWorld interactive science, Jericho text-adventure games, and group travel planning. The dataset is paired with two evaluation suites: Reflection Evaluation and Evolution Evaluation. Each episode includes a unique identifier, environment/game instance, task type, agent model, success status, snapshot (trajectory context for reflection), and annotated failure instances with detection, localization, and diagnosis labels. The data is derived from several agentic environments under their respective licenses, with original annotations released under CC-BY-4.0.

提供机构:
huangjh16
搜集汇总
数据集介绍
huangjh16/BenchTrace 数据集图片
构建方式
BenchTrace数据集的构建源于对大型语言模型(LLM)智能体自我进化能力的评估需求。研究团队从ALFWorld、BabyAI、Jericho等六个具有代表性的智能体任务环境中,系统采集了由不同模型生成的智能体交互轨迹。每一条轨迹均经过精细的失败标注,涵盖失败检测、定位与诊断三个维度,形成了包含1821个注释片段的综合性数据集。这些片段以JSON格式组织,并依据任务类别进行划分,为后续的标准化评估提供了坚实的基础。
特点
该数据集的核心特色在于其双轨评估体系,即反思评估与进化评估,能够从不同层面衡量智能体的自我改进能力。它提供了丰富的快照信息,记录了智能体在任务中的完整上下文,使得研究者可以深入分析失败的根源。此外,数据集的覆盖范围广泛,涵盖了具身任务、文本冒险、网格导航与网络购物等多种场景,为全面检验LLM智能体的泛化能力提供了宝贵的资源。
使用方法
使用BenchTrace数据集极为便捷,研究者可通过HuggingFace平台的datasets库直接加载,例如执行`load_dataset("huangjh16/BenchTrace", "jericho")`即可获取特定任务的数据。同时,数据集也支持直接读取原始JSON文件,便于进行自定义处理。结合配套的代码与评估套件,用户能够轻松运行反思评估与进化评估,从而量化智能体在面对失败后的表现提升,推动自我进化领域的研究进展。
背景与挑战
背景概述
随着大语言模型(LLM)代理在复杂交互任务中的广泛应用,如何评估其自主进化能力——即从失败中学习并改进自身策略的能力——成为人工智能研究的前沿课题。于2026年发表在ACL会议的BenchTrace数据集,由日本国立信息学研究所(NII)的研究团队构建,旨在填补LLM代理自我进化评估的空白。该数据集精心收集了1,821个标注轨迹,覆盖ALFWorld、BabyAI、WebShop等六种典型代理任务环境,通过记录代理的完整交互快照与失败实例的细粒度标注,为衡量代理的反思与进化能力提供了标准化基准。BenchTrace的出现,标志着LLM代理评估从单一任务性能转向动态学习能力的范式转变,对推动自主智能体的持续优化具有深远影响。
当前挑战
构建BenchTrace面临的核心挑战在于,现有基准大多仅关注代理的单次执行结果,缺乏对其从过往失误中汲取经验并进行策略调整能力的系统量化。数据集构建过程同样困难重重:其一,需要从异构的代理环境中提取统一的反思与进化评估框架,而各任务(如网格导航与文字冒险)的失败模式差异巨大,标注规范难以标准化;其二,失败实例的自动检测与人工标注需兼顾效率与质量,确保对‘策略失误’与‘环境随机性’的准确区分;其三,数据规模有限,在1821个片段中平衡任务分布并保证进化轨迹的多样性,对构建代表性基准提出了严苛要求。
常用场景
经典使用场景
BenchTrace数据集专为评估大语言模型(LLM)代理的自我进化能力而设计,其经典使用场景聚焦于对代理体在复杂交互环境中的反思与演进进行系统性评测。该数据集涵盖了ALFWorld、BabyAI、科学世界等六个典型代理任务,包含1,821个精心标注的回合记录,每个回合均提供了完整的状态快照和故障实例注释,为研究者提供了从失败检测到根因定位的多层次诊断信息。
解决学术问题
BenchTrace直面当前LLM代理研究中的一个核心盲区——如何定量评估代理体在面对失败后的自我反思与策略调整能力。传统基准多侧重于单次任务的成功率,而忽视了从错误中学习并优化行为模式的动态进化过程。该数据集通过双重评估体系(反思评估与进化评估),首次为学术界提供了标准化框架,以系统研究代理体如何利用过往经验提升后续决策质量,从而推动LLM代理从静态执行向动态自适应的范式转变。
衍生相关工作
围绕BenchTrace数据集,已衍生出多项标志性研究工作,包括自我反思驱动的元学习框架、基于奖励塑形的失败诊断模型以及多智能体协同进化策略。这些工作推动了LLM代理在失败解释性、错误恢复机制和长期性能优化等方面的理论突破,并为构建能够持续性自我改进的通用代理体提供了实验范式和评估标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务