AlayaLab/AgenticSTS-trajectories
收藏官方服务:
资源简介:
这个数据集包含了AgenticSTS论文(《AgenticSTS: 一个用于长视野LLM代理的有界内存测试平台》)背后的完整运行级别和决策级别数据,以及两个开源累积上下文基线的原始捕获。具体来说,它包括运行历史记录(如结果、楼层、条件标签、模型配置文件快照、令牌/调用计数)、每个运行的代理决策会话日志(包括每个状态、决策、LLM调用、行动结果、战斗摘要和运行后阶段),以及竞争对手基线运行的原始捕获(如完整提示/响应、游戏输入/输出和运行摘要)。数据集还提供了每个运行的索引清单,并涵盖了298篇论文游戏、14个决策上限运行以及额外审计行的分析超集。数据经过清洗,移除了敏感信息如机器主机名和个人路径。
The complete run-level + decision-level data behind the AgenticSTS paper (AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents), plus the raw captures of the two open-source accumulating-context baselines.
提供机构:
AlayaLab搜集汇总
数据集介绍

构建方式
AgenticSTS-trajectories数据集源自一篇聚焦于有限记忆机制下长程LLM智能体行为评估的学术研究。其构建过程系统而严谨,核心包含两大子集:其一为团队自身智能体的完整轨迹数据,通过让LLM驱动的游戏智能体在《Slay the Spire 2》环境中进行数百次对局,逐决策记录状态、推理过程、令牌消耗及行动结果,形成详尽的会话日志与运行级档案;其二为两个开源基线系统(STS2MCP和CharTyr)的原始捕获数据,每个基线各完成五局游戏,其完整提示、响应及游戏交互被原样归档。所有数据在发布前均经过去敏处理,移除主机名、邮箱等敏感信息,确保了隐私安全。
特点
该数据集独具匠心,提供了多层次的精细数据架构。运行级档案包含每次对局的胜负结果、楼层数、实验条件及模型配置快照,便于宏观性能分析;轨迹级日志则深入到每一次决策的微观细节,囊括LLM调用的延迟、缓存状态与令牌使用量,为剖析智能体推理过程提供了无与伦比的透明度。特别地,数据集包含了14个因决策上限而终止的对局记录,作为审计样本补充了完整分析集,体现了实验的严谨性。此外,基线系统的捕获数据以压缩包形式独立存放,并明确标注其上游许可证,既尊重原始版权,又支持了可复现的对比研究。
使用方法
研究者可通过多层数据接口灵活运用该数据集。运行级存储在`runs_history.jsonl`文件中,可直接加载并依据胜负状态筛选出298局核心实验数据,用于复现论文中的主要统计结果。对于需要深入分析智能体决策行为的用户,可利用`manifest.json`索引,按需解压`trajectories/`目录下对应运行ID的压缩日志,每一步交互的完整JSON内容均可解析。基线系统的数据则通过`competitors/`目录下的独立归档提供,需注意其不同的许可证约束。数据集支持跨版本游戏(v0.103.1与v0.103.3)的比较分析,每个对局记录均标注了游戏版本,为研究游戏更新对智能体表现的影响提供了宝贵素材。
背景与挑战
背景概述
大型语言模型(LLM)驱动的智能体在复杂、长期任务中的表现日益受到关注,然而现有评估体系往往局限于短时域交互,缺乏对智能体在有限记忆资源下持续决策能力的系统性测试。AgenticSTS-trajectories数据集应运而生,由ShandaAI团队于2026年发布,旨在填补这一空白。该数据集基于游戏《Slay the Spire 2》构建,记录了298场完整对局及14场决策截断轨迹,涵盖LLM调用的状态、决策、行动结果等细粒度信息,并附带两个开源基线的原始捕获数据。数据集的核心研究问题是探究LLM智能体在有限记忆约束下的长期决策能力,为长时域智能体评估提供了标准化的行为日志基准。其对后续LLM智能体研究的影响在于,推动了从简单任务向具有记忆限制的复杂策略空间的迁移,成为评估智能体持续推理与适应能力的重要参照。
当前挑战
该数据集所解决的领域挑战在于,传统LLM智能体评估多依赖短对话或单一任务,无法揭示智能体在长期博弈中因记忆累积而面临的决策退化问题,而AgenticSTS通过模拟带有有限记忆约束的游戏环境,逼迫智能体在信息不完整情况下做出序列决策,直接挑战了现有模型在持久规划与状态管理上的脆弱性。构建过程中,团队面临多重实际困难:首先,需要对游戏版本(v0.103.1至v0.103.3)的变化进行严格记录与对齐,确保轨迹一致性;其次,竞争对手基线的原始数据包含各自上游许可证约束(如AGPL-3.0),需在数据集打包时进行逐行脱敏处理,同时保留策略文档用于复现审核;此外,需处理运行时异常(如中断、决策上限)带来的非完整轨迹,以确保分析结果的统计可靠性,最终形成312条记录的分析超集,并需清晰区分论文使用子集与审计子集。
常用场景
经典使用场景
AgenticSTS-trajectories数据集为研究长程任务决策的智能体行为提供了丰富的细粒度轨迹数据。该数据集收录了312轮完整游戏会话的决策级日志,涵盖每步状态、决策选择、大语言模型调用细节(包括令牌消耗、延迟、缓存统计)、行动结果及战斗总结。研究者可借此深入剖析智能体在复杂环境中逐步推理与行动的模式,尤其适用于分析其在有限记忆约束下的策略演变与适应性调整。
解决学术问题
该数据集有效攻克了长期困扰智能体研究领域的核心难题——如何在有界记忆条件下评估大规模语言模型智能体的长程规划能力。依托《杀戮尖塔2》这一复杂策略游戏环境,数据集提供了超越简单问答的序列决策基准,使学术研究者得以系统性地分析智能体在延迟奖励、状态爆炸与信息不完全等现实挑战下的表现。这一资源显著推动了对智能体记忆压缩、注意力分配及错误恢复机制的理论探索。
衍生相关工作
围绕该数据集,已涌现出一系列具有影响力的衍生工作。原始论文《AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents》确立了长程智能体评估的新范式。后续研究基于此数据开发了记忆压缩策略评估框架,并衍生出对比基线智能体(如STS2MCP与CharTyr)的复现分析工具包。这些工作共同构筑了从数据采集到模型优化的完整学术链条,推动了有界记忆场景下智能体设计的标准化进程。
以上内容由遇见数据集搜集并总结生成



