AgentTrove
收藏资源简介:
AgentTrove是目前最大的开源智能体交互轨迹数据集,由OpenThoughts-Agent团队发布。该数据集包含来自219个源数据集的1,696,847条记录,涵盖代码修复、Shell脚本编写、数学问题求解、竞技编程和通用计算机任务等多个领域。其规模是之前最大的开源智能体轨迹数据集Nemotron Terminal Corpus(43万条)的4倍。所有轨迹均采用terminus-2交互格式(类似ShareGPT的对话布局),每条记录包含完整的智能体轨迹,包括工具调用、环境响应和最终推理。数据集使用开源Harbor框架生成,每条记录包含messages(对话轮次列表)、original_source(任务来源标识)、original_teacher(生成轨迹的教师模型)、reward(成功/失败结果)等核心字段,以及来自源数据集的其他元数据。该数据集适用于智能体行为分析、强化学习和代码生成等任务的研究。
AgentTrove is currently the largest open-source agent interaction trajectory dataset, released by the OpenThoughts-Agent team. The dataset contains 1,696,847 records from 219 source datasets, covering multiple fields such as code fixing, Shell script writing, mathematical problem solving, competitive programming, and general computer tasks. Its scale is four times that of the previously largest open-source agent trajectory dataset, Nemotron Terminal Corpus (430,000 records). All trajectories adopt the terminus-2 interaction format (similar to ShareGPTs dialogue layout), with each record containing complete agent trajectories, including tool calls, environment responses, and final reasoning. The dataset is generated using the open-source Harbor framework, with each record containing core fields such as messages (list of dialogue turns), original_source (task source identifier), original_teacher (teacher model generating the trajectory), reward (success/failure result), and other metadata from the source datasets. This dataset is suitable for research in agent behavior analysis, reinforcement learning, and code generation tasks.
AgentTrove 数据集概述
AgentTrove 是目前最大规模的开源代理交互轨迹(agentic interaction traces)数据集,由 OpenThoughts-Agent 团队发布。
- 总规模:包含 1,696,847 行(约 170 万条)数据。
- 数据来源:整合自 219 个源数据集,覆盖代码修复、Shell 脚本、数学问题求解、竞赛编程和通用计算机使用等任务。
- 规模对比:数据量是此前最大的开源代理轨迹数据集 Nemotron Terminal Corpus(43 万行)的 4 倍。
数据格式
所有轨迹采用 terminus-2 harness 格式,即 ShareGPT 风格的对话布局。每一行代表一个完整的代理运行轨迹,包含工具调用、环境响应和最终推理过程。
所有轨迹均使用开源的 Harbor 代理评估与数据生成框架生成。
数据模式(Schema)
每一行包含以下字段。注意,不同源数据集的模式可能不同,缺失的列以 null 填充。
| 字段名 | 类型 | 描述 |
|---|---|---|
messages |
list[dict] |
完整代理轨迹,由多个对话轮次组成。每个轮次为一个字典,包含 role("user"、"assistant" 或 "tool")和 content(字符串)。遵循 Harbor 使用的 terminus-2 / ShareGPT 格式。 |
original_source |
string |
标识该行数据来源的任务标签(例如 "swesmith"、"codeforces"、"nl2bash"、"r2egym"、"exp_rpt"、"exp_tas")。 |
original_teacher |
string |
标识生成该轨迹的教师模型(例如 "GLM-4.7"、"GLM-4.6"、"GPT 5.1 Nano"、"Kimi K2.0 Thinking"、"MiniMax M2.0"、"Qwen3-8B")。 |
reward |
float |
代理轨迹的通过/失败结果,通常为 1.0(成功)或 0.0(失败)。大部分源数据集包含此字段。 |
task_id |
string |
任务实例的唯一标识符。格式因源数据集而异。 |
| (其他列) | 可变 | 来自源数据集的其他元数据列(例如 trajectory_id、episode、model、sandbox_id)。 |
源数据集
AgentTrove 通过拼接 OpenThoughts-Agent 项目过程中生成的训练数据集构建而成。完整来源列表请参见 README 文件。
许可协议
- 许可证:Apache-2.0
- 任务类别:文本生成(text-generation)
- 语言:英语(English)
引用
若在研究中使用了 AgentTrove,请引用:
bibtex @misc{openthoughts-agent, author = {Team, OpenThoughts-Agent}, month = Dec, title = {{OpenThoughts-Agent}}, howpublished = {https://www.open-thoughts.ai/blog/agent}, year = {2025} }




