Toolathlon-Trajectories
收藏资源简介:
Toolathlon是一个综合性的基准测试,用于评估语言代理在多样化、现实和长周期任务上的表现。该数据集包含了17种最先进的语言模型在Toolathlon基准测试上的完整执行轨迹,共超过5000条任务执行记录。数据集采用JSONL格式存储,每行代表一个任务的执行轨迹。
Toolathlon is a comprehensive benchmark designed to evaluate the performance of language agents on diverse, realistic, and long-duration tasks. This dataset contains complete execution trajectories of 17 state-of-the-art language models on the Toolathlon benchmark, with over 5,000 task execution records in total. The dataset is stored in JSONL format, where each line represents the execution trajectory of a single task.
Toolathlon-Trajectories 数据集概述
数据集基本信息
- 许可证: CC-BY-4.0
- 语言: 英语
- 标签: 智能体
- 数据集名称: toolathlon
- 规模: 1K<n<10K
数据集简介
该数据集包含在Toolathlon基准测试上评估的17个最先进语言模型的完整执行轨迹。Toolathlon是一个用于评估语言智能体在多样化、现实和长视野任务上的综合基准测试。
数据集统计
- 轨迹文件数量: 51个文件(17个模型×3次运行)
- 每个文件任务数: 约108个任务(取决于成功完成情况)
- 总轨迹数: 超过5,000个任务执行记录
- 文件格式: JSONL(每行一个任务轨迹)
数据集用途
- 分析不同大语言模型如何使用工具完成现实世界任务
- 研究智能体推理模式和工具使用策略
- 比较不同模型系列的性能表现
- 调查失败模式和错误恢复策略
数据集结构
文件命名规范
{模型名称}_{运行编号}.jsonl
示例文件名:
gpt-5-high_1.jsonl- GPT-5 High,第一次运行claude-4.5-sonnet-0929_2.jsonl- Claude 4.5 Sonnet,第二次运行gemini-2.5-pro_3.jsonl- Gemini 2.5 Pro,第三次运行
包含的模型
| 模型系列 | 模型名称 |
|---|---|
| OpenAI GPT | gpt-5, gpt-5-high, gpt-5-mini |
| OpenAI o系列 | o3, o4-mini |
| Anthropic Claude | claude-4-sonnet-0514, claude-4.5-sonnet-0929, claude-4.5-haiku-1001 |
| Grok | grok-4, grok-4-fast, grok-code-fast-1 |
| Google Gemini | gemini-2.5-pro, gemini-2.5-flash |
| DeepSeek | deepseek-v3.2-exp |
| 阿里巴巴Qwen | qwen-3-coder |
| Moonshot Kimi | kimi-k2-0905 |
| Zhipu GLM | glm-4.6 |
数据格式
每个JSONL文件每行包含一个JSON对象,代表单个任务执行轨迹:
json { "task_name": "任务名称", "task_status": { "preprocess": "预处理状态", "running": "运行状态", "evaluation": "评估结果" }, "traj_log": { "config": {...}, "messages": [...], "tool_calls": [...], "key_stats": {...}, "agent_cost": {...}, "user_cost": {...}, ... } }
字段说明
task_name: 任务唯一标识符task_status: 执行状态信息traj_log: 完整执行轨迹,包含:config: 任务配置messages: 完整对话历史tool_calls: 所有工具调用记录key_stats: 摘要统计信息agent_cost: 智能体模型API成本user_cost: 用户模拟器模型API成本
隐私与匿名化
所有敏感凭据和API令牌均已匿名化处理:
- 识别所有API密钥、令牌、密码和凭据
- 保留每个敏感字符串的前1/6和后1/6部分
- 中间部分用星号替换
引用
bibtex @article{toolathlon2025, title={The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution}, author={Your Authors}, journal={arXiv preprint arXiv:xxxx.xxxxx}, year={2025} }
许可证
CC-BY-4.0




