遇见数据集

tomo-traces

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

Tomo Agent Traces 数据集是 tomo-labs(用于评估 tomo 及其对比编码智能体的工具链)的完整运行记录。该数据集持续捕获并发布每次评估运行的完整智能体与模型对话轨迹,并将其转换为 Hugging Face Hub 的原生智能体轨迹格式,同时附带重新生成的看板和成本分析报告,确保没有任何运行的证据丢失。目前,数据集包含 86 条轨迹,覆盖 1 个评估集(swebench-live)、15 个场景、5 种工具(claude, codex, opencode, pi, tomo-oi)和 3 种模型(gpt-5.6-luna, gpt-5.6-sol, laguna-s-2.1-free)。每条轨迹对应一个 JSONL 文件,遵循 Hub 的智能体会话模式:首行为 session 记录(包含运行元数据,如工具、模型、场景、通过/失败状态、令牌数和成本),第二行为 model_change 记录,后续每行为一个 message 记录(包含角色和多种类型的内容块,如 text、thinking、toolCall、toolResult)。每条消息都带有 id、parentId 和 timestamp,从而可以构建出有序的时间线。数据集的核心分析聚焦于解决率和每个工具/每个评估的成本,特别强调以最少令牌数解决问题的“最经济获胜者”。随数据集提供的 reports/ 目录包含自动生成的分析报告,如主看板、成本明细(含缓存命中率和推理令牌占比)、按评估和按模型的细分报告等。该数据集旨在为 AI 编码智能体的性能提供透明、可复现的比较基准。用户可以通过 Hub 的轨迹查看器直观查看对话时间线,或使用 datasets 库将整个语料库加载为表格进行分析。数据生成过程确保了安全性:所有文件在提交前都经过凭证扫描,公开的存储库中不包含任何密钥、令牌或授权头信息。

The Tomo Agent Traces dataset is a complete run log of tomo-labs (a toolchain for evaluating tomo and its comparative coding agents). It continuously captures and publishes the full agent-model dialogue trajectories from each evaluation run, converting them into Hugging Face Hubs native agent trajectory format, along with regenerated dashboards and cost analysis reports, ensuring no evidence of any run is lost. Currently, the dataset contains 86 trajectories, covering 1 evaluation set (swebench-live), 15 scenarios, 5 tools (claude, codex, opencode, pi, tomo-oi), and 3 models (gpt-5.6-luna, gpt-5.6-sol, laguna-s-2.1-free). Each trajectory corresponds to a JSONL file, following Hubs agent session pattern: the first line is a session record (including run metadata such as tool, model, scenario, pass/fail status, token count, and cost), the second line is a model_change record, and each subsequent line is a message record (containing roles and various content blocks like text, thinking, toolCall, toolResult). Each message includes id, parentId, and timestamp, allowing for the construction of an ordered timeline. The core analysis of the dataset focuses on resolution rate and cost per tool/per evaluation, with particular emphasis on the most economical winner that solves problems with the fewest tokens. The provided reports/ directory includes automatically generated analysis reports, such as the main dashboard, cost breakdown (including cache hit rate and inference token proportion), and detailed reports by evaluation and model. The dataset aims to provide a transparent and reproducible benchmark for the performance of AI coding agents. Users can visually inspect dialogue timelines via Hubs trajectory viewer or load the entire corpus as a table for analysis using the datasets library. The data generation process ensures security: all files are scanned for credentials before submission, and no keys, tokens, or authorization headers are included in the public repository.

创建时间:
2026-07-23
原始信息汇总

数据集概述

数据集名称:Tomo Agent Traces

数据集地址:https://huggingface.co/datasets/open-index/tomo-trances

许可证:Apache-2.0

语言:英语

任务类别:文本生成

数据规模:少于1K条记录(当前包含90条追踪记录)


数据集内容

该数据集记录了tomo-labs代理评估框架的运行结果,包含每次运行中代理与模型交互的完整对话追踪。数据集持续更新,每次提交都会重新生成评估面板和成本分析。

当前覆盖范围

  • 评估任务(evals):1 个(swebench-live)
  • 场景(scenarios):15 个
  • 工具(tools):5 个(claude, codex, opencode, pi, tomo-oi)
  • 模型(models):3 个(gpt-5.6-luna, gpt-5.6-sol, laguna-s-2.1-free)
  • 追踪总数:90 条

数据格式

每个追踪文件为JSONL格式,存储于 data/ 目录下,遵循Hugging Face Hub原生agent-session模式:

  • 第一条记录为 session 记录,包含运行元数据(工具、模型、场景、通过/失败、令牌数、成本等)
  • 第二条为 model_change 记录,指定使用的模型
  • 后续每条记录为 message 记录,包含 idparentIdtimestamp,以及内容块(textthinkingtoolCalltoolResult
  • 所有记录通过ID和父ID形成有序时间线

文件路径结构

data/<eval>/<scenario>/<model>/<tool>-<runid>.jsonl


评估报告

reports/ 目录包含从每次运行结果自动生成的分析报告:

  • reports/board.md:主面板,展示所有工具在各评估中的解决率、令牌成本、美元成本和运行时间,标记最便宜的解决方
  • reports/by-eval/<eval>.md:每个评估的详细分析,按场景展示通过/失败及成本
  • reports/by-model/<model>.md:每个模型的详细分析,隔离模型表现与工具差异
  • reports/cost.md:令牌和美元成本视图,包含缓存命中率、推理令牌占比

主要评估结果(swebench-live)

工具 模型 解决率 令牌数 成本 运行时间
opencode laguna-s-2.1-free 2/40 1.5M 未知 261m50s
claude gpt-5.6-sol 0/1 0 未知 -
codex gpt-5.6-luna 0/1 7.3M 未知 13m05s
pi laguna-s-2.1-free 0/38 6.8M 未知 46m58s
tomo-oi gpt-5.6-luna 0/10 4.8M 未知 417m20s

最便宜解决方:opencode,仅消耗1.5M令牌


数据加载方式

使用Hugging Face Datasets库加载整个数据集: python from datasets import load_dataset traces = load_dataset("open-index/tomo-traces", split="train") print(traces[0]) # 第一条追踪的session记录


数据生成方法

每个工具在容器中运行,通过记录代理的模型流量,对结果进行隐藏测试评分,生成 result.json 和原始追踪。发布者将捕获的请求历史转换为agent-trace格式,并在提交前扫描所有文件,确保不包含任何密钥、令牌或授权头。


关于tomo

tomo 是一个单Go二进制文件提供的个人AI编码代理。tomo-labs 公正地将其与同任务、同模型、同容器环境下的其他强大开源代理进行对比,并发布追踪记录以确保可复现性。本数据集中的其他工具均为独立项目,通过其官方入口运行,本数据集为外部评估,与其无附属或背书关系。

最后更新:2026-07-23 19:47 UTC

搜集汇总
数据集介绍
tomo-traces 数据集图片
构建方式
在编码智能体评估领域,Tomo Agent Traces数据集通过自动化评估框架tomo-labs系统化构建而成。该框架在容器化环境中运行每个工具,经由记录型代理路由其模型流量,对生成的成果通过隐藏测试进行评分,最终输出包含完整对话历史的result.json及原始轨迹。发布程序从捕获的请求历史和最终响应流中重构完整对话,将其转换为HuggingFace Hub原生智能体会话格式,并提交至数据集。在提交前,每个文件均经过凭证形状扫描,确保不包含任何密钥、令牌或授权头信息。
特点
该数据集的核心特色在于其实时性与可复现性。它记录了每次评估运行的完整智能体轨迹,包括系统提示、用户任务、每个助手回合的推理过程与工具调用,以及每个工具结果与其源头调用的关联。数据集当前涵盖90条轨迹,横跨1个评估基准、15个场景、5种工具(claude、codex、opencode、pi、tomo-oi)和3种模型,并提供详细的成本分析,包括令牌消耗、缓存命中率及推理令牌占比。
使用方法
研究人员可通过HuggingFace Hub的数据集查看器以交互式时间线形式浏览每条轨迹,也可使用datasets库以编程方式加载整个语料库,如`load_dataset("open-index/tomo-traces", split="train")`。数据集按评估基准、场景、模型、工具和运行ID分层组织于`data/`目录下,同时`reports/`目录提供综合分析报告,包括总览面板、各评估基准细分、各模型细分及成本视图,便于进行系统性比较与再现性验证。
背景与挑战
背景概述
随着大语言模型在代码生成领域的迅猛发展,如何系统性地评估和比较不同编码代理的性能成为了亟待解决的关键问题。Tomo Agent Traces数据集由tomo-labs团队于2026年创建,旨在为编码代理评估提供透明、可复现的运行记录。该数据集以SWE-bench等基准任务为场景,记录了claude、codex、opencode、pi及tomo-oi等工具在多种模型上的完整交互轨迹,并以标准化格式存储于HuggingFace Hub。其核心研究问题聚焦于代理的求解率与成本效率,通过详尽的追踪数据驱动分析,为编码代理的公平比较和优化提供了坚实基础,对推动智能编程代理的评估范式和社区实践具有重要影响。
当前挑战
该数据集所面临的挑战首先体现在领域问题层面:现有编码代理评估普遍缺乏一致性,不同工具和模型的性能难以直接对比,而多数评估仅报告最终结果,忽略了运行过程中的交互细节和成本消耗。其次,在构建过程中,团队需要应对多工具、多模型、多场景的复杂组合,确保每次运行的轨迹完整捕获并转换为统一格式,同时解决代理通信中敏感凭证的自动检测与过滤问题,以防数据泄露。此外,成本信息的不完整性(如未知费用)也为结果分析带来不确定性。这些挑战要求数据收集、转换与发布流程具备高度的自动化与鲁棒性。
常用场景
经典使用场景
Tomo Agent Traces数据集作为智能体轨迹的标准化记录库,其核心用途在于为代码生成型语言智能体的行为分析与性能评估提供可复现的实证基础。该数据集以HuggingFace原生智能体会话架构存储每一次运行中智能体与模型间的完整交互序列,涵盖系统提示、用户任务、推理过程、工具调用及结果反馈等多模态内容块。借助数据集内置的时间戳与父子消息链结构,研究者能够完整重建智能体在软件开发基准测试(如SWE-bench)中的决策轨迹,从而深入剖析不同工具与模型组合在代码补全、缺陷修复等场景下的推理模式与执行效率。
实际应用
在实际开发与部署场景中,Tomo Agent Traces数据集为代码智能体系统的选型与优化提供了切实可依的决策依据。工程团队可依据该数据集中记录的多种工具(如Claude、Codex、OpenCode、Pi与Tomo-oi)在不同模型(如GPT-5.6系列与Laguna系列)上的解决率、令牌消耗与运行时长,评估各方案在相似任务下的性价比与稳定性。此外,通过观察智能体在交互过程中的工具调用频次与错误恢复模式,开发者能够针对性地改进自身智能体系统的规划能力与错误处理策略。该数据集亦成为构建更高效提示工程与模型微调策略的重要实证来源,助力从学术研究迈向产业应用的平稳过渡。
衍生相关工作
该数据集的出现催生了多项围绕代码智能体性能归因与效率优化的衍生研究工作。一方面,研究者借助其详尽的交互记录,开展了对智能体推理路径质量的系统评价,分析不同工具在处理同一SWE-bench任务时产生的思考链长度、工具调用准确性与中间步骤冗余度等关键指标。另一方面,基于数据集的可复现特性,出现了若干旨在压缩智能体运行成本的后处理优化工作,通过剪枝无效推理步骤或优化提示策略来降低令牌消耗而不牺牲解决率。此外,该数据集也激发了跨模型迁移能力的研究,探讨同一工具在不同基础模型上表现差异的深层原因,为混合智能体系统的设计提供了实证指引。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务