遇见数据集

kimi-k3-coding-and-debugging-traces

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

Kimi K3 编码与调试代理轨迹数据集是一个包含端到端代理编码轨迹的集合,专为代码生成、调试和工具使用任务设计。该数据集由 moonshotai/kimi-k3 模型通过 pi 编码代理运行时在 openrouter 平台上生成,采用最大推理强度。每个轨迹代表一个完整的会话,旨在解决真实代码仓库中的具体修复或构建任务,涉及代码的读取、编辑和运行。数据集包含 28 个已验证的轨迹(基于 883 个可验证修复种子),每个轨迹的助手交互轮次在 4 到 11 次之间(中位数为 8 次)。任务类别多样,涵盖构建游戏(build-game,占 29%)、修复 Bash 警告(warnfix-bash,占 11%)、构建报告(build-report,占 7%)以及调试 CLI、重构参数、构建配置、构建文本等多种类型,所有任务均属于编码(coding)领域。涉及的主要编程语言是 Bash 和汇编语言(asm)。在数据生成过程中,代理被提供了统一的工具集(包括 read、write、edit、bash、grep、find、ls),并在实际轨迹中主要使用了 bash、edit、read 和 write 等工具。原始运行时轨迹被标准化为 OpenAI 风格的 messages 和 tools 模式,确保其与具体代理运行时无关。数据模式包括任务ID、语言、类别、教师运行时、教师模型、提供商、推理努力程度、模型认证状态、观察到的模型列表、轨迹格式、消息数量以及完整的会话消息列表等字段。数据集以单个 traces.jsonl 文件发布,每行包含一个完整轨迹的会话数据。在最终发布版本中,该文件将被替换为累积的下一步前缀导出格式,该格式将每个轨迹拆分为每个助手轮次的独立训练行,并确保精确前缀连续性和轨迹不相交的训练/验证分割。该数据集的主要用途包括:用于代理编码模型的监督微调(SFT)或知识蒸馏,研究真实仓库环境中的下一步规划和工具使用行为,以及对在确定性验证下表现强大的教师模型进行行为分析。数据集在发布前经过独立评审模型(claude-fable-5)的筛选,并进行了隐私擦除处理(如主机路径、运行时临时目录和凭证模式)。数据集采用 CC-BY-4.0 许可证发布。

The Kimi K3 Coding and Debugging Agent Trajectory Dataset is a collection of end-to-end agent coding trajectories, designed for code generation, debugging, and tool usage tasks. It is generated by the moonshotai/kimi-k3 model via the pi coding agent runtime on the openrouter platform, using maximum inference strength. Each trajectory represents a complete session aimed at solving specific repair or build tasks in real code repositories, involving code reading, editing, and execution. The dataset contains 28 verified trajectories (based on 883 verifiable repair seeds), with assistant interaction rounds per trajectory ranging from 4 to 11 (median 8). Task categories are diverse, including build-game (29%), warnfix-bash (11%), build-report (7%), as well as debugging CLI, refactoring parameters, build configuration, build text, and other types, all belonging to the coding domain. The primary programming languages involved are Bash and assembly language (asm). During data generation, agents were provided with a unified toolset (including read, write, edit, bash, grep, find, ls), with bash, edit, read, and write being the main tools used in actual trajectories. Original runtime trajectories are standardized into OpenAI-style messages and tools format, ensuring independence from specific agent runtimes. The data schema includes fields such as task ID, language, category, teacher runtime, teacher model, provider, inference effort, model certification status, observed model list, trajectory format, message count, and a complete session message list. The dataset is released as a single traces.jsonl file, with each line containing session data for a complete trajectory. In the final release version, this file will be replaced by a cumulative next-step prefix export format, which splits each trajectory into independent training rows for each assistant round, ensuring precise prefix continuity and trajectory-disjoint training/validation splits. The main uses of the dataset include supervised fine-tuning (SFT) or knowledge distillation for agent coding models, studying next-step planning and tool usage behaviors in real repository environments, and behavioral analysis of teacher models that perform robustly under deterministic verification. Before release, the dataset is filtered by an independent review model (claude-fable-5) and undergoes privacy erasure (e.g., host paths, runtime temporary directories, and credential patterns). The dataset is released under the CC-BY-4.0 license.

创建时间:
2026-07-18
原始信息汇总

数据集概述

数据集名称:Kimi K3 Coding & Debugging Agent Traces

许可证:CC-BY-4.0

语言:英语

任务类别:文本生成

数据集规模:n<1K(当前含57条已验证轨迹)

标签:traces, code, agentic, tool-use, coding-agent, SFT, distillation, reasoning, chain-of-thought, moonshotai, kimi, k3


核心特点

  • 真实端到端智能体编程轨迹:由moonshotai/kimi-k3模型在pi编码智能体运行环境上通过openrouter服务生成,使用max推理级别。
  • 每个轨迹均已通过可验证的测试:所有轨迹通过验收测试,且受保护的测试/规范文件未经修改(基于哈希校验),非自我声称的成功。
  • 独立审查:最终发布前由独立的claude-fable-5审查器筛选每个轨迹,教师模型不自我评分。
  • 模型可验证溯源:100%的行经过模型验证,智能体事件流和宿主机侧环回代理均确认上游应答来自声明的模型。
  • 运行时归一化:原始运行时轨迹被转换为统一的OpenAI样式messages + tools模式,轨迹格式无关。
  • 统一工具集:每个任务均使用相同的行动空间(read, write, edit, bash, grep, find, ls)。
  • 隐私清理:宿主路径、运行时临时目录和凭证模式已被擦除。

任务类型分布

任务类别 轨迹数量 占比
构建游戏(build-game) 12 21%
构建CLI工具(build-cli) 4 7%
构建库(build-lib) 4 7%
构建报告(build-report) 3 5%
bash警告修复(warnfix-bash) 3 5%
全蒸馏棕地导向(full-distill-brownfield-orientation) 2 4%
构建文件系统(build-fs) 2 4%
bash语法修复(syntax-bash) 2 4%
C语言警告修复(warnfix-c) 2 4%
构建解析(build-parsing) 2 4%
其他各类(调试CLI、构建配置、重构、构建文本等,各1条) 各1 各2%

领域覆盖:全部57条轨迹(100%)属于编程领域。

多步深度:每条轨迹的助手交互轮次范围为4–17轮,中位数为8轮。


编程语言

  • bash
  • C
  • asm(汇编)

工具集

  • 全部任务提供的工具read, write, edit, bash, grep, find, ls
  • 轨迹中实际使用的工具bash, edit, read, write

数据模式

当前版本(发布前)为单文件traces.jsonl,每行一条完整轨迹(全会话消息)。

当前模式字段

列名 类型 描述
task string 轨迹所解决的种子/任务ID
lang string 主要编程语言
category string 任务种类(构建、调试、特性、重构等)
teacher_runtime string 产生轨迹的编码智能体运行环境
teacher_model string 教师模型ID
provider string 教师模型的推理服务提供商
reasoning_effort string 教师模型的推理水平
model_attested bool 智能体流和上游代理是否均确认模型身份
observed_models list[string] 验证流中实际观察到的模型ID
trace_format string 归一化前的原始运行时轨迹格式
n_messages int 轨迹中的消息数量
messages list[object] OpenAI聊天格式的完整会话(系统/用户/助手/工具)

发布后模式:切换为累积下一步前缀模式(包含source_trajectory_id, split, assistant_step, target_message_index, JSON编码的tools等字段),每行对应一条助手轮次。


数据溯源与可复现性

  • 种子来源:任务基于真实的修复fixture(提示、验证命令、受保护测试文件、参考修复),参考修复仅用于证明可解性,不被导出。
  • 教师moonshotai/kimi-k3 通过 pi 环境在 openrouter 上以 max 推理级别运行。
  • 筛选:确定性子门(验收测试 + 受保护文件哈希)已应用于每条已发布轨迹;独立审查最终发布。
  • 导出方式:整条轨迹 → 发布时导出为累积下一步前缀,确保精确的前缀连续性和轨迹分离的分割。

局限性

  • 仅包含成功轨迹:数据仅反映成功的问题解决行为,不包含全部尝试或失败恢复的分布。
  • 审查者偏见:筛选结果反映审查模型自身的偏好和盲点。
  • 发布前筛选:每行通过确定性验证,但独立审查在发布时进行,最终导出中可能有少量删除或替换。
  • 推理仅限表面内容:仅包含教师在流中暴露的推理,不重构隐藏的思维链。

预期用途

  • 用于智能体编码模型的监督微调(SFT)与知识蒸馏,基于经过验证的多步、工具使用轨迹。
  • 研究实际仓库中的下一步规划和工具使用行为。
  • 对在确定性验证下强教师模型的行为分析。
搜集汇总
数据集介绍
kimi-k3-coding-and-debugging-traces 数据集图片
构建方式
该数据集由moonshotai/kimi-k3模型驱动pi编码代理运行时,在OpenRouter平台上以最大推理能力生成的端到端智能体编码轨迹构成。每个轨迹均针对真实代码仓库中的具体修复或构建任务,通过读取、编辑和运行代码等工具操作完成。轨迹的收录需严格满足双重验证:验收测试通过且受保护测试文件未被修改,同时由独立的claude-fable-5模型进行审核。原始运行时轨迹被统一转换为OpenAI风格的messages与tools格式,确保代理无关性。
特点
该数据集的独特之处在于每条轨迹均已通过可验证的验收测试,且受保护文件哈希值未变,杜绝了自我报告式成功。所有轨迹均经过双重模型认证,既包括代理事件流,也包含宿主机环回代理对模型身份的验证。数据经过隐私清洗,路径、凭据等敏感信息被移除。任务涵盖构建游戏、命令行工具、库、报告等多种类别,涉及bash、C、汇编等编程语言,充分体现了复杂多步推理与工具协作的多样性。
使用方法
该数据集主要用于对编码代理模型进行监督微调与知识蒸馏,特别是利用经过验证的多步工具使用轨迹来提升智能体规划与执行能力。数据以JSONL格式提供,每条记录代表一个完整的会话轨迹,包含任务描述、编程语言、类别、模型认证信息及完整的对话消息序列。用户可直接加载message字段用于序列到序列的训练,或结合tools字段研究工具调用模式。更高级的用法是利用累积下一步前缀结构,进行逐步预测与轨迹分割验证。
背景与挑战
背景概述
在大语言模型驱动的智能体研究领域,获取高质量、经过验证的编程与调试训练数据是提升模型能力的关键瓶颈。为此,研究人员于近期发布了Kimi K3 Coding & Debugging Agent Traces数据集,该数据集由moonshotai/kimi-k3模型通过pi智能体运行框架,在OpenRouter平台上以最大推理能力生成,并由独立评审模型claude-fable-5进行最终筛查。数据集聚焦于真实代码仓库中的修复与构建任务,收录了63条完整的端到端智能体编程轨迹,每条轨迹均经过验收测试和受保护文件哈希校验的双重验证,确保任务的真实解决。其独特的双重模型认证机制和运行时标准化的数据格式,为智能体编程领域的监督微调与知识蒸馏研究提供了可靠的基础资源。
当前挑战
该数据集的核心挑战在于解决智能体编程训练数据中普遍存在的可靠性问题。传统数据集中模型自述的成功往往缺乏客观验证,而Kimi K3数据集通过强制验收测试和哈希校验实现了任务完成的可证伪性,解决了领域内数据可信度低的难题。在构建过程中,研究人员面临多重技术挑战:首先,需要在沙箱环境中运行完整智能体会话,同时通过主机端环回代理实现模型身份认证,防止沙箱自证身份;其次,要将不同运行时环境的原生轨迹统一转换为OpenAI风格的messages与tools架构,确保数据格式的通用性;此外,还需对隐私敏感的宿主机路径、运行时临时目录和凭据模式进行彻底脱敏,并通过构建失败机制杜绝敏感信息泄露。最后,独立评审模型的引入虽然提升了数据质量,但其自身偏好也可能带来评审偏差,需在最终发布前进行严格筛选与质量控制。
常用场景
经典使用场景
Kimi K3编码与调试智能体轨迹数据集为研究多步骤、工具驱动的编码智能体行为提供了高质量的验证性数据。其核心价值在于收录了由moonshotai/kimi-k3模型在“pi”运行时环境中生成的完整端到端智能体轨迹,每条轨迹均经过验收测试与受保护文件哈希校验的双重确定性验证,并辅以独立评审模型claude-fable-5的事后筛选。该数据集覆盖了从游戏构建、命令行工具开发到调试修复等33种任务类别,会话深度在4至17个助手轮次之间,为训练具备链式推理与工具调用能力的编码智能体提供了可靠基础。
解决学术问题
该数据集着力解决了智能体编码研究中训练数据可信度匮乏与验证机制缺失的学术困境。传统数据集常依赖自我报告的成功信号,容易引入虚假或未完成轨迹,导致模型在真实环境中的泛化能力受到质疑。Kimi K3通过双重确定性验证——即每次任务完成后必须通过自动化验收测试且保护文件哈希值不变——从根本上确保了每条轨迹的真实可解性。同时,双模型背书机制通过独立评审模型对教师模型的输出进行验证,进一步降低了单一模型偏差对数据质量的侵蚀,为知识蒸馏和监督微调等研究方向提供了具有高度可靠性的训练语料。
衍生相关工作
该数据集的诞生推动了面向编码智能体的高保真轨迹数据构建范式,催生了若干具有启发意义的相关工作。基于其验证框架“moonshiner”,研究者得以构建类似的自验证数据生成流程,在更广泛的编程语言与任务领域中产生可复现的训练数据。同时,数据集中采用的双模型背书与独立评审机制,也为后续研究提供了评估智能体轨迹真实性的基准准则。此外,该数据集成功示范了从教师模型到学生模型的知识蒸馏路径,激励了学界探索更高效的跨模型能力迁移方法,并促进了针对智能体失败模式与恢复策略的差异化分析研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务