遇见数据集

fable-5-coding-and-debugging-traces

收藏
Hugging Face2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

Fable 5编码与调试轨迹数据集包含来自Claude Fable 5(claude-fable-5)作为自主编码代理在真实软件任务上工作的行为保留工程轨迹。这些轨迹记录了代理读取代码、编辑文件、运行编译器和测试套件、安装固定依赖项并迭代直到工作完成的完整过程。数据集特点包括:所有数据均为真实的长期开发会话记录,无任何合成或模板化对话;每行数据对应轨迹中的一个助理回合,包含从开始到该回合的累积上下文;数据经过运行时标准化处理,移除了速率限制、加密思考签名等噪声,但保留了大型源代码读取和编译器诊断等因果任务上下文;经过行为审计,移除了未经授权的提交、被拒绝的测试写入等操作序列;每个保留的会话都通过了独立验证,确保最终状态通过隐藏的验证步骤;所有会话均在真实环境和工具链中运行。数据集包含3,327个累积下一步行(3,044个训练行,283个验证行),源自611个在不相交的训练和验证任务上的轨迹。任务类型包括构建(约46%)、调试(约22%)、项目(约16%)、功能(约13%)和重构/性能(约3%),涵盖数据结构、解析器、并发原语、HTTP/API服务、CLI工具、系统编程等多个领域。当前版本支持Python、TypeScript、Go、Rust、Java、Ruby、JavaScript、C#、Bash、Zsh、C、C++等语言。数据模式包括任务ID、语言、类别、分割、助理步骤编号、消息列表和工具模式等字段。数据集主要用于工具使用编码代理的监督微调,以及分析长视野代理行为,如多步规划、工具选择、构建-测试-修复循环和验证驱动的完成。数据由Claude Fable 5在无头Claude Code会话中生成,经过确定性验证和明确的Codex接受审查。数据集采用CC BY 4.0许可证,允许任何用途,包括训练、研究、商业产品、修改和再分发,但需要注明出处。

The Fable 5 Coding and Debugging Traces Dataset contains behavior-preserved engineering traces from Claude Fable 5 (claude-fable-5) as an autonomous coding agent working on real software tasks. These traces record the complete process of the agent reading code, editing files, running compilers and test suites, installing fixed dependencies, and iterating until the work is completed. Dataset features include: all data are real long-term development session records, with no synthetic or templated dialogues; each row corresponds to an assistant turn in a trace, containing cumulative context from the start to that turn; data is runtime-standardized, removing noise such as rate limiting and encrypted thought signatures, but preserving causal task context like large source code reads and compiler diagnostics; after behavioral auditing, sequences of unauthorized commits, rejected test writes, etc., are removed; each retained session passes independent verification, ensuring the final state passes hidden validation steps; all sessions run in real environments and toolchains. The dataset contains 3,327 cumulative next-step rows (3,044 training rows, 283 validation rows), derived from 611 traces on disjoint training and validation tasks. Task types include build (~46%), debug (~22%), project (~16%), feature (~13%), and refactor/performance (~3%), covering areas such as data structures, parsers, concurrency primitives, HTTP/API services, CLI tools, and systems programming. The current version supports languages including Python, TypeScript, Go, Rust, Java, Ruby, JavaScript, C#, Bash, Zsh, C, and C++. Data schema includes fields like task ID, language, category, split, assistant step number, message list, and tool mode. The dataset is primarily used for supervised fine-tuning of tool-using coding agents and analyzing long-horizon agent behaviors, such as multi-step planning, tool selection, build-test-fix loops, and verification-driven completion. Data is generated by Claude Fable 5 in headless Claude Code sessions, with deterministic verification and explicit Codex acceptance review. The dataset is licensed under CC BY 4.0, permitting any use including training, research, commercial products, modification, and redistribution, with attribution required.

创建时间:
2026-07-14
原始信息汇总

Fable 5 Coding & Debugging Traces 数据集概述

该数据集包含来自 Claude Fable 5 的自主编码代理在真实软件任务上的行为保留工程轨迹,涵盖代码阅读、文件编辑、编译器和测试套件运行、依赖安装等完整开发流程。

核心特性

  • 完全真实,零合成数据:每一行都是真实、长周期开发会话的累积前缀,无模板对话、无合成问答、无回填内容。
  • 每行一个下一步:轨迹中每个助手回合产生一行数据,上下文累积而非窗口化或摘要化。
  • 运行时规范化:移除了速率限制、加密思考签名、会话限制横幅、终端控制序列等运行时噪音,保留大型源代码读取和编译器/测试诊断等因果任务上下文。
  • 行为审计:经过二次范围和需求审计,移除了未经授权的提交、被拒绝的测试写入等微序列,保留28个原始会话,排除4个不符合要求的轨迹并用新轨迹替换。
  • 独立验证:每个保留的会话最终状态通过隐藏的验证步骤(测试套件/构建检查),且测试文件从未被修改。100%的行通过验证。
  • 真实环境与工具链:会话在 gcc/g++、go test -race、pytest 等真实工具链上运行,包括真实的依赖安装。

任务构成

类型 占比 描述
构建 ~46% 从规范实现模块/库/CLI,从空文件到通过测试套件
调试 ~22% 针对真实植入缺陷的症状优先工单(并发、失效、编码、环境漂移)
项目 ~16% 多文件脚手架和仓库级工作
功能 ~13% 扩展现有代码库,现有测试必须保持通过
重构/性能 ~3% 保持行为不变的重构和可测量的速度提升

涉及领域包括数据结构、解析器和编解码器、状态机、并发原语、HTTP/API客户端和服务、CLI工具、依赖/环境管理、前端构建、工作流引擎、C和C++系统编程。

语言覆盖

Python、TypeScript、Go、Rust、Java、Ruby、JavaScript、C#、Bash、Zsh、C、C++(更多语言将在后续版本中添加)。

数据模式

数据文件为 traces.jsonl,共 6,224 行累积下一步行(5,702 训练 / 522 验证),来自 666 个轨迹

列名 类型 内容
task string 稳定的任务ID
lang string 任务主要编程语言
category string 任务分类标签(如 debug-concurrency
split string 内部分区:trainval
assistant_step int 源轨迹中目标助手回合的序号
assistant_steps int 源轨迹中助手回合总数
target_message_index int messages 中最终助手目标的索引
n_messages int 该目标之前的总消息数
messages list of objects 累积上下文,以该助手目标结束
tools string (JSON) 此会话中调用的工具模式

预期用途

  • 工具使用型编码代理的监督微调
  • 长周期代理行为分析:多步规划、工具选择、构建-测试-修复循环、验证驱动完成

许可证

CC BY 4.0 — 允许任何用途:训练、研究、商业产品、修改、再分发,以及纳入其他数据集或语料库。唯一要求是使用时提供署名。

建议引用方式:

Fable 5 Coding & Debugging Traces — https://huggingface.co/datasets/greghavens/fable-5-coding-and-debugging-traces

搜集汇总
数据集介绍
fable-5-coding-and-debugging-traces 数据集图片
构建方式
该数据集源自Claude Fable 5在真实软件开发任务中自主作为编码代理所产生的行为保留轨迹。每条记录对应一次完整开发会话的累积前缀,覆盖从代码阅读、文件编辑、编译器与测试套件运行到依赖安装的完整迭代过程。构建时通过双层过滤机制确保质量:首先由确定性验证步骤确保每次会话最终状态通过隐藏测试,再经由独立的Codex审核对行为进行二次审计,剔除存在违规提交或越界操作的片段,并对保留会话进行行为归一化处理,移除运行时噪声如速率限制、终端控制序列等冗余信息。所有数据均为真实轨迹,无合成填充或模板化对话。
特点
本数据集最显著的特质在于其完全真实性,全部6,251条累积下一步行源自671条独立轨迹,零合成数据。每条记录仅以最终助手消息为训练目标,上下文呈累加式而非窗口式截断,避免了早期步骤的过拟合风险。轨迹覆盖构建、调试、项目、功能开发及重构优化五大任务类别,跨度包括并发、解析器、状态机、HTTP客户端等多种领域,语言涉及Python、TypeScript、Go等12种主流编程语言。数据经过运行时归一化与行为审计,保留因果上下文的同时剔除无关噪声,且全部轨迹均通过独立于代理视角的验证测试。
使用方法
该数据集专为工具调用型编码代理的监督微调以及长周期代理行为分析而设计。使用时,每条记录中的最终助手消息作为监督信号,其余上下文作为输入,避免对重复出现的早期步骤进行多重加权。数据以单一JSONL文件存储,包含任务标识、语言、类别、分割类型、助手步骤索引、消息列表及工具Schema等字段。用户可通过附带Python脚本复现规范文件。许可协议为CC BY 4.0,允许自由用于训练、研究、商业产品及再分发,仅需在使用时注明数据集出处。
背景与挑战
背景概述
Fable 5 Coding & Debugging Traces数据集由研究人员基于Claude Fable 5模型构建,于近期发布,旨在为自主编码代理提供真实、长程的开发轨迹数据。该数据集聚焦于智能体在真实软件任务中的端到端行为,涵盖代码阅读、文件编辑、编译测试及依赖管理等多个环节,所有数据均来自实际工程会话,摒弃了模板化或合成样本。其核心研究问题在于如何通过监督微调,使编码代理掌握多步规划、工具选择及验证驱动的完成能力。作为早期的公开资源,该数据集填补了真实代理轨迹领域的空白,为相关研究提供了高质量的训练与验证基准,对提升大型语言模型在复杂编程任务中的自主性和可靠性具有显著推动作用。
当前挑战
该数据集所解决的领域挑战在于,现有编码代理训练数据多依赖合成对话或简化任务,难以真实反映开发中面临的复杂环境,例如并发错误、缓存失效、环境漂移及工具调用失败等。构建过程中,研究人员需应对诸多技术难题:包括从原始会话中规范化运行时噪声(如速率限制、终端控制序列),同时保留关键因果上下文;执行行为审计以移除违规操作(如未授权提交)并确保数据纯净;通过独立验证环节确保每个会话在隐藏测试中通过,且测试文件未被修改。此外,还需处理轨迹的累积表示,避免训练时过度加权早期步骤,这些挑战共同塑造了该数据集的独特价值与质量保障。
常用场景
经典使用场景
Fable 5 Coding & Debugging Traces 数据集专注于真实软件工程场景下的自主编码智能体行为,经典使用场景涵盖从零实现模块或命令行工具(build)、定位并修复注入的真实缺陷(debug)、构建多文件项目脚手架(project)、扩展已有代码库并确保原有测试通过(feature)以及行为保持性重构与性能优化(refactor/perf)。这些任务覆盖数据结构、解析器、状态机、并发原语、HTTP/API客户端与服务、CLI工具、前端构建及系统级C/C++编程等多个领域,为监督微调工具型编码智能体提供了高质量的轨迹数据。
解决学术问题
该数据集解决了编码智能体研究中长期存在的核心问题:缺乏真实、非合成、因果完整的智能体工程轨迹。现有数据集常依赖模板化对话或人工填充的‘助手说’内容,无法反映智能体的因果探索、工具参数选择与自我修正过程。Fable 5 通过保留完整的构建-测试-修复循环轨迹,并经过独立的隐藏验证与行为审计,使研究者能够深入分析多步规划、工具选择、验证驱动的任务完成等关键学术议题,为理解长期自主智能体行为提供了可靠的实验基座。
衍生相关工作
该数据集的出现推动了若干方向的研究工作:其一,基于累积前缀轨迹的监督学习范式启发了一系列针对长期决策序列的智能体训练方法;其二,行为审计与独立验证流程促进了可验证智能体工作流的构建,成为后续‘验证驱动开发’框架的重要参照;其三,数据集中的多语言任务覆盖激发了跨语言编码智能体的泛化研究。此外,该数据集的发布也催生了诸如pi-agent corpus等同类轨迹语料库的标准化工作,共同塑造了工具型编码智能体领域的数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务