Accretion
收藏官方服务:
资源简介:
Accretion数据集是一个精心策划的统一监督微调(SFT)数据集,通过从多种架构和推理风格的前沿模型轨迹中蒸馏得到。该数据集包含29,477个示例,整合自5个不同的前沿模型轨迹源,涵盖三大行为类别:编码(17,973例,包括编码、调试、代码审查和实现)、推理(7,836例,包括数学推理、算法设计和问题解决)以及智能体(3,679例,包括工具使用、多轮智能体交互和命令执行)。数据集采用90/10的比例进行训练集(26,532例)和测试集(2,945例)的分割,并按源进行分层以保持比例代表性。每个示例遵循标准的messages格式,包含用户、助手和工具角色,以及元数据信息。数据集100%为英文内容,包含丰富的推理步骤(使用<thinking>标签标记)和工具调用模式。该数据集专为基础语言模型在前沿级推理和工具使用行为上的监督微调而设计,特别适用于提升模型的推理能力、编码调试技能以及智能体/工具使用行为。
创建时间:
2026-07-26
原始信息汇总
Accretion — Frontier Trace Distillation Dataset
数据集概述
Accretion 是一个经过精心策划和统一处理的 SFT(监督微调)数据集,从多个前沿模型架构和推理风格的轨迹中提炼而成。数据集名称源自“吸积盘”概念——物质在引力作用下螺旋向内、加速并组织成连贯结构的区域。
数据集规模
- 总样本数:29,477 条
- 训练集:26,532 条
- 测试集:2,945 条
- 按来源分层抽样,保持各来源比例
数据分类
| 类别 | 样本数 | 描述 |
|---|---|---|
| 编程 (coding) | 17,973 | 编程、调试、代码审查、实现 |
| 推理 (reasoning) | 7,836 | 数学推理、算法设计、问题解决 |
| 智能体 (agent) | 3,679 | 工具使用、多轮智能体交互、命令执行 |
数据来源
| 来源 | 样本数 | 原始数据集链接 |
|---|---|---|
| Fable 5 (Claude Fable 5) | 11,235 | greghavens/fable-5-coding-and-debugging-traces |
| Kimi K2.6 Max distilled | 7,836 | lordx64/reasoning-distill-kimi-k2-6-max-sft |
| Kimi K3 traces | 4,906 | greghavens/kimi-k3-coding-and-debugging-traces |
| Hermes Agent traces | 3,679 | DJLougen/hermes-agent-traces-filtered |
| GLM 5.2 coding & debugging | 1,821 | greghavens/glm-5.2-coding-and-debugging-traces |
数据结构
每条样本采用标准的 messages 格式,包含用户消息、助手消息(可包含推理步骤和工具调用)以及工具输出消息,并附带元数据字段记录来源、格式、代码和工具使用情况。
关键统计信息
语言分布
- 100% 英文,未进行翻译处理。
内容长度(每条消息)
- 用户消息:中位数约 250 字符,平均值约 1,000 字符
- 助手消息:中位数约 150 字符,平均值约 1,500 字符
- 工具输出:中位数约 100 字符,平均值约 1,500 字符
每条样本的消息数量
- 中位数:2 条消息
- 平均值:18.6 条消息
- 最小值:2 条
- 最大值:246 条
推理与工具使用
- 带有推理标签(think tags)的助手消息:68,248 条
- 带有工具调用(tool_calls)的助手消息:158,708 条
- 空助手消息(无声推理):103,987 条(占 21.0%)
处理流程
- 下载与统一化:从 HuggingFace 下载各来源数据集,转换为统一的
messages格式并保留元数据。 - 保留推理与工具信息:将
reasoning_content包裹在<think>标签中,并保留tool_calls。 - 质量检查:剔除了原始 Claude Mythos 来源(25,000 条样本),因其格式单一、缺乏多样性。
- 训练/测试集划分:剩余 29,477 条按 90/10 比例分层抽样划分。
预期用途
适用于对基础语言模型进行监督微调(SFT),以提升以下能力:
- 推理能力:多步骤问题解决、算法设计
- 编程与调试:实现、错误分析、代码审查
- 智能体/工具使用:工具调用、多轮交互、命令执行
许可证
该数据集采用 MIT License 发布,各来源数据集保留其原始许可证。
引用
使用本数据集时,请引用原始来源数据集(详见 README 中的 BibTeX 引用信息)。
搜集汇总
数据集介绍

构建方式
Accretion数据集通过多源蒸馏的范式构建而成,旨在将前沿模型的高质量推理轨迹转化为统一的监督微调资源。其构建流程起始于从HuggingFace下载五个来源数据集,包括Fable 5、Kimi K2.6 Max、Kimi K3、Hermes Agent和GLM 5.2的编码、推理及智能体轨迹。随后进行格式统一化处理,将各来源的原生格式映射为标准的messages结构,并特意保留推理内容与工具调用字段。经过质量审查,剔除了格式僵化且多样性不足的Claude Mythos来源。最终对剩余的29,477条样本进行按来源分层的90/10训练测试划分,形成了兼顾多样性与代表性的数据集结构。
特点
该数据集的核心特色在于其多元异构与深度保留的结合。它汇聚了来自五种不同架构和推理风格的前沿模型轨迹,覆盖编码、数学推理与智能体交互三大行为类别,共计29,477条样本,其中编码相关样本占比超过六成。每条样本均保留完整的思维链标签和工具调用记录,这对于训练模型的多步推理与工具使用能力至关重要。值得注意的是,数据集中包含大量多轮对话轨迹,平均消息数达18.6条,最长可达246条消息,为模型提供了丰富的上下文依赖与长程交互范式。所有内容均为英文,确保了语言一致性。
使用方法
该数据集专为基座语言模型的监督微调设计,尤其适用于强化模型的推理、编码与智能体行为。使用时,可直接加载统一的messages格式数据,其结构包含用户提示、助手回复及工具输出字段,并辅以元数据标注来源与属性。建议训练时对超长轨迹进行长度过滤以防止上下文溢出,同时可针对特定任务偏好对各来源样本进行加权采样。对于需要工具调用能力的场景,可优先利用Hermes Agent来源数据。数据集已预划分为训练集与测试集,用户可直接沿用此分层划分进行模型评估与迭代训练。
背景与挑战
背景概述
Accretion数据集诞生于2025年,由多位独立研究者(如greghavens、lordx64及DJLougen)通过蒸馏前沿模型轨迹联合构建而成。该数据集得名于‘吸积盘’的物理隐喻,寓意将来自Claude、Kimi、Hermes Agent及GLM等五种架构与推理风格各异的前沿模型的高质量追踪数据,加速汇聚为结构紧凑且聚焦的训练资源。其核心研究问题在于弥合开放语言模型与前沿商业模型在推理、编码及智能体交互能力上的鸿沟,通过监督微调提升基础模型的推理深度与工具调用能力。Accretion涵盖29,477条高质量示例,被划分为编码、推理与智能体三大类别,对推动开源大模型在复杂任务上的泛化性能具有显著影响。
当前挑战
Accretion数据集所解决的领域挑战聚焦于三个层面。其一,当前开源模型在需多步推理与工具使用的复杂任务上表现不足,尤其是编码调试、算法设计与多轮智能体对话缺乏高质量训练范例。其二,数据集构建过程中面临来源异构难题,需将不同格式的原始追踪数据(如纯文本、对话流及未结构化日志)统一为包含推理痕迹与工具调用的标准化messages结构,同时保留推理内容与函数调用等关键信息。其三,质量控制环节需剔除低效样本(如原始的Claude Mythos源2.5万条固化问答数据被全部移除),并应对长对话轨迹(最长246轮)带来的训练效率与噪声挑战,确保数据多样性、真实性与前沿性的平衡。
常用场景
经典使用场景
Accretion数据集作为前沿模型轨迹蒸馏的典范之作,其设计初衷在于为语言模型的监督微调提供高质量、多样化的训练素材。该数据集整合了来自五种不同架构与推理风格的前沿模型追踪数据,共计29,477条示例,涵盖编码、推理与智能体三大核心行为类别。在经典使用场景中,研究者通常利用该数据集对基础语言模型进行指令微调,以提升模型在复杂编码任务(如调试与代码审查)、多步数学推理以及工具调用等场景下的表现能力。其统一的消息格式和丰富的元数据标签,使得模型能够更有效地学习从用户提示到结构化推理与执行响应的完整对话逻辑。
实际应用
在实际应用中,Accretion数据集的价值体现在推动语言模型在三个关键工程场景中的落地:首先,在自动化编程领域,该数据集帮助微调后的模型在代码审查、错误检测及修复任务中展现出更精准的洞察力;其次,在数学与算法推理场景中,模型得以学会类似人类专家的分步推导与验证过程;再次,在企业级智能体系统中,该数据集强化了模型执行工具调用、管理多模态输出以及进行复杂会话管理的能力。这些应用场景共同指向一个目标:使语言模型不再仅是文本生成器,而是能切实融入工作流的智能协作伙伴。
衍生相关工作
Accretion数据集的发布催生了一系列与之密切相关的经典工作。其中,基于该数据集的微调模型被广泛用作推理能力评估的基准,推动了不同蒸馏策略对模型性能影响的比较研究。此外,它所采用的轨迹结构化保存方法(如保留思考标记和工具调用字段)启发了后续工作在对话数据集构建中更注重推理完整性与交互细节的捕获。研究者还基于该数据集探索了长对话序列在微调中的有效利用策略,以及如何通过长度过滤来优化训练效率,这些衍生研究共同丰富了监督微调在复杂任务场景下的方法论体系。
以上内容由遇见数据集搜集并总结生成



