遇见数据集

Fable-GPT-5.5-Distillation-Traces

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

Agent Traces Curated 2026 是一个精选的聊天轨迹语料库,包含 1,113,586 条记录,总计约 147 亿词元,汇集了来自 19 个不同来源的数据。该数据集专为模型蒸馏流程设计,旨在作为蒸馏工具包(如 DistillKit)进行 logit 捕获的提示端语料库。其核心内容是真实的多轮对话记录,每条记录代表一个完整的会话,数据主要来源于个人实际使用的编码代理会话(如 Codex CLI、Gemini CLI、VS Code Copilot、Claude Code)以及多个开源的代理式推理和指令数据集。数据经过精心清洗和去重,过滤了 API 密钥、个人身份信息(PII),并移除了包含速率限制或失败标记且无助手响应的会话。每条数据都遵循统一的模式,包含来源标识、模型标签、唯一会话 ID、消息轮数、以 JSON 字符串存储的消息列表(包含角色和内容)以及源特定的元数据。该数据集具有显著的代理交互特征,其中工具消息占比高达 44.2%,代码块比例约为 48.4%。数据整体以 CC-BY-4.0 许可证发布,但用户需同时遵守其上游各来源数据集(包括 CC-BY-4.0 和 Apache-2.0 等)的相应许可证条款。

Agent Traces Curated 2026 is a curated chat trajectory corpus containing 1,113,586 records, totaling approximately 14.7 billion tokens, aggregated from 19 different sources. This dataset is specifically designed for model distillation workflows, intended to serve as a prompt-side corpus for logit capture in distillation toolkits like DistillKit. Its core content consists of real multi-turn dialogue records, with each record representing a complete session. The data primarily originates from personally used coding agent sessions (e.g., Codex CLI, Gemini CLI, VS Code Copilot, Claude Code) as well as multiple open-source agent-style reasoning and instruction datasets. The data has been meticulously cleaned and deduplicated, filtering out API keys, personally identifiable information (PII), and removing sessions containing rate-limiting or failure tokens without assistant responses. Each data entry follows a unified schema, including source identifier, model label, unique session ID, number of message turns, a message list stored as a JSON string (with roles and content), and source-specific metadata. The dataset exhibits significant agent interaction characteristics, with tool messages accounting for 44.2% and code blocks approximately 48.4%. The data is released under the CC-BY-4.0 license overall, but users must also comply with the respective license terms of its upstream source datasets (including CC-BY-4.0 and Apache-2.0, among others).

创建时间:
2026-07-02
原始信息汇总

数据集概述:Agent Traces Curated 2026

基本信息

  • 数据集名称:Agent Traces Curated 2026
  • 许可证:CC-BY-4.0(数据集整体编排、去重与打包);上游来源数据保留原始许可证
  • 任务类别:文本生成
  • 数据规模:1,113,586 条记录,来自 19 个来源,约 14.7 B tokens
  • 数据集格式:Parquet(snappy 压缩),约 58 GB JSONL 压缩至 19 GB
  • 托管链接:https://huggingface.co/datasets/RESMP-DEV/Fable-GPT-5.5-Distillation-Traces

用途

该数据集是为蒸馏流程构建的提示侧语料库(prompt-side corpus),每条记录为多轮对话(messages: [{role, content}, ...])。可与开放权重教师模型(如 GLM 5.2,通过 vLLM 部署)配对使用,生成新的响应并捕获 logits,用于蒸馏至约 27B 参数的学生模型。

数据来源(共 19 个)

来源 记录数 Token 数 许可证 致谢
nemotron-swe-v3 237,577 8.08 B CC-BY-4.0 NVIDIA Nemotron
open-r1-math(default + extended + train) 412,722 1.51 B Apache-2.0 Open-R1
open-thoughts 113,957 652 M Apache-2.0 OpenThoughts
codex 75,783 1.00 B CC-BY-4.0(用户收集) RESMP-DEV(Jason Lu, Elliot Arledge)
nemotron-cp-python 41,439 1.48 B CC-BY-4.0 NVIDIA Nemotron
nemotron-cp-cpp 41,201 1.46 B CC-BY-4.0 NVIDIA Nemotron
nemotron-swe-pivot 48,148 142 M CC-BY-4.0 NVIDIA Nemotron
gemini-cli 20,876 277 M 用户收集 RESMP-DEV(Jason Lu, Elliot Arledge)
openhermes-2.5 96,066 38 M Apache-2.0 Teknium(OpenHermes)
nemotron-cp-text-to-sql 12,071 35 M CC-BY-4.0 NVIDIA Nemotron
fable5-crownelius 9,223 1 M 参见来源数据集 Fable-5(Crownelius 去重)
vscode-insiders 3,018 3 M 用户收集 RESMP-DEV(Jason Lu, Elliot Arledge)
fable5-glint 651 49 K 参见来源数据集 Fable-5(Glint)
claude-code 674 215 K 用户收集 RESMP-DEV(Jason Lu, Elliot Arledge)
codex-project_a/b/c 180 122 K CC-BY-4.0(用户收集) Kevork Sulahian
合计 1,113,586 ~14.7 B

数据模式(Schema)

python { "source": "nemotron-swe-v3", # 来源数据集名称 "model": "openhands-agent", # 来源模型标签 "session_id": "uuid-string", # 唯一会话标识符 "n_turns": 42, # 消息轮数 "messages": "[{role, content}, ...]" as JSON string, "metadata": "{...}" as JSON string # 来源特定的元数据 }

加载示例: python import pandas as pd df = pd.read_parquet("data-00000-of-00124.parquet") df["messages"] = df["messages"].apply(json.loads) df["metadata"] = df["metadata"].apply(json.loads)

数据统计

  • 代码占比:48.4%(约 270 万个代码块,以 标记)
  • 工具消息占比:44.2%(强调智能体信号)
  • 中位数字符数/记录:17,557 字符(约 4.4K tokens)
  • p99 字符数/记录:332,309 字符(约 83K tokens)

已应用的过滤

  • ❌ 删除 API 密钥字符串(sk-, AIza, AKIA*, hf_, gh[pousr]_
  • ❌ 清除 PII(路径、邮箱、IP、Hugging Face Token)
  • ❌ 移除包含速率限制/失败标记且无助手响应的会话
  • ❌ 每条记录最少 100 字符,最多 500K 字符
  • ❌ 对短记录(<5K 字符)使用 MinHash LSH 去重,Jaccard 相似度阈值 0.99

许可说明

  • 数据集整体编排、去重与打包:CC-BY-4.0
  • Nemotron 数据集(swe-v3, swe-pivot, cp-python, cp-cpp, cp-text-to-sql):CC-BY-4.0(NVIDIA)
  • OpenThoughts, Open-R1-Math, OpenHermes-2.5:Apache-2.0
  • 个人会话(codex, gemini-cli, claude-code, vscode-insiders):RESMP-DEV 收集,以 CC-BY-4.0 贡献
  • codex-project_a/b/c:Kevork Sulahian 收集,以 CC-BY-4.0 贡献
  • Fable-5(Crownelius, Glint):参见各自来源数据集的许可条款

下游用户若需重新分发,必须遵守所涉及来源中最严格的许可。

致谢

  • 策展、去重与发布RESMP-DEV — Jason Lu 和 Elliot Arledge
  • 个人编码智能体会话贡献:RESMP-DEV(Jason Lu, Elliot Arledge);codex-project_a/b/c 由 Kevork Sulahian 贡献
  • 智能体推理数据:NVIDIA Nemotron(OpenHands SWE 轨迹、竞争性编程)
  • 推理与指令数据:OpenThoughts、Open-R1、Teknium(OpenHermes)
  • Fable-5 提示轨迹:Crownelius 和 Glint 来源数据集
搜集汇总
数据集介绍
Fable-GPT-5.5-Distillation-Traces 数据集图片
构建方式
Fable-GPT-5.5-Distillation-Traces 数据集精心整合了来自19个不同来源的约111万条对话记录,总计约147亿个token,旨在为知识蒸馏流程提供高质量的prompt语料。其构建过程融合了个人编码助手会话记录(如Codex CLI、Gemini CLI、VS Code Copilot、Claude Code)与开源智能体、推理及指令数据集(如NVIDIA Nemotron系列、Open-R1、OpenThoughts、OpenHermes 2.5等)。为保障数据纯净,团队实施了严格的过滤流程:剔除包含API密钥、个人身份信息的记录,去除无助手响应的失败会话,设定长度阈值,并采用MinHash局部敏感哈希算法对短文本进行近似去重,最终以Parquet格式压缩存储,兼顾了效率与规模。
特点
该数据集最显著的特征在于其作为蒸馏管线的‘prompt端语料库’定位,每条记录均以多轮对话形式结构化为消息数组,可与开放式教师模型(如GLM 5.2)配对以生成响应并捕获logits,从而将前沿模型的知识迁移至约27B参数的小型学生模型。数据集中蕴含强烈的智能体交互信号,工具消息占比高达44.2%,代码块占比48.4%,平均每条记录约4.4K token,而p99记录可达83K token,体现了深度与广度兼具的复杂对话场景。此外,多源异构数据的融合不仅丰富了prompt的多样性,也使得模型在推理、编程、指令遵循等多种能力上获得均衡的蒸馏素材。
使用方法
用户可通过Pandas库直接读取Parquet文件,加载后需使用json.loads方法将messages和metadata字段从JSON字符串解析为Python对象。典型的工作流程为:将数据集作为蒸馏框架(如DistillKit)的输入,每个多轮对话样本作为prompt,调用vLLM等推理引擎加载开放的教师模型生成新响应,并捕获输出logits;随后利用这些logits对小型学生模型进行知识蒸馏训练。需注意,不同来源子集受各自原始许可证约束,下游使用时应遵守最严格的许可条款,优先引用NVIDIA Nemotron、Open-R1、OpenThoughts及Teknium OpenHermes等上游数据集。
背景与挑战
背景概述
在大语言模型快速迭代的当下,知识蒸馏技术成为压缩前沿模型能力至轻量级学生模型的核心路径。2026年,Jason Lu与Elliot Arledge领导的RESMP-DEV团队发布了Fable-GPT-5.5-Distillation-Traces数据集,旨在为蒸馏管线提供高质量的提示语料库。该数据集整合了来自Codex CLI、Gemini CLI等前沿编码代理的对话轨迹,以及NVIDIA Nemotron、OpenThoughts、Open-R1等多源代理推理与指令数据,共计约111万条记录、147亿词元。其核心研究问题在于如何通过收集真实前沿模型交互中的多轮对话,结合开源教师模型(如GLM 5.2)生成响应并捕获对数几率,从而高效蒸馏出约27B参数的学生模型。该数据集不仅丰富了代理编码领域的数据生态,也为蒸馏范式的实用化提供了关键基准,对减少大模型部署成本、推动轻量化智能体应用具有显著影响力。
当前挑战
该数据集所面临的挑战多维交织。在领域问题层面,知识蒸馏需解决代理编码任务中复杂推理链与工具调用序列的忠实迁移问题,即如何确保学生模型在软件工程、竞赛编程等场景下复现教师模型多步推理与决策能力,同时避免过拟合于特定对话模式。在构建过程中,数据清洗面临严峻挑战:需从约19个异构来源的海量交互中剔除API密钥、路径等敏感隐私信息,并利用MinHash LSH去重算法在Jaccard相似度0.99阈值下消除短记录冗余;此外,需系统性过滤因速率限制或故障中断而无助手响应的会话,平衡长尾分布(p99达83K词元)与最小100字符的有效性下限,最终在58GB JSONL向19GB Parquet的压缩中保留高保真代理信号(44.2%工具消息占比),对数据治理的自动化与鲁棒性提出极高要求。
常用场景
经典使用场景
在大型语言模型的知识蒸馏与能力迁移研究中,Fable-GPT-5.5-Distillation-Traces 扮演了至关重要的提示语侧语料库角色。该数据集汇聚了来自前沿模型(如 GLM 5.2、Fable 5 等)交互日志及开放权重智能代理系统的 111 万余条多轮对话记录,涵盖代码生成、数学推理与工具调用等多种复杂场景。其经典使用路径是将这些高质量的对话历史作为提示,配合强大的教师模型通过 vLLM 进行响应生成与对数几率捕获,从而将前沿模型的深度推理能力高效地蒸馏至参数量约 27B 的小型学生模型中,实现能力压缩与部署效率的平衡。
解决学术问题
该数据集有效回应了如何从小规模、高成本的前沿模型中提取并迁移深层推理与代码生成能力这一核心学术难题。通过提供经过严格清洗、去重与隐私过滤的多样化交互痕迹,它为知识蒸馏领域提供了一个大规模、高质量的提示语基准。研究者可借此系统探究教师模型输出的对数几率分布如何引导学生模型逼近复杂推理轨迹,进而推动对小规模模型在专业编程、多步推理等任务上性能上限的量化评估与理论建模,对模型压缩与能力保留研究具有里程碑式的意义。
衍生相关工作
围绕该数据集已衍生出一系列代表性工作,包括基于 NVIDIA Nemotron 系列贡献的软件工程轨迹数据(如 nemotron-swe-v3 与 nemotron-cp-python)所推动的自主编程智能体研究,以及 OpenThoughts 和 Open-R1 在数学推理路径上的深入探索。此外,Fable-5 家族的 Crownelius 与 Glint 子集在提示工程与少样本泛化方面催生了多项对比分析,而 RESMP-DEV 收集的 Codex 与 Gemini CLI 真实编码会话也为理解人类与模型协作的交互模式提供了宝贵的实证素材。这些工作共同编织了一个从数据构建、蒸馏训练到性能评估的完整研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务