遇见数据集

GPT-5.5-Gemini-3.1-Pro-Grok-4-Claude-Fable-5-Mythos-5-Qwen-3.7-Max-and-more-Distillation-Dataset

收藏
Hugging Face2026-07-05 更新2026-07-06 收录
官方服务:

资源简介:

The Open Distillation Codex 是一个大规模、统一格式的开源数据集集合,整合了来自49个上游数据集的20,617,503个样本,总大小约14GB,分为106个分片。该数据集旨在为人工智能模型训练提供一个单一、标准化的数据流,特别专注于代码生成、推理蒸馏和指令微调任务。数据集内容涵盖六个主要类别:1) 智能编码轨迹(约11.4M样本):来自前沿编码智能体的真实会话记录,呈现为指令/响应对;2) 蒸馏推理轨迹(约2.7M样本):来自WithinUsAI Mythos系列的模型蒸馏数据,覆盖量子化学到超自然哲学等29个学科;3) 代码仓库库(475,467个样本):完整提取了7,090个GitHub仓库的每个文件,每个文件作为一个样本,其中instruction字段为文件路径,response字段为文件内容;4) 前沿数学与证明(27,503个样本):DeepSeek Prover-V1的形式化定理证明轨迹;5) 智能体SFT(159,972个样本):来自Nexlab Fable-5 SFT发布的精心策划的多轮智能体轨迹;6) 经典公共指令(约47K样本):包括OpenAssistant、Databricks Dolly等公共指令数据集。所有数据都遵循统一的五字段JSONL格式:source(上游数据集短标识)、source_dataset(完整HuggingFace仓库ID)、instruction(用户端内容,如提示、问题或文件路径,≤4000字符)、response(助手端内容,如回答、完成或文件内容,≤4000字符)、category(自由形式类别标签,通常为general或code)。数据集支持流式加载,便于大规模处理。该数据集适用于多种人工智能任务,包括但不限于:代码补全预训练、代码生成、跨文件依赖学习、工具使用SFT、智能体文件编辑训练、知识蒸馏、指令微调、推理能力训练和存储库级上下文训练。数据集整体采用MIT许可证,但每个上游样本保留其原始许可证,可通过source_dataset字段追溯。

The Open Distillation Codex is a large-scale, uniformly formatted open-source dataset collection that integrates 20,617,503 samples from 49 upstream datasets, with a total size of approximately 14 GB and split into 106 shards. This dataset aims to provide a single, standardized data stream for artificial intelligence model training, with a particular focus on code generation, reasoning distillation, and instruction fine-tuning tasks. The dataset content covers six main categories: 1) Intelligent Coding Trajectories (~11.4M samples): Real conversation logs from cutting-edge coding AI Agents, formatted as instruction-response pairs; 2) Distilled Reasoning Trajectories (~2.7M samples): Model distillation data from the WithinUsAI Mythos series, covering 29 disciplines ranging from quantum chemistry to supernatural philosophy; 3) Code Repositories (475,467 samples): Each file from 7,090 complete GitHub repositories is fully extracted as an individual sample, where the `instruction` field stores the file path, and the `response` field stores the file content; 4) Cutting-edge Mathematics and Proofs (27,503 samples): Formal theorem proving trajectories from DeepSeek Prover-V1; 5) AI Agent SFT (159,972 samples): Curated multi-turn AI Agent trajectories released by Nexlab Fable-5 SFT; 6) Classic Public Instruction Datasets (~47K samples): Includes public instruction datasets such as OpenAssistant, Databricks Dolly, and others. All data adheres to a unified five-field JSONL format: `source` (short identifier for the upstream dataset), `source_dataset` (full HuggingFace repository ID), `instruction` (user-side content such as prompts, questions, or file paths, with a maximum length of 4000 characters), `response` (assistant-side content such as answers, completions, or file contents, with a maximum length of 4000 characters), and `category` (free-form category label, typically `general` or `code`). The dataset supports streaming loading to facilitate large-scale processing. It is applicable to a wide range of artificial intelligence tasks, including but not limited to: code completion pre-training, code generation, cross-file dependency learning, tool use SFT, AI Agent file editing training, knowledge distillation, instruction fine-tuning, reasoning capability training, and repository-level contextual training. The entire dataset is licensed under the MIT License, while each upstream sample retains its original license, which can be traced via the `source_dataset` field.

创建时间:
2026-07-01
原始信息汇总

数据集概述

数据集名称:The Open Distillation Codex
版本:v5.0
许可证:MIT(集合许可证,各上游数据集保留其原始许可证)
语言:英语及多语言
任务类别:文本生成、其他
数据集大小:约 74 GB,包含 20,679,506 个样本
配置:默认配置,仅训练集(数据文件路径:data/train-*.jsonl


一、架构与规模

该数据集采用双层架构

  • A 层(data/ 目录):约 14 GB,包含 20,679,506 个样本,分布在 107 个 JSONL 分片(每片约 200,000 个样本),采用统一的五字段格式,可直接用于训练。
  • B 层(archives/ 目录):约 60 GB,包含 7,090 个原始 .tar.gz 归档文件,源自 notune/fable5-repos,每个归档是一个完整的 GitHub 仓库快照,保留完整的仓库结构、二进制文件和未截断的文件内容(A 层每个文件内容上限为 4 KB)。

二、数据字段与模式

每个样本包含五个字段:

字段 类型 说明
source 字符串 上游数据集的简短标识符
source_dataset 字符串 上游数据集的 Hugging Face 完整仓库 ID
instruction 字符串(≤ 4,000 字符) 用户侧内容(提示、问题或文件路径)
response 字符串(≤ 4,000 字符) 助手侧内容(完成、回答或文件内容)
category 字符串(≤ 200 字符) 自由分类标签(如 generalcode

三、数据内容分布(A 层)

该数据集整合了 51 个开源数据集,主要分为以下几类:

1. 智能体编码轨迹(约 1140 万样本)

  • vibe_instruct_v2CodeDevX/Vibe-Coding-Instruct-V2):8,152,510 个样本
  • fable5_2mCrownelius/Complete-FABLE.5-traces-2M):2,406,487 个样本
  • vibe_instruct_v1CodeDevX/Vibe-Coding-Instruct):1,100,000 个样本
  • vibe_codingattentionAllYouNeed/Vibe-Coding-Claude-Fable-5):1,100,000 个样本

2. 蒸馏推理轨迹(约 270 万样本)

  • Royal Ghost & Citation 系列:约 2,683,513 个样本
  • 29 个 WithinUsAI 25K 主题(涵盖数学、物理、化学、生物、医学、计算机科学、机器人、纳米技术、材料、地球气候等):约 725,000 个样本
  • 前沿模型蒸馏(Claude、Gemini、Grok、GPT-5.5):约 178,000 个样本
  • Coder 系列(Genesis、GOD、Omega、Legend、HyperScholar):约 150,000 个样本

3. 代码仓库库(475,467 个样本)

来自 notune/fable5-repos 的所有 7,090 个仓库,每个文件对应一个样本(instruction 为 <仓库名>/<路径>,response 为文件内容,上限 4 KB)。

4. 经典指令数据集(约 67,000 个样本)

  • alpacatatsu-lab/alpaca):52,002 个样本
  • oasstOpenAssistant/oasst1):32,141 个样本
  • dollydatabricks/databricks-dolly-15k):15,011 个样本

5. 数学与证明 + 智能体 SFT

  • deepseek_prover_v1deepseek-ai/DeepSeek-Prover-V1):27,503 个样本
  • fable5_agentic_sftNexlab/fable5-agentic-coding-sft):159,972 个样本

四、部分上游数据集清单

以下为部分主要来源(共 51 个):

序号 来源标识符 上游数据集 样本数
1 vibe_instruct_v2 CodeDevX/Vibe-Coding-Instruct-V2 8,152,510
2 fable5_2m Crownelius/Complete-FABLE.5-traces-2M 2,406,487
3 vibe_instruct_v1 CodeDevX/Vibe-Coding-Instruct 1,100,000
4 vibe_coding attentionAllYouNeed/Vibe-Coding-Claude-Fable-5 1,100,000
5 royal_ghost_1m WithinUsAI/Royal_Ghost_Coder_1M 1,000,000
6 citation_ground WithinUsAI/CitationGround-1M 980,064
7 royal_ghost_501k WithinUsAI/Royal_Ghost_Coder_501k 703,449
8 fable5_repos_full notune/fable5-repos 475,467
9 fable5_agentic_sft Nexlab/fable5-agentic-coding-sft 159,972
10 alpaca tatsu-lab/alpaca 52,002
11 alpca_gpt55 GabrielFreeze-2/alpca-mlt-gpt-5.5_chatml 49,099
12 oasst OpenAssistant/oasst1 32,141
13 deepseek_prover_v1 deepseek-ai/DeepSeek-Prover-V1 27,503
14 dolly databricks/databricks-dolly-15k 15,011
15 gpt55_distilled WithinUsAI/GPT_5.5_Distilled 18,197
16 kimi_coding trjxter/Kimi-K2.7-CodingTraces-9000x 9,014
17–46 30 × WithinUsAI 25K 主题 多个 约 750,000
47–51 Genesis 及 Coder 变体 WithinUsAI/Genesis_AI_Code_* 约 75,000

五、未纳入的数据集

部分上游数据集因源数据本身格式问题未能纳入:

  • WithinUsAI/P_P_GHOST_1Million:仓库无支持的数据文件
  • WithinUsAI/HyperScholar-OmniPython-50K:仓库无支持的数据文件
  • WithinUsAI/GPT-2-to-GPT-5-5k:缺少训练文件
  • Glint-Research/Fable-5-traces:模式转换错误(嵌套结构不匹配)
  • WithinUsAI/Genesis_v1_1_Update_Instruct_Thinking_Reasoning:模式转换错误(仅部分恢复)
  • WithinUsAI/Sports_25kHuman_25kAll_Known_Species_Index_25kpyarrow.list_() 调用错误
  • WithinUsAI/GOD_Coder_100kpython_GOD_coder_100kElite_GOD_Coder_100kOmega_Genesis_Coder_100k:上游数据 JSON 格式错误(仅部分恢复)

六、版本历史

版本 日期 说明
v1.0 2026-07-01 初始发布,117K 样本
v2.0 2026-07-02 145 万样本,57 个来源
v3.0 2026-07-03 1060 万样本,44 个来源完整摄入
v3.1 2026-07-04 新增 5 个用户请求的数据集,2010 万样本
v4.0 2026-07-05 fable5-repos 完整提取(7,090 个归档)
v5.0 2026-07-05 新增 B 层(7,090 个原始 tar.gz 归档,约 60 GB),恢复部分数据集,双层架构

七、引用信息

bibtex @misc{open_distillation_codex_2026, title = {The Open Distillation Codex: 20.7M unified samples + 7,090 raw code repositories from 51 open-source datasets}, author = {Manusagents}, year = {2026}, url = {https://huggingface.co/datasets/Manusagents/GPT-5.5-Gemini-3.1-Pro-Grok-4-Claude-Fable-5-Mythos-5-Qwen-3.7-Max-and-more-Distillation-Dataset}, note = {v5.0 — 107 JSONL shards + 7090 archive files, 20,679,506 samples, ~74 GB} }

搜集汇总
数据集介绍
GPT-5.5-Gemini-3.1-Pro-Grok-4-Claude-Fable-5-Mythos-5-Qwen-3.7-Max-and-more-Distillation-Dataset 数据集图片
构建方式
该数据集通过三层流水线构建而成:Pipeline α 利用标准流式加载(load_dataset + streaming=True)处理44个格式良好的上游数据集,从中提取指令与响应对,每缓冲20万样本便上传一个分片;Pipeline β 对7,090个原始代码仓库进行并行批量提取,将每个文件转换为一条样本(指令为仓库路径,响应为文件内容),无任何跳过;Pipeline γ 则针对格式异常的数据集进行逐行原始JSONL恢复,滤除损坏行并保留可解析内容。此外,Layer B 层以5GB为批次上传了全部原始tar.gz归档文件,共13次提交完成60GB数据的上传。最终,51个开放数据集被整合为统一的5字段模式,形成了包含约2070万条样本的双层数据集。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset函数以流式方式加载整个数据集。针对不同训练目标,可采用多种使用策略:最简单的方案是直接使用Layer A进行监督微调,将指令与响应格式化为对话模板后送入模型训练;进阶使用者可依据source字段对数据进行过滤,实施课程学习策略,例如先筛选数学与科学样本,再逐步加入编码轨迹和仓库数据;需要完整文件内容或二进制文件的研究者,可结合Layer B的原始归档文件进行自定义提取与处理。此外,数据集支持仓库级上下文训练、文件路径到内容的预测以及智能体工具调用的SFT场景。
背景与挑战
背景概述
在大规模语言模型快速迭代的背景下,知识蒸馏与指令微调逐渐成为提升模型性能与泛化能力的关键技术路径。GPT-5.5-Gemini-3.1-Pro-Grok-4-Claude-Fable-5-Mythos-5-Qwen-3.7-Max-and-more-Distillation-Dataset(又名Open Distillation Codex)由Manusagents团队于2026年构建并发布,版本迭代至v5.0。该数据集汇聚了51个开源数据源,包括来自GPT-5.5、Claude、Gemini、Grok等前沿模型的推理轨迹、代理式编程记录、完整代码仓库快照及经典指令集,形成超过2000万条样本与7090个原始代码仓库的双层架构(可训练的JSONL层与原始tar.gz层),总存储规模约74GB。数据集以MIT协议开放,旨在为研究社区提供一个高质量、大规模、多样化的蒸馏与微调基准资源,推动开源语言模型在编程、推理、数学与科学问答等任务上的能力跃升。
当前挑战
领域问题层面,该数据集直面当前开源模型在复杂推理、长代码生成与跨学科知识整合方面的性能瓶颈,通过整合多源蒸馏信号与原始代码仓库,为模型注入从执行轨迹到上下文感知的编码能力,弥补了传统指令数据集在深度推理与多样性上的不足。构建过程中,团队面临三大挑战:一是格式不一致性,部分上游数据集存在嵌套结构错配、缺失关键文件或JSON格式错误,需通过原始JSONL逐行恢复策略提取有效样本;二是规模管理的复杂性,面对超10亿字符的代码仓库归档,采用5GB批量并行下载与提交的分段策略,在保持数据完整性的同时优化了存储与传输效率;三是数据融合的统一性,将来自44个格式良好的数据源通过标准流式加载与字段映射整合为一致的instruction-response- category模式,确保跨数据源的可训练性与可复现性。
常用场景
经典使用场景
在大型语言模型的发展浪潮中,知识蒸馏与指令微调已成为提升小模型能力的关键范式。该数据集汇聚了来自51个开源数据源的逾两千万条统一化样本,并辅以七千余个原始代码仓库的快照,构成了一套双层架构的训练资源。其最经典的用途在于监督式微调(SFT),研究者可便捷地将指令-响应对加载至Transformer框架中,使基座模型习得前沿模型(如GPT-5.5、Claude、Gemini等)的推理轨迹与编码风格。此外,通过按数据源进行筛选,用户可设计课程学习策略,例如优先以数学与科学样本锤炼逻辑能力,再以编码轨迹提升工程素养,从而精细调控模型的能力演进路径。
解决学术问题
该数据集直面大模型研究中的核心瓶颈:高质量训练数据的稀缺与异构数据源的整合难题。传统上,研究者需从多个不兼容的仓库中分别采集并清洗数据,耗时且易引入偏差。此数据集成为了弥合这一鸿沟的桥梁,首次将海量蒸馏信号、代码仓库快照与经典指令数据(如Alpaca、OASST)统一于简洁的五字段模式之下,使得跨来源的对比实验与能力溯源分析成为可能。它支撑了对知识蒸馏有效性的系统性评估,例如探究来自不同前沿模型的蒸馏信号对基座模型在推理、编码与通用问答等维度的影响差异,推动了训练数据工程从经验直觉向科学量化迈进。
实际应用
在产业界,该数据集为构建高性能对话代理与代码助手提供了开箱即用的训练基座。产品团队可利用其包含的逾千万条智能体编码轨迹,微调模型以支持复杂的多步骤任务编排,如自动化代码审查、漏洞修复建议生成及交互式编程教学。其第二层中保留的完整代码仓库快照,更是为研发面向软件工程的全链路智能体铺平了道路——模型可学习读取文件结构、理解项目上下文并执行跨文件编辑。在学术机构中,研究者借此复现前沿模型的推理过程,探索将庞大系统的能力压缩至轻量级学生模型的方法,从而降低部署成本,推动开源社区与资源受限场景下的普惠智能落地。
数据集最近研究
最新研究方向
当前,大规模语言模型的知识蒸馏与指令微调正从单源、单层范式迈向多源异构数据融合与分层架构设计。该数据集整合了来自51个开源数据集的超过2000万条蒸馏信号与7090个原始代码仓库,构建了包含已处理JSONL层与原始归档层的双层体系,为研究者提供了从即用型训练样本到完整代码仓库结构的灵活资源。其前沿方向聚焦于Agentic编程轨迹、推理链蒸馏与代码仓库级预训练的交叉融合,尤其关注多模型(GPT-5.5、Gemini-3.1、Claude等)协作蒸馏信号的统一规整与课程学习策略。这一数据驱动的方法论突破,不仅降低了海量高质量训练数据的获取门槛,更通过开源、可复现的架构推动了开放智能研究范式的进化,对提升模型的代码生成、复杂推理与工具使用能力具有里程碑式的实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务