Mega-Brain-Distill
收藏资源简介:
Mega-Brain-Distill 是一个经过精心筛选和去重的大规模语言模型(LLM)蒸馏与推理轨迹数据集。它通过自动化流程,合并了来自 Hugging Face Hub 上 584 个社区上传的 LLM 蒸馏/推理轨迹数据集中质量最高的样本。这些源数据集涵盖了来自 Fable-5、Opus、GLM、Kimi、DeepSeek、GPT、MiniMax、Qwen 等多种模型生成的推理轨迹。数据集的构建旨在提取高质量内容,其核心筛选方法完全基于确定性的启发式规则,不依赖任何模型进行质量评判。具体步骤包括:从各种原始对话或文本模式中提取内容;应用长度过滤(丢弃过短的样本);应用词汇多样性过滤(丢弃重复或退化的生成内容);进行严格的跨数据集和数据集内去重(基于文本的 SHA-256 哈希);最后,根据质量得分(`token_count` * `word_diversity`)为每个源数据集保留得分最高的前 10% 的样本。经过此流程,从原始约 1099 万行数据中,最终保留了 1,004,211 行高质量样本,总计约 33.2 亿 tokens。数据集包含以下字段:`source_dataset`(源数据集标识)、`messages`(JSON 格式的对话轮次,适用于源为对话结构的数据)、`text`(纯文本,适用于源为非对话结构的数据)、`token_count`(启发式 token 计数)、`word_diversity`(词汇类型-标记比)和 `quality_score`(质量得分)。该数据集适用于文本生成任务,特别是与监督微调(SFT)、知识蒸馏、模型对齐和推理能力增强相关的研究与应用。
数据集概述:Mega-Brain-Distill
Mega-Brain-Distill 是一个经过精心筛选和去重的高质量推理追踪(reasoning trace)文本生成数据集,由社区上传至 Hugging Face Hub 的 584 个 LLM 蒸馏/推理追踪数据集合并而成。
核心统计
- 来源数据集: 处理完成 584 个,失败 0 个。
- 原始数据行数: 14,619,350 行。
- 最终保留数据: 1,114,908 行,约 34.8 亿 Token。
- 去重与过滤:
- 精确/跨数据集重复丢弃: 3,116,201 行
- 低词汇多样性丢弃: 578,425 行
- 过短丢弃: 443,385 行
- 无法识别 Schema 丢弃: 3,113,971 行
筛选方法(纯启发式规则,不使用 LLM 评判质量)
- Schema 提取: 自动识别并转换来源数据集的对话/文本格式(如 ShareGPT、OpenAI
messages、instruction/output、prompt/response、text等)。 - 长度过滤: 丢弃 Token 数低于
MIN_TOKENS的行。 - 词汇多样性过滤: 丢弃类型-Token 比率低于
TTR_MIN的行(针对重复/退化生成)。 - 去重: 对规范化文本计算 SHA-256 哈希,通过跨所有来源数据集的持久化布隆过滤器进行精确去重(包括数据集内部和跨数据集的重复)。
- 质量评分与 Top-K 保留: 使用
token_count × word_diversity作为质量分数,在每个来源数据集的幸存行中仅保留分数最高的 前 10%。
数据 Schema
| 字段 | 类型 | 说明 |
|---|---|---|
source_dataset |
string | 来源数据集名称 (org/name) |
messages |
string (JSON) | 对话轮次 [{role, content}](来源为对话格式时) |
text |
string | 纯文本(来源无聊天结构时) |
token_count |
int | 启发式 Token 计数 |
word_diversity |
float | 类型-Token 比率 |
quality_score |
float | token_count × word_diversity |
主要数据来源(按保留行数排序,Top 10)
- [Verdugie/opus-4.6-training-catalog]: 保留 40,000 行,9.76M Tokens
- [someoneatemylastsliceofpizza/claude-sonnet-4.6-merged]: 保留 40,000 行,39.64M Tokens
- [yycfq/gpt5.5gt]: 保留 40,000 行,59.05M Tokens
- [attentionAllYouNeed/Vibe-Coding-Claude-Fable-5]: 保留 40,000 行,3.81M Tokens
- [thetrillioniar/claude-sonnet-4.6-opus-4.8-mythos-5-fable-5-openai-finetuning-dataset]: 保留 35,565 行,64.88M Tokens
- [inference-optimization/DeepSeek-V4-Flash-responses]: 保留 33,724 行,65.43M Tokens
- [fuzzer-app/vhdl-arria10-fable5-generated]: 保留 30,995 行,29.25M Tokens
- [Rexhaif/anon-reasoning-gpt5.4]: 保留 27,950 行,37.02M Tokens
- [mgoin/GLM-5.2-FP8-magpie-ultrachat]: 保留 26,944 行,47.13M Tokens
- [empero-ai/MiniMax-M3-70k-CodeMath]: 保留 25,878 行,8.90M Tokens
许可证
- other(自定义许可证)
任务类别
- text-generation(文本生成)
标签
- distillation, reasoning, sft, curated, deduplicated
加载方式
python from datasets import load_dataset ds = load_dataset("ShinMK3/Mega-Brain-Distill", split="train")




