遇见数据集

Mega-Brain-Distill

收藏
Hugging Face2026-07-12 更新2026-07-13 收录
官方服务:

资源简介:

Mega-Brain-Distill 是一个经过精心筛选和去重的大规模语言模型(LLM)蒸馏与推理轨迹数据集。它通过自动化流程,合并了来自 Hugging Face Hub 上 584 个社区上传的 LLM 蒸馏/推理轨迹数据集中质量最高的样本。这些源数据集涵盖了来自 Fable-5、Opus、GLM、Kimi、DeepSeek、GPT、MiniMax、Qwen 等多种模型生成的推理轨迹。数据集的构建旨在提取高质量内容,其核心筛选方法完全基于确定性的启发式规则,不依赖任何模型进行质量评判。具体步骤包括:从各种原始对话或文本模式中提取内容;应用长度过滤(丢弃过短的样本);应用词汇多样性过滤(丢弃重复或退化的生成内容);进行严格的跨数据集和数据集内去重(基于文本的 SHA-256 哈希);最后,根据质量得分(`token_count` * `word_diversity`)为每个源数据集保留得分最高的前 10% 的样本。经过此流程,从原始约 1099 万行数据中,最终保留了 1,004,211 行高质量样本,总计约 33.2 亿 tokens。数据集包含以下字段:`source_dataset`(源数据集标识)、`messages`(JSON 格式的对话轮次,适用于源为对话结构的数据)、`text`(纯文本,适用于源为非对话结构的数据)、`token_count`(启发式 token 计数)、`word_diversity`(词汇类型-标记比)和 `quality_score`(质量得分)。该数据集适用于文本生成任务,特别是与监督微调(SFT)、知识蒸馏、模型对齐和推理能力增强相关的研究与应用。

创建时间:
2026-07-09
原始信息汇总

数据集概述:Mega-Brain-Distill

Mega-Brain-Distill 是一个经过精心筛选和去重的高质量推理追踪(reasoning trace)文本生成数据集,由社区上传至 Hugging Face Hub 的 584 个 LLM 蒸馏/推理追踪数据集合并而成。

核心统计

  • 来源数据集: 处理完成 584 个,失败 0 个。
  • 原始数据行数: 14,619,350 行。
  • 最终保留数据: 1,114,908 行,约 34.8 亿 Token
  • 去重与过滤:
    • 精确/跨数据集重复丢弃: 3,116,201 行
    • 低词汇多样性丢弃: 578,425 行
    • 过短丢弃: 443,385 行
    • 无法识别 Schema 丢弃: 3,113,971 行

筛选方法(纯启发式规则,不使用 LLM 评判质量)

  1. Schema 提取: 自动识别并转换来源数据集的对话/文本格式(如 ShareGPT、OpenAI messagesinstruction/outputprompt/responsetext 等)。
  2. 长度过滤: 丢弃 Token 数低于 MIN_TOKENS 的行。
  3. 词汇多样性过滤: 丢弃类型-Token 比率低于 TTR_MIN 的行(针对重复/退化生成)。
  4. 去重: 对规范化文本计算 SHA-256 哈希,通过跨所有来源数据集的持久化布隆过滤器进行精确去重(包括数据集内部和跨数据集的重复)。
  5. 质量评分与 Top-K 保留: 使用 token_count × word_diversity 作为质量分数,在每个来源数据集的幸存行中仅保留分数最高的 前 10%

数据 Schema

字段 类型 说明
source_dataset string 来源数据集名称 (org/name)
messages string (JSON) 对话轮次 [{role, content}](来源为对话格式时)
text string 纯文本(来源无聊天结构时)
token_count int 启发式 Token 计数
word_diversity float 类型-Token 比率
quality_score float token_count × word_diversity

主要数据来源(按保留行数排序,Top 10)

  • [Verdugie/opus-4.6-training-catalog]: 保留 40,000 行,9.76M Tokens
  • [someoneatemylastsliceofpizza/claude-sonnet-4.6-merged]: 保留 40,000 行,39.64M Tokens
  • [yycfq/gpt5.5gt]: 保留 40,000 行,59.05M Tokens
  • [attentionAllYouNeed/Vibe-Coding-Claude-Fable-5]: 保留 40,000 行,3.81M Tokens
  • [thetrillioniar/claude-sonnet-4.6-opus-4.8-mythos-5-fable-5-openai-finetuning-dataset]: 保留 35,565 行,64.88M Tokens
  • [inference-optimization/DeepSeek-V4-Flash-responses]: 保留 33,724 行,65.43M Tokens
  • [fuzzer-app/vhdl-arria10-fable5-generated]: 保留 30,995 行,29.25M Tokens
  • [Rexhaif/anon-reasoning-gpt5.4]: 保留 27,950 行,37.02M Tokens
  • [mgoin/GLM-5.2-FP8-magpie-ultrachat]: 保留 26,944 行,47.13M Tokens
  • [empero-ai/MiniMax-M3-70k-CodeMath]: 保留 25,878 行,8.90M Tokens

许可证

  • other(自定义许可证)

任务类别

  • text-generation(文本生成)

标签

  • distillation, reasoning, sft, curated, deduplicated

加载方式

python from datasets import load_dataset ds = load_dataset("ShinMK3/Mega-Brain-Distill", split="train")

搜集汇总
数据集介绍
Mega-Brain-Distill 数据集图片
构建方式
在大型语言模型蒸馏与推理轨迹数据集日益涌现的浪潮中,Mega-Brain-Distill 数据集应运而生,旨在从社区贡献的海量资源中提炼出最高质量的训练样本。其构建方式别具匠心,完全基于确定性的启发式规则,摒弃了任何模型或大语言模型的质量评判。具体而言,首先从多达584个社区上传的蒸馏/推理轨迹数据集中统一提取对话或文本内容,无论原始格式是 ShareGPT、OpenAI messages 还是其他结构;随后依次经过长度门控(剔除过短样本)、词元多样性门控(利用型例比过滤重复或退化的生成内容),以及跨数据集的去重操作(借助持久化布隆过滤器进行 SHA-256 哈希比对);最终,每个来源数据集内仅保留得分(词元数与多样性的乘积)排名前10%的样本,并通过尺寸受限的最小堆确保资源消耗可控。
特点
该数据集的核心特点在于其严苛的筛选标准与卓越的数据纯净度。从原始处理的超过1460万行数据中,最终仅精选出约111.5万行高质量样本,压缩比高达13:1,充分体现了去芜存菁的核心理念。其过滤指标无需依赖任何大模型,完全基于可复现的确定性算法,从而保证了数据选择的透明性与公正性。此外,数据集内部及跨数据集的全方位去重机制尤为突出:通过共享布隆过滤器,不仅消除了同一数据集内的重复,更能够识别和剔除不同用户重复上传的相同内容,累计去重超过310万条。最终数据集的每个样本都附带来源、词元数、词元多样性及质量评分等元信息,为下游微调提供了丰富的筛选维度。
使用方法
Mega-Brain-Distill 数据集专为文本生成任务的监督微调与知识蒸馏而设计,使用方式极为便捷。用户可通过 Hugging Face 的 datasets 库一键加载,仅需一行代码即可获得训练数据:调用 load_dataset 函数并指定数据集名称与分割名。数据以标准格式呈现,包含来源标签、结构化对话消息或纯文本字段,以及启发式计算的词元数、多样性和综合质量分数。这些元信息赋予用户极大的灵活性,可以根据自身任务需求进行二次筛选,例如选择特定来源的高质量子集,或按照质量分数进行加权采样。该数据集适用于多种场景,包括提升小模型的推理能力、增强指令遵循表现,或作为预训练后阶段的精调数据源。
背景与挑战
背景概述
Mega-Brain-Distill数据集诞生于大语言模型知识蒸馏与推理轨迹生成领域迅猛发展的2026年,由社区研究者ShinMK3主导构建。该数据集的核心研究问题在于如何从大量冗余、质量参差的社区开源蒸馏数据中,通过确定性启发式方法筛选出高质量的推理轨迹样本,以服务于高效的语言模型监督微调(SFT)。数据集整合了来自HuggingFace Hub上584个社区上传的蒸馏与推理轨迹数据集,涵盖Fable-5、Opus、GLM、Kimi、DeepSeek、GPT等主流模型的输出,经过严格的去重与质量过滤后,最终保留约111万条样本,总计约34.8亿词元。这一大规模、高精度的筛选工作为开源社区提供了可靠且可复现的训练数据基础,在降低训练成本的同时显著提升了数据质量,对推动知识蒸馏技术在非商业场景下的应用具有重要参考价值。
当前挑战
Mega-Brain-Distill所解决的领域问题在于应对大语言模型知识蒸馏中的核心挑战——如何从海量、高噪声、且严重重复的社区数据中高效提取高质量推理轨迹。原始数据横跨584个来源,其中大量数据集为同一底层内容被不同用户重复上传,导致跨数据集的精确重复率极高,传统单数据集去重方法无法触及。构建过程中面临多重技术挑战:首先,需设计统一的异构模式解析器,以兼容ShareGPT、OpenAI messages、instruction/output等十余种不同数据格式;其次,基于SHA-256与全局布隆过滤器的跨数据集去重策略需处理超过1460万条原始样本,过滤掉约310万条精确重复项;此外,通过词元长度门限与词多样性(TTR)过滤算法剔除过短、低质量或重复性生成的样本,需在不依赖任何模型评判的前提下,保证筛选结果的公平性与鲁棒性。最终,采用token_count×word_diversity的评分机制对每个源数据集保留最高分的10%,有效平衡了长序列与高信息密度之间的张力,在有限的计算资源下实现了高质量数据的规模化蒸馏。
常用场景
经典使用场景
在大型语言模型(LLM)的研究与开发中,知识蒸馏与监督微调(SFT)是提升模型推理能力与性能的核心范式。Mega-Brain-Distill数据集专为这一需求而生,汇聚了来自HuggingFace社区584个高质量蒸馏/推理轨迹数据源的精华,经过去重与启发式质量筛选后,保留了最具价值的10%样本。它最经典的使用场景在于作为SFT微调语料,用于训练具备强推理能力的语言模型,尤其是在需要长链推理、数学解题与代码生成等任务中,能为模型提供海量、多样化且经过严格质量控制的示范性对话与文本。
衍生相关工作
Mega-Brain-Distill的发布催生了一系列围绕数据质量筛选与跨源数据融合的后续研究。其采用的非模型依赖式启发式筛选策略启发了社区开发更轻量、可解释的数据过滤工具。此外,该数据集汇聚了来自Opus、Fable-5、KIMI-K2.5等多个知名开源或闭源模型推理轨迹的特性,为研究者提供了独特的视角来比较不同模型之间的推理风格与能力差异,间接促进了跨架构知识迁移、多模型集成以及针对数据污染的鲁棒训练方法等方向的探索。
数据集最近研究
最新研究方向
在大规模语言模型蒸馏与推理轨迹数据日益泛滥的背景下,Mega-Brain-Distill 数据集应运而生,其核心研究价值在于提供一种不依赖任何大模型裁判的纯确定性启发式筛选策略。该数据集从社区上传的584个蒸馏与推理轨迹数据集中,通过长度门控、词多样性过滤与跨数据集SHA-256去重等步骤,精心萃取出约111万条高质量、长序列且非重复的样本,总规模达34.8亿词元。此举精准回应了当前开源社区中同一底层数据被不同用户重复上传所引发的数据冗余与质量参差问题,为后续监督微调与逻辑推理研究提供了可靠、洁净且极具代表性的训练语料,深刻推动了数据治理从规模优先向质量优先的范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务