遇见数据集

Qwen3.8-GLM5.2-Kimi-K3-GPT5.6-Gemini-3.1-Claude-Fable5-Mythos5-distillation

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

SuperFusion 数据集是一个经过精心策划的高密度蒸馏融合数据集,包含 190,000 条精选样本。该数据集融合了来自多个前沿大语言模型(包括 Qwen 3.8 Max、GLM 5.2、Kimi K3、GPT 5.6、Gemini 3.1 Pro、Claude、Fable、Mythos、Grok 4.4 等)的优质轨迹,并通过深度过滤确保数据具有深度和实质内容,从而为微调和训练提供一流性能。数据集的字段非常丰富,涵盖了任务类型(task)、语言(lang)、类别(category)、领域(domain)、安全任务(security_task)、验证器(verifier)、数据分割(split)、会话 ID(session_id)、教师模型(teacher_model)、推理努力程度(reasoning_effort)、轨迹格式(trace_format)、使用的工具(tools_used)、轨迹部分(trace_part)、连续性(continuation)、衍生来源(derivation)、助手步骤(assistant_step)、消息内容(messages_json)、工具配置(tools_json)、地面真相(ground_truth_json)、去重集群 ID(dedup_cluster_id)、验证标志(verifier_passed)、格式分数(format_score_raw)、质量标志(quality_flags)、采样权重(sampling_weight)、助手回合数(n_assistant_turns)、工具调用次数(n_tool_calls)、难度(difficulty)、指令(instruction)、输入(input)、输出(output)以及标签(tags)等。该数据集适用于多轮对话、工具调用、推理轨迹学习、指令微调、模型对齐等多种任务,尤其适合需要高质量、多样化训练数据的研究和开发场景。

The SuperFusion dataset is a carefully curated high-density distillation fusion dataset containing 190,000 selected samples. It integrates high-quality trajectories from multiple cutting-edge large language models (including Qwen 3.8 Max, GLM 5.2, Kimi K3, GPT 5.6, Gemini 3.1 Pro, Claude, Fable, Mythos, Grok 4.4, etc.) and undergoes deep filtering to ensure data depth and substance, thereby providing top-tier performance for fine-tuning and training. The dataset features rich fields covering task type, language, category, domain, security task, verifier, split, session ID, teacher model, reasoning effort, trace format, tools used, trace part, continuation, derivation, assistant step, messages JSON, tools JSON, ground truth JSON, dedup cluster ID, verifier passed, format score raw, quality flags, sampling weight, number of assistant turns, number of tool calls, difficulty, instruction, input, output, and tags. This dataset is suitable for various tasks such as multi-turn dialogue, tool calling, reasoning trajectory learning, instruction fine-tuning, and model alignment, especially for research and development scenarios requiring high-quality and diverse training data.

创建时间:
2026-08-11
原始信息汇总

数据集概述

SuperFusion Dataset (190k Elite Rows) 是一个经过精心策划的高密度知识蒸馏融合数据集,旨在为模型微调和训练提供顶级质量的数据支持。

数据来源

数据集融合了多个先进模型的精英轨迹数据,包括:

  • Qwen 3.8 Max
  • GLM 5.2Kimi K3
  • GPT 5.6(包含50k行数据)
  • Gemini 3.1 Pro
  • Claude
  • Fable
  • Mythos
  • Grok 4.4

数据规模与特色

  • 总数据量约为 190,000 行
  • 经过深度和实质内容的筛选,确保数据的高质量和高密度,专为追求顶尖性能的微调与训练任务设计。

数据文件与配置

  • 数据集包含一个默认配置(default),对应单个训练分割(train),数据存储于 superfusion_master_dataset_downloaded.jsonl 文件中。

数据特征

数据集包含丰富的特征字段,主要涵盖以下几类:

  • 任务与内容标识task(任务类型)、task_typecategory(类别)、domain(领域)、subdomain(子领域)、instruction(指令)、input(输入)、output(输出)、tags(标签)等。
  • 数据来源与溯源source(来源)、source_repositorysource_revisionsource_licensesource_splitsource_item_idsource_record_hashteacher_model(教师模型)、teacher_provider(教师提供方)。
  • 轨迹与消息结构session_id(会话ID)、trace_formattrace_parttrace_partscontinuation(是否延续)、derivationassistant_stepassistant_stepstarget_message_indexoriginal_n_messagesn_messagesparent_ididmessages_json(消息JSON)、n_assistant_turns(助手轮次)、n_tool_calls(工具调用次数)。
  • 工具使用tools_used(使用的工具列表)、toolstools_json
  • 质量与验证verifier(验证器)、verifier_passed(验证是否通过)、family_oracle_passedreference_agreementformat_score_raw(格式原始分数)、quality_flags(质量标志)、sampling_weight(采样权重)、disposition
  • 聚类与去重prompt_cluster_idtemplate_cluster_iddedup_cluster_id
  • 其他元数据lang(语言)、kindtrace_kindsecurity_task(安全任务)、reasoning_effort(推理努力程度)、difficulty(难度)、schema_version(模式版本)。

应用场景

该数据集特别适用于需要高质量对话数据、多任务指令微调、复杂推理轨迹学习以及工具调用场景的大语言模型训练与优化。

搜集汇总
数据集介绍
Qwen3.8-GLM5.2-Kimi-K3-GPT5.6-Gemini-3.1-Claude-Fable5-Mythos5-distillation 数据集图片
构建方式
在大规模语言模型蒸馏与微调的数据需求日益精细化的背景下,该数据集通过融合多个前沿大模型的精英轨迹构建而成。其汇集了来自Qwen 3.8 Max、GLM 5.2、Kimi K3、GPT 5.6、Gemini 3.1 Pro、Claude、Fable、Mythos以及Grok 4.4等模型的优质输出,形成约19万行的高密度蒸馏样本。构建过程依托多源轨迹采样与系统化过滤,逐条评估推理深度与内容实质,保留具备高训练价值的精英数据,并经由统一的结构化字段组织,形成可复用的训练语料。
使用方法
该数据集适用于大语言模型的蒸馏训练与指令微调。使用者可加载train划分的JSONL文件,依据task、domain、lang、teacher_model等字段进行子集筛选,并结合quality_flags、verifier_passed、sampling_weight等指标实施质量过滤与加权采样。messages_json与tools_json字段承载对话与工具调用结构,可直接用于监督微调或轨迹蒸馏。通过difficulty与category等标签,可进一步构造课程学习或领域自适应训练方案。
背景与挑战
背景概述
大语言模型的知识蒸馏技术近年来从单一教师范式向多教师协同融合演进,SuperFusion数据集正是这一趋势下的产物。该数据集由研究社区于2024至2025年间构建,汇集了Qwen 3.8 Max、GLM 5.2、Kimi K3、GPT 5.6、Gemini 3.1 Pro、Claude、Fable、Mythos及Grok 4.4等九个前沿模型的精英推理轨迹,形成约十九万行的高密度蒸馏融合语料。其核心研究问题在于如何跨模型整合异构推理路径与工具调用轨迹,并通过验证器通过率、家族预言机检验及参考一致性等多重信号实现质量筛选。该数据集为多教师蒸馏、智能体行为克隆及推理链对齐研究提供了规模化、多源化的实证基础,对探索模型能力融合与蒸馏数据治理具有显著的参考价值。
当前挑战
该数据集所应对的领域问题在于多教师蒸馏中异构轨迹的语义对齐与质量甄别:不同教师模型的推理风格、工具调用范式与输出格式差异显著,直接混合易导致知识冲突与训练信号稀释。构建过程中亦面临多重挑战:其一,跨模型轨迹的归一化与去重,需依赖提示聚类、模板聚类与去重聚类等多级标识符实现精细化管理;其二,质量验证的多源一致性,验证器通过、家族预言机通过及参考一致性等布尔信号需协同判定,以剔除表面流畅而实质错误的轨迹;其三,工具调用与多轮对话轨迹的完整性维护,涉及助手步数、消息索引与续写标记的结构化编排;其四,出处溯源与许可合规,各源仓库、修订版本与许可证信息须逐条记录,以保障数据治理的透明性与可复现性。
常用场景
经典使用场景
在大模型蒸馏与多智能体推理研究领域,该数据集凭借跨模型、跨任务、跨语言的精英轨迹汇聚特征,为知识蒸馏与指令微调提供了高质量的监督信号。其经典用法在于以教师模型产生的思维链与工具调用轨迹为样本,训练学生模型习得复杂推理、多步工具编排与结构化输出能力,尤其适用于智能体行为克隆与长程任务规划的监督学习场景。
解决学术问题
该数据集直面大模型蒸馏中教师信号质量参差、推理轨迹冗长低效、跨模型能力难以对齐等常见学术难题。通过设置验证器通过率、家族预言机通过率、参考答案一致性及格式评分等多维质量标志,它为研究者提供了可量化筛选高价值轨迹的依据,从而支撑关于蒸馏数据筛选策略、推理长度与性能权衡、以及多教师融合有效性的实证研究,对提升小模型推理能力具有方法论意义。
实际应用
在实际应用中,该数据集可服务于企业级智能助手与编程代理的微调,覆盖安全任务、工具调用、多轮对话等场景。其字段涵盖任务类别、领域、子领域、难度与工具使用情况,便于按业务需求定制训练子集。开发者可借助其结构化消息与工具描述,构建具备函数调用、代码执行与检索增强能力的垂直领域模型,加速从通用基座到专用代理的落地进程。
数据集最近研究
最新研究方向
在大模型知识蒸馏与推理增强的交汇地带,SuperFusion数据集凭借其融合Qwen、GLM、Kimi、GPT、Gemini、Claude及Grok等旗舰模型精英轨迹的独特构造,正推动多教师异构蒸馏范式的前沿探索。该数据集汇聚逾十九万条经深度筛选的高密度样本,涵盖工具调用、安全任务、多轮对话与可验证推理等多元场景,其细粒度元数据体系(如教师模型标识、验证器通过状态、推理代价及质量标志)为研究教师模型能力解耦与轨迹级信用分配提供了稀缺的实证基础。当前热点聚焦于如何借助此类融合语料实现学生模型在复杂推理与工具使用上的协同跃升,同时规避单一教师偏差与数据污染风险,其影响延伸至蒸馏数据治理、模型能力溯源及评测基准重构等关键议题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务