遇见数据集

fable-5-premium

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

Fable-5 Premium Dataset是一个高质量的监督微调(SFT)数据集,由Claude Fable-5智能体轨迹(agent traces)构建而成。该数据集秉持“质量优于易用性,优于数量”的原则,经过严格的清洗流程,包括去重、结构验证、内容过滤、个人可识别信息(PII)清理、工具调用验证以及多维质量评分。数据规模为12,730条记录,划分为训练集(5,728条,占45%)、验证集(318条,占2.5%)和测试集(319条,占2.5%)。数据集提供两种格式:OpenAI Chat格式(包含user、assistant、tool角色的messages数组)和Hugging Face Agent Traces格式。此外,还包含reasoning字段用于显式思维链,以及嵌入在assistant内容中的`thinking`标签以支持标准微调。该数据集适用于文本生成和token分类任务,可直接用于Axolotl、Unsloth以及OpenAI微调API。许可证为MIT,创建日期为2026-07-30。

Fable-5 Premium Dataset is a high-quality supervised fine-tuning (SFT) dataset constructed from Claude Fable-5 agent traces. It adheres to the principle of quality over usability, over quantity and undergoes a rigorous cleaning process including deduplication, structure validation, content filtering, personally identifiable information (PII) removal, tool call validation, and multi-dimensional quality scoring. The dataset comprises 12,730 records, split into a training set (5,728 records, 45%), a validation set (318 records, 2.5%), and a test set (319 records, 2.5%). It is available in two formats: the OpenAI Chat format (with messages arrays containing user, assistant, and tool roles) and the Hugging Face Agent Traces format. Additionally, it includes a reasoning field for explicit chain-of-thought and `thinking` tags embedded in assistant content to support standard fine-tuning. The dataset is suitable for text generation and token classification tasks, and can be directly used with Axolotl, Unsloth, and the OpenAI fine-tuning API. The license is MIT, and the creation date is 2026-07-30.

创建时间:
2026-07-30
原始信息汇总

数据集概述

Fable-5 Premium Dataset 是一个基于 Claude Fable-5 智能体轨迹(agent traces)构建的高质量监督微调(SFT)数据集,强调“质量优先于易用性和数量”的原则。

基本信息

属性
记录总数 12,730
训练集 5,728 条(45.0%)
验证集 318 条(2.5%)
测试集 319 条(2.5%)
创建日期 2026-07-30
许可证 MIT
语言 英语
数据规模 10K < n < 100K

数据格式

数据集提供两种格式:

  1. OpenAI Chat 格式:标准的 messages 数组,包含 user/assistant/tool 角色,可直接用于 Axolotl、Unsloth 和 OpenAI 微调 API。
  2. Hugging Face Agent Traces 格式:原生 HF Agent Traces,可在 Data Studio 中查看。

质量处理流程

  1. 去重:对所有来源采用 SHA-256 内容哈希进行跨来源去重
  2. 结构验证:验证消息模式、工具调用 ID 和角色序列的合法性
  3. 内容过滤:移除空响应、截断响应、仅错误会话和占位符
  4. PII 清洗:移除本地路径、API 密钥和特定环境数据
  5. 工具调用验证:确保工具调用有对应的工具响应
  6. 质量评分:采用多维质量指标进行评分

质量分布

分数区间 数量
0.3-0.5 448
0.7-0.8 532
0.8-0.9 3,736
0.9-1.0 6,740

多数样本(约 82%)的质量分数在 0.8 以上,表明数据集整体质量较高。

思维链(Chain-of-Thought)支持

  • reasoning 字段:为支持显式思维令牌的模型提供独立字段
  • 嵌入 <think> 标签:将思维链合并到 assistant 内容中,适用于标准微调

任务类型

  • 文本生成(text-generation)
  • 令牌分类(token-classification)

相关标签

  • fable-5、claude、agent-traces、coding、tool-use、sft、fine-tuning、distillation
搜集汇总
数据集介绍
fable-5-premium 数据集图片
构建方式
该数据集源自Claude Fable-5代理轨迹,经过严格的清洗流程构建而成。构建过程涵盖SHA-256内容哈希去重、消息结构验证、内容过滤(剔除空响应、截断回复、错误会话及占位符)、PII数据擦除(移除本地路径、API密钥与环境特定信息)、工具调用验证(确保每次工具调用均有对应响应)以及多维质量评分。最终形成包含12,730条记录的高质量监督微调数据集,划分为训练集(5,728条,占45%)、验证集(318条,占2.5%)和测试集(319条,占2.5%)。
特点
该数据集以质量为核心,优先考虑数据纯净度而非数量,展现三大显著特性:其一,提供OpenAI聊天格式与Hugging Face代理轨迹格式双版本,适配不同微调工具链;其二,内置链式思考(CoT)支持,通过独立的reasoning字段或嵌入的<think>标签,满足显式推理令牌模型与传统微调需求;其三,质量分布集中于高分区间,0.9-1.0分记录占比超过半数,确保训练数据的可靠性。
使用方法
使用者可通过Hugging Face Datasets库便捷加载,指定openai_chat或agent_traces子集分别获取标准消息数组或原生轨迹格式。该数据集原生兼容Axolotl(通过chat_template类型配置)及Unsloth(结合FastLanguageModel)等主流微调框架,同时适用于OpenAI微调API。对于支持显式思维令牌的模型,可直接使用reasoning字段;对于传统模型,可依赖嵌入的<think>标签进行标准有监督微调。
背景与挑战
背景概述
Fable-5 Premium Dataset 是由 Hugging Face 平台用户 saidutta69 于 2026 年 7 月 30 日创建的高质量监督微调(SFT)数据集,基于 Claude Fable-5 智能体轨迹构建。该数据集旨在解决大型语言模型在工具调用与智能体任务中的微调数据稀缺与质量低下问题,通过严格的清洗流程(包括去重、结构验证、内容过滤、PII 脱敏、工具调用验证及多维质量评分)确保数据的高保真度。其发布为研究社区提供了两种格式(OpenAI Chat 格式与 Hugging Face Agent Traces 格式),兼容 Axolotl、Unsloth 等主流微调框架,对提升模型在复杂代理任务中的泛化能力具有重要推动作用,成为该领域数据构建的标杆之作。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。领域层面,工具调用型智能体训练需大量真实交互轨迹,但此类数据难以从开源社区大规模获取,且常见数据噪声大、格式不一,易导致模型产生幻觉或工具误用;构建过程中,需处理跨源重复内容(借助 SHA-256 哈希去重)、确保消息序列与工具调用 ID 的严格对应关系,并过滤错误或占位响应,同时平衡数据规模与质量,最终在 12,730 条记录中精选出质量评分高于 0.7 的绝大多数样本,但低分段(0.3-0.5)仍存在 448 条,提示质量分布不均的风险,需持续优化筛选策略以满足更高阶微调需求。
常用场景
经典使用场景
Fable-5 Premium数据集的核心应用场景在于监督式微调(SFT),旨在提升语言模型在复杂工具调用与智能体任务中的表现。该数据集源自Claude Fable-5智能体轨迹,经过严格清洗与质量筛选,保留了高价值的推理过程与交互记录。研究者可利用其提供的OpenAI对话格式或Hugging Face Agent Traces格式,对开源模型如Llama-3-8B进行指令微调,使其习得多步推理、工具选择与结果整合的能力。该数据集特别适合训练能够执行编码、API调用等任务的语言智能体,是构建高效AI助手的关键资源。
解决学术问题
该数据集解决了语言模型在智能体任务中泛化能力不足的学术难题。传统文本生成数据集缺乏对工具调用和结构化推理的深入刻画,导致模型在真实世界中难以适应动态环境。Fable-5 Premium通过提供包含完整思维链(CoT)与工具交互轨迹的高质量样本,使研究者能够探索如何将隐式推理显式化,并增强模型的分步决策能力。其数据质量评分机制也为建立数据筛选基准提供了参考,推动了数据高效学习、知识蒸馏及模型对齐等领域的研究进展,为构建更稳健的智能体系统奠定了数据基础。
衍生相关工作
Fable-5 Premium数据集衍生了一系列颇具影响力的研究工作。其高质量轨迹数据启发了针对推理蒸馏(reasoning distillation)的新方法,通过模仿Claude模型的长思维链来提升小型模型的推理能力。基于该数据集的工具调用模式,研究者开发了更先进的智能体策略学习算法,如基于偏好优化的工具选择机制。此外,该数据集的Agent Traces格式促进了开源社区对智能体行为分析和可解释性研究的探索,催生了若干基准测试集与评估框架,用于衡量语言模型在代理任务上的性能。这些衍生工作不仅扩展了数据集的应用边界,也推动了语言智能体研究向更深层次发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务