遇见数据集

Fable5 Dataset

收藏
github2026-06-16 更新2026-07-13 收录
官方服务:

资源简介:

Fable5数据集是FableForge生态系统的一部分,用于加载、预处理和管理代理跟踪数据集,以进行微调和评估。它包括多个来源的数据,如Glint(基于会话的完整代理会话,包含工具使用)、armand0e(多轮对话,包含函数调用)、vfable(代理轨迹,包含顺序工具使用)、Coding Excellence(基于会话的高质量编码会话,由专家评分)、OpenCoven(指令跟随的输入/输出对)和Victor(单轮编码指令对)。

The Fable5 dataset is part of the FableForge ecosystem, dedicated to loading, preprocessing, and managing agent trace datasets for fine-tuning and evaluation. It includes data from multiple sources: Glint (full session-based agent sessions with tool usage), armand0e (multi-turn dialogues with function calls), vfable (agent trajectories with sequential tool usage), Coding Excellence (session-based high-quality coding sessions scored by experts), OpenCoven (instruction-following input-output pairs), and Victor (single-turn coding instruction pairs).

创建时间:
2026-06-15
原始信息汇总

Fable5 数据集概述

Fable5 数据集 是一个用于微调与评估智能体(Agent)轨迹的数据集,提供加载、预处理和管理功能。它是 FableForge 生态系统 的一部分,该生态系统包含 21 个开源项目,基于 210K 真实智能体轨迹构建。

数据集来源

来源 格式 描述
Glint 基于会话的轮次结构 包含工具使用的完整智能体会话
armand0e 带有 tool_calls 的多轮对话 支持函数调用的多轮对话
vfable 带有 tool_use 的轨迹 包含顺序工具使用的智能体轨迹
Coding Excellence 基于会话并附带质量评分 由专家评分的高质量编程会话
OpenCoven 源/目标对 遵循指令的输入/输出对
Victor 提示/回复对 单轮编程指令对

安装与使用

  • 安装pip install fable5-dataset
  • 加载数据:支持命令行与编程 API。可加载单一来源(如 fable5 load glint)或全部数据,支持 PII 移除与质量过滤。
  • 查看统计:通过 fable5 stats 命令可查看单一数据集或所有数据集的统计信息。
  • 格式转换:支持将数据转换为 OpenAI Chat 格式或 Alpaca 格式。
  • 基准生成:可根据来源和类别(如 debugging, implementation)生成基准测试任务。
  • 数据拆分:支持按比例或分层(如按工具分布)拆分为训练集和验证集。

编程 API 示例

python from fable5_dataset import DatasetLoader, Preprocessor, BenchmarkGenerator, DatasetStats

加载数据

loader = DatasetLoader() records = loader.load_dataset("glint", normalize=True, remove_pii=True)

预处理

preprocessor = Preprocessor() normalized = preprocessor.normalize_format(records, source_format="glint") cleaned = preprocessor.remove_pii(normalized) filtered = preprocessor.filter_quality(cleaned, min_quality=0.7)

统计

stats = DatasetStats() result = stats.compute_stats(records) print(result.summary())

基准生成

gen = BenchmarkGenerator() tasks = gen.generate_benchmark(records, num_tasks=50, categories=["debugging"])

数据集比较

comparisons = stats.compare_datasets(all_data)

许可证

采用 MIT 许可证。

搜集汇总
数据集介绍
Fable5 Dataset 数据集图片
构建方式
Fable5 Dataset是基于FableForge生态系统构建的大规模智能体轨迹数据集,汇集了来自Glint、armand0e、vfable、Coding Excellence、OpenCoven和Victor等六个来源的异构数据,覆盖会话式交互、函数调用轨迹、专家评分编码会话及指令对等多元格式。通过统一的预处理流水线,数据集支持PII移除、质量过滤与格式归一化,最终形成结构化的智能体行为记录集合。
特点
该数据集最显著的特征在于其丰富的多源异构性与生态系统协同性。每个子数据集都保留了原始交互的完整上下文,既包含多轮对话的'Glint'数据,也包含具有工具调用时序的'vfable'轨迹。此外,数据集中融入了专家评分的高质量编码会话,为模型训练提供了可靠性锚点。作为FableForge生态的基石,它与21个开源项目深度耦合,覆盖从错误恢复模式到成本优化的全链路智能体开发需求。
使用方法
用户可通过pip安装fable5-dataset包后,利用命令行界面或Python API灵活操作数据。'fable5 load'命令支持按来源加载特定数据集或合并全部数据,并可选启用PII移除与质量阈值过滤。核心API提供DatasetLoader进行数据加载,Preprocessor实现格式转换与清洗,BenchmarkGenerator生成评测基准,DatasetStats计算统计特征。数据可导出为OpenAI Chat、Alpaca等通用格式,或通过split命令按工具分布进行分层分割,适配微调与评估流程。
背景与挑战
背景概述
Fable5 Dataset 诞生于 FableForge 生态体系,由 KingLabs 团队于近期构建,旨在为自主智能体的训练与评估提供高质量的轨迹数据。该数据集汇聚了来自 Glint、Armand0e、VFable、Coding Excellence 等六大来源的真实 Agent 交互记录,覆盖多轮对话、工具调用、编码会话等复杂场景,总量超过 21 万条原始轨迹。Fable5 的核心研究问题在于如何利用丰富的 Agent 行为数据,推动模型在计划执行、错误恢复、多步推理等能力上的突破。作为 FableForge 生态中 21 个开源组件的数据基石,该数据集为 Anvil、VerifyLoop、FableForge-14B 等下游系统提供了统一的训练与评测基准,对 Agent 导向的微调、对齐与泛化研究具有重要的催化作用。
当前挑战
Fable5 Dataset 所面临的挑战主要体现在两个层面。领域层面,现有 Agent 系统在处理多类型工具、多轮次动态上下文时,常面临轨迹稀疏、工具分布不均和长程依赖建模困难等问题,如何从异构轨迹中提取通用、可迁移的行为表征仍是关键难题。构建层面,面对来自不同来源的异构数据格式(如会话式会话、工具调用对、带质量分数的编码迹),需要解决格式归一化、PII 脱敏与质量过滤等预处理难题;同时,在拆分与基准生成过程中,需确保分层抽样(如按工具类型进行分层切分)的合理性与代表性,以支持公平、可复现的模型评估与对比。
常用场景
经典使用场景
Fable5 Dataset是面向大语言模型智能体(Agent)行为建模与训练的核心数据集,其最经典的使用场景在于对Agent轨迹数据的加载、预处理与评估。研究者借助该数据集能够高效地汇聚来自Glint、armand0e、vfable等多源异构会话与工具调用数据,通过统一的API完成去标识化、格式标准化、质量过滤与统计计算,从而为后续的微调与基准测试奠定坚实的数据基础。该场景解决了从真实Agent交互日志中提取高质量训练样本的痛点,使得在编码、调试与多轮对话等任务上构建鲁棒的Agent模型成为可能。
解决学术问题
该数据集解决了智能体领域长期存在的训练数据匮乏与异质性难题,为Agent行为的系统性研究提供了标准化评估与复现标尺。具体而言,它攻克了多源轨迹数据格式不统一、隐私信息混杂及质量参差等关键障碍,使学术社群得以在统一的基准上比较不同训练策略与模型架构的有效性。其意义在于推动了从单轨行为剖析到跨场景泛化能力验证的范式跃迁,为验证Agent在工具使用、错误恢复与多步骤推理等复杂任务中的表现提供了可信赖的数据支撑,进而加速了Agent基础理论的演进。
衍生相关工作
围绕Fable5 Dataset孕育出一系列极具影响力的衍生工作,构成了完备的FableForge生态。其中,Anvil项目基于该数据集训练了具备自验证能力的编码Agent,而VerifyLoop框架则从中提炼出规划-执行-验证-恢复的通用循环范式。ErrorRecovery利用数据集中的3,725种错误模式构建了自愈中间件,ReasonCritic进一步训练出专门的验证模型。此外,AgentCurriculum基于数据分布设计了五阶段渐进式训练流程,AgentFuzzer则从轨迹中生成对抗样本用于鲁棒性测试,这些工作共同推动了Agent从单一技能执行向自主决策与持续进化的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务