遇见数据集

CanvasCraftSFT

收藏
Hugging Face2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

CanvasCraftSFT是CanvasCraft数据集的监督微调子集,源自CanvasAgent研究,旨在为复杂图像创建和编辑任务提供可执行的多模态工具使用轨迹。该数据集包含142,798个轨迹示例,每个轨迹教导代理如何响应用户请求、调用带有结构化参数的视觉工具、观察中间视觉结果,并决定图像转换何时完成。数据以JSON格式存储轨迹(包括任务提示、图像列表、元数据和聊天式消息序列),并以Parquet分片形式嵌入181,038个图像资源(对应179,630个唯一图像路径)。轨迹中图像引用数量分布广泛(1-7个图像),消息长度主要为5-19条,工具使用涵盖图像编辑、生成、OCR、定位、翻转、旋转、超分辨率等51种独特工具链。该数据集专为多模态工具使用代理的监督微调研究而设计,适用于图像创建和编辑工作流、视觉代理的推理-动作-观察训练,以及为在CanvasCraftRL上进行强化学习前的代理引导。数据仅限研究和教育用途,需注意轨迹JSON中使用遗留绝对图像前缀,需规范化路径以匹配存储库文件。

CanvasCraftSFT is a supervised fine-tuning subset of the CanvasCraft dataset, derived from CanvasAgent research, designed to provide executable multimodal tool usage trajectories for complex image creation and editing tasks. The dataset contains 142,798 trajectory examples, each teaching an agent how to respond to user requests, invoke visual tools with structured parameters, observe intermediate visual results, and decide when image transformations are complete. Data is stored in JSON format for trajectories (including task prompts, image lists, metadata, and chat-style message sequences), with 181,038 image resources embedded in Parquet shards (corresponding to 179,630 unique image paths). Trajectories have a wide distribution of image references (1-7 images), message lengths primarily between 5-19, and tool usage covers 51 unique tool chains such as image editing, generation, OCR, positioning, flipping, rotation, and super-resolution. This dataset is specifically designed for supervised fine-tuning research on multimodal tool-using agents, applicable to image creation and editing workflows, reasoning-action-observation training for visual agents, and agent bootstrapping before reinforcement learning on CanvasCraftRL. Data is limited to research and educational use; note that legacy absolute image prefixes are used in trajectory JSONs, requiring path normalization to match repository files.

创建时间:
2026-05-28
原始信息汇总

CanvasCraftSFT 数据集概述

CanvasCraftSFT 是 CanvasCraft 数据集的监督微调子集,与 CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration 一同发布。该数据集包含用于复杂图像创建和编辑任务的可执行多模态工具使用轨迹。

数据集用途

  • 研究目的:仅限研究及教育用途,禁止商业使用。
  • 主要目标:为 CanvasAgent 提供 SFT(监督微调)阶段训练数据,后续结合 CanvasCraftRL 进行强化学习。
  • 适用研究方向
    • 多模态工具使用代理的监督微调
    • 图像创建与编辑工作流中的可执行工具调用
    • 视觉代理的推理-行动-观察训练
    • 多轮交互中的视觉资产追踪
    • 为 CanvasCraftRL 强化学习优化进行代理预训练

数据集统计

主轨迹文件train_reason_imglist.json,包含 142,798 条记录。

图像资源

资源 数量
Parquet 图像分片数 167
Parquet 中嵌入的图像行数 181,038
唯一图像路径 179,630

轨迹图像引用分布

每轨迹图像数 示例数
1 49,972
2 71,069
3 19,270
4 1,883
5 540
6 61
7 3

对话长度分布

每轨迹消息数 示例数
5 98,811
7 26,786
9 13,393
11 2,045
13 1,154
15 594
17 12
19 3

工具使用分布

工具或工具链 示例数
ImageEdit 19,378
ImageGeneration 18,616
OCR 17,876
Grounding 13,480
Grounding+Crop 13,393
Grounding+SAM 13,393
Grounding+SAM+Extract 13,393
Overlayer 10,000
Flip 8,834
Rotate 8,627
SR 2,000
多工具链(51 种不同链) 3,808

数据格式

SFT 轨迹train_reason_imglist.json 是一个 JSON 数组,每条记录包含以下字段:

字段 描述
prompt 自然语言用户请求
edit_type 可用的编辑类别
images 轨迹使用的图像路径列表(使用旧版绝对路径前缀)
extra_info 元数据,如 original_id、轮次信息、工具名称或工具链
messages 聊天风格的 SFT 对话,包括系统提示、用户提示、助手推理/工具调用、工具观察结果和最终助手回复
image_sizebboxocr_tokens 可选的特定任务元数据,用于定位和 OCR 相关子集

messages 字段遵循工具使用格式,助手消息中可能包含 <reason>...</reason><tool_call>{"name": "...", "arguments": {...}}</tool_call> 等标记。工具观察结果存储为 role="tool" 的消息,可能包含 <image> 标记指示新生成的视觉资产。

图像包:以 Parquet 分片形式存储,具有以下模式:

  • imagestruct<bytes: binary, path: string>,标记为 Hugging Face Image 特征,可直接由 datasets 解码。
  • path:字符串类型,原始相对路径。

167 个分片包括 151 个原始图像分片、7 个 SR 图像分片和 9 个与 3,808 条新增多工具轨迹相关的分片。某些图像路径在多个行中出现,需使用 path 列作为查找键。

数据加载示例

加载轨迹 JSON: python from datasets import load_dataset repo_id = "GML-FMGroup/CanvasCraftSFT" traj = load_dataset("json", data_files={"train": f"hf://datasets/{repo_id}/train_reason_imglist.json"}, split="train", streaming=True) example = next(iter(traj)) print(example["prompt"]) print(example["images"]) print(example["messages"][-1]["content"])

加载嵌入图像包: python from datasets import load_dataset repo_id = "GML-FMGroup/CanvasCraftSFT" images = load_dataset("parquet", data_files={"train": f"hf://datasets/{repo_id}/data/train-*.parquet"}, split="train", streaming=True) sample = next(iter(images)) print(sample["path"]) print(sample["image"].size)

构建路径到图像的查找表(本地使用): python from datasets import load_dataset repo_id = "GML-FMGroup/CanvasCraftSFT" def normalize_path(path: str) -> str: return path.removeprefix("/jiangwenhao/zhuhairui/").lstrip("/") images = load_dataset("parquet", data_files={"train": f"hf://datasets/{repo_id}/data/train-*.parquet"}, split="train", streaming=True) image_by_path = {} for row in images: image_by_path[row["path"]] = row["image"] traj = load_dataset("json", data_files={"train": f"hf://datasets/{repo_id}/train_reason_imglist.json"}, split="train", streaming=True) record = next(iter(traj)) resolved_paths = [normalize_path(path) for path in record["images"]] resolved_images = [image_by_path.get(path) for path in resolved_paths]

已知局限性

  • 轨迹 JSON 使用旧版绝对图像前缀,需移除 /jiangwenhao/zhuhairui/ 以匹配仓库文件。
  • original_id 在当前合并文件中唯一,但不等于数组索引。
  • 所有引用的图像路径(包括 SR 输出和多工具中间结果)均嵌入在 Parquet 图像包中。
  • 数据集反映固定工具环境,工具模式、模型后端和视觉输出可能因其他实现而异。
  • 数据仅供研究使用,用户应避免欺骗性、有害、侵犯隐私或误导性的视觉内容应用。

引用

若使用该数据集,请引用 CanvasAgent / CanvasCraft 论文: bibtex @misc{canvasagent2026, title = {CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration}, author = {CanvasAgent Team}, year = {2026}, note = {Dataset: CanvasCraftSFT} }

搜集汇总
数据集介绍
CanvasCraftSFT 数据集图片
构建方式
CanvasCraftSFT隶属于CanvasAgent项目,旨在通过视觉工具编排实现复杂的图像创作与编辑任务。该数据集精心构建了多模态工具使用轨迹,每条轨迹详尽记录了智能体如何理解用户请求、调用结构化参数的工具、观察中间视觉结果,并最终决策图像变换是否完成。数据以JSON格式存储主轨迹文件,包含142,798条样本,涵盖任务提示、图像列表、元数据及完整的对话消息序列,其中消息格式遵循<reason>与<tool_call>的标记结构以体现工具调用过程。图像资源则封装于167个Parquet分片中,嵌入图像字节和原始路径,便于高效检索。
特点
CanvasCraftSFT的核心特色在于其多样化的工具使用模式与丰富的多轮交互结构。数据集涵盖了51种独特的工具链组合,包括图像编辑、生成、OCR、接地、叠加、翻转、旋转及超分辨率等操作,其中单图像轨迹近5万条,多图像轨迹逐步增加至最多7张图像,展示了从简单到高度复杂的任务难度梯度。对话长度分布从5到19条消息不等,突出了智能体在多次推理与观察中的动态决策。此外,每个轨迹均附带图像路径与归一化处理指导,虽存在遗留绝对路径前缀的局限性,但通过预处理即可解决。
使用方法
使用CanvasCraftSFT进行模型训练与研究时,推荐通过Hugging Face datasets库加载数据。用户可调用load_dataset函数分别读取JSON轨迹与Parquet图像包,支持流式处理以节约内存。对于图像路径匹配,需先移除遗留的'/jiangwenhao/zhuhairui/'前缀以建立路径与图像的映射字典。代码示例展示了如何遍历轨迹并提取相应的图像批次。数据集特别适用于多模态工具使用智能体的监督微调、图像创作与编辑工作流的构建、以及作为强化学习阶段CanvasCraftRL的bootstrap基础,推动视觉智能体领域的相关研究。
背景与挑战
背景概述
CanvasCraftSFT是由CanvasAgent团队于2026年推出的视觉工具编排数据集,旨在解决多模态智能体在复杂图像创建与编辑任务中的监督微调需求。该数据集源自CanvasCraft项目,其核心研究问题是如何让智能体通过结构化的工具调用链(如图像编辑、生成、OCR、定位等)来推理用户请求、观察中间视觉结果并自主决策任务完成时机。作为CanvasAgent的SFT阶段数据集,它为后续的强化学习优化(CanvasCraftRL)奠定了数据基础。CanvasCraftSFT包含约14.3万条可执行的多模态工具使用轨迹,覆盖51种不同的工具链组合,对推动视觉智能体在可操作性、多步推理和反馈闭环方面的研究具有重要影响力。
当前挑战
CanvasCraftSFT所解决的领域挑战在于:传统的图像创建与编辑方法通常依赖单一模型或静态指令,缺乏对多步推理与工具动态编排的支持,而智能体需要理解复杂自然语言请求并协调多个视觉工具的调用顺序与参数。在构建过程中,数据集面临多重挑战:首先是路径一致性问题,轨迹JSON中的图像路径使用遗留绝对前缀,需要标准化处理才能与Parquet分片中的嵌入式图像对应;其次是工具环境固定性,数据所反映的工具模式、模型后端及视觉输出在其他实现中可能存在差异;此外,还需确保14.3万条轨迹中的工具调用逻辑、中间结果记录与终止条件判断的准确性与一致性,避免产生误导性或有害的视觉内容应用。
常用场景
经典使用场景
CanvasCraftSFT最经典的使用场景是作为多模态工具编排智能体的监督微调(SFT)训练数据集。该数据集包含了超过14万条可执行的多模态工具调用轨迹,每条轨迹都详细记录了智能体如何理解用户对复杂图像创作与编辑的请求,如何调用结构化的视觉工具(如图像生成、图像编辑、OCR识别、目标定位、图像叠加、旋转、翻转等),观察中间视觉结果,并最终确定何时完成指定的图像变换任务。研究者可以利用这些轨迹对基础的多模态大语言模型进行指令微调,使其学会在复杂的图像操作流程中进行推理、决策和工具调用,从而构建出能够自主完成多步骤图像处理任务的智能体系统。
衍生相关工作
基于CanvasCraftSFT数据集,研究社区已经衍生出多项重要的学术工作。最核心的是CanvasAgent系统本身,它首次提出了通过监督微调加强化学习的两阶段训练策略来培养视觉工具编排智能体,其中CanvasCraftSFT作为SFT阶段的关键数据支撑。该数据集的出现还促进了多模态智能体在工具调用效率、轨迹规划优化、中间视觉结果理解等方面的深入研究。此外,研究者利用该数据集的工具链分布特征,开展了工具组合策略学习、视觉资产追踪等方向的探索工作。这些衍生研究不仅验证了高质量SFT数据在多模态智能体训练中的核心作用,也为未来构建更加自主、灵活、可靠的视觉AI系统提供了重要参考和基准资源。
数据集最近研究
最新研究方向
在视觉工具编排的多模态智能体领域,CanvasCraftSFT数据集代表了监督微调范式的最新前沿。该数据集为复杂图像创建与编辑任务提供了可执行的多模态工具使用轨迹,每个轨迹详细记录了智能体如何解析用户需求、调用结构化参数的视觉工具、观察中间视觉结果并判断生成何时完成。这一研究方向聚焦于构建具备推理-行动-观察循环能力的视觉智能体,通过142,798条SFT轨迹涵盖图像编辑、生成、OCR、定位、分割、叠加等51种工具链组合,为多模态智能体在工具编排场景下的自主决策与连续交互提供了关键训练基础。该数据集作为CanvasAgent系统的SFT阶段,专门服务于后续的强化学习优化,在推动视觉智能体从简单指令跟随向复杂创作任务的自适应执行演进中具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务