遇见数据集

GML-FMGroup/CanvasCraftSFT

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

CanvasCraftSFT是CanvasCraft数据集的监督微调子集,源自CanvasAgent项目,专注于复杂图像创建和编辑任务的可执行多模态工具使用轨迹。该数据集旨在训练代理通过用户请求进行推理、调用带有结构化参数的视觉工具、观察中间视觉结果,并决定图像转换何时完成。数据集包含138,990个轨迹示例,涉及166,563个嵌入图像和2,000个额外SR图像,覆盖多种工具如ImageEdit、ImageGeneration、OCR等。数据格式包括JSON轨迹文件(包含任务提示、图像列表和聊天式消息)和Parquet图像分片(包含图像字节和路径)。数据集主要用于多模态工具使用代理的监督微调研究,支持图像创建和编辑工作流程、视觉代理的推理-动作-观察训练,以及为CanvasCraftRL的强化学习阶段提供基础。局限性包括路径前缀需标准化、图像存储方式不同以及工具环境固定。

CanvasCraftSFT is the supervised fine-tuning subset of the CanvasCraft dataset introduced with CanvasAgent, focusing on executable multimodal tool-use trajectories for complex image creation and editing tasks. It teaches agents to reason over user requests, call visual tools with structured arguments, observe intermediate visual results, and decide when image transformations are complete. The dataset contains 138,990 trajectory examples, with 166,563 embedded images and 2,000 additional SR images, covering tools such as ImageEdit, ImageGeneration, and OCR. The data format includes JSON trajectory files (with task prompts, image lists, and chat-style messages) and Parquet image shards (with image bytes and paths). It is intended for research on supervised fine-tuning of multimodal tool-use agents, image creation and editing workflows, reasoning-action-observation training for visual agents, and bootstrapping before RL optimization on CanvasCraftRL. Limitations include the need to normalize legacy path prefixes, mixed image storage, and a fixed tool environment.

提供机构:
GML-FMGroup
搜集汇总
数据集介绍
GML-FMGroup/CanvasCraftSFT 数据集图片
构建方式
CanvasCraftSFT作为CanvasCraft数据集的有监督微调子集,旨在为多模态工具编排智能体提供可执行的轨迹数据。每条轨迹通过对话式消息结构,完整记录了智能体从解析用户自然语言请求、调用结构化参数的视觉工具、观察中间图像结果,到判定任务终止的完整推理-行动-观察循环。数据集由主轨迹文件train_reason_imglist.json与额外的多工具硬样本集multitool-hard-v2.json构成,后者包含3万条更长工具链与更丰富中间图像结果的复杂轨迹。图像数据以自包含的Parquet分片形式存储,嵌入二进制图像字节与相对路径,确保与轨迹文件中的路径直接匹配,无需额外路径归一化处理。
使用方法
用户可通过Hugging Face Datasets库便捷加载数据集。轨迹数据以JSON格式加载,每条记录包含用户提示、图像路径列表、元信息及多轮对话消息。图像Parquet分片支持流式加载,可通过path列构建路径到图像的查找字典,实现轨迹中图像资源的高效解析。硬样本集需先解压对应的tar.gz图像归档,保持内部路径结构以匹配JSON中的images条目。数据集适用于多模态工具使用智能体的监督微调、图像创建与编辑工作流的工具调用训练、视觉资产追踪以及强化学习前的引导阶段,所有操作均需遵循研究用途许可,避免误导性或有害内容应用。
背景与挑战
背景概述
CanvasCraftSFT 数据集诞生于多模态智能体与视觉工具编排研究的前沿交汇处,由 CanvasAgent 团队于2026年提出,旨在解决复杂图像生成与编辑任务中智能体难以高效调用视觉工具进行多步推理与协作的难题。作为 CanvasAgent 框架的监督微调子集,该数据集专注于为智能体提供可执行的工具使用轨迹,涵盖从用户自然语言请求出发,到工具选择、参数调用、中间视觉结果观察直至任务完成的完整流程。其核心研究问题在于如何通过结构化数据驱动的方式,使多模态智能体学会自主编排如 ImageEdit、ImageGeneration、OCR、Grounding 等视觉工具,从而显著提升图像创作与编辑的复杂性与灵活性。该数据集的发布为视觉智能体领域提供了关键的训练基准,推动了从简单指令响应到复杂工具链编排的研究范式转变。
当前挑战
CanvasCraftSFT 主要应对两个层面的挑战。在领域问题层面,传统图像生成与编辑模型受限于单一模型或固定流程,难以处理涉及多步骤推理、多工具协作的复杂用户请求,例如在编辑后需进行定位、裁剪、叠加等操作时,智能体缺乏统一的任务分解与工具编排能力,导致生成结果与用户意图存在较大偏差。在数据构建过程中,挑战尤为显著:一是需要设计涵盖高多样性工具链(如51种多工具链)且确保轨迹可执行的样本,避免无效或中断的调用序列;二是需解决图像资源与轨迹的关联问题,包括多来源图像(原始图、SR图、多工具中间结果)的路径统一与存储优化;三是确保大规模数据(逾14万条轨迹)在不同工具调用范式下的格式一致性,同时为后续强化学习阶段提供可靠的初始策略基础。
常用场景
经典使用场景
在视觉智能体与多模态工具编排的研究浪潮中,CanvasCraftSFT为训练能够执行复杂图像创作与编辑的多模态智能体提供了高质量监督微调数据。该数据集的经典使用场景在于通过学习用户请求的推理过程、调用视觉工具的结构化参数、观察中间结果并判断何时完成图像转换,从而构建完整的智能体决策轨迹。研究者可将其作为强化学习前的初始训练阶段,利用其超14万条涵盖图像编辑、生成、OCR、定位分割等多工具链条的轨迹数据,训练智能体在复杂视觉任务中的推理-行动-观察闭环能力。
解决学术问题
该数据集精准回应了多模态大模型在工具编排领域面临的三个关键学术问题:其一是如何弥合自然语言指令与视觉工具调用之间的语义鸿沟,通过包含系统提示、用户请求、模型推理与工具调用的聊天式结构化数据,使智能体学会将抽象需求转化为具体工具操作。其二是解决了多工具链条中的状态追踪与中间结果表征难题,通过嵌入图像字节的Parquet格式,系统记录了每次工具调用后产生的视觉资产,为研究多步推理中的视觉反馈机制提供了实证基础。其三是为图像创作领域中长期存在的工具协同复杂性提供了标准化训练基准,使研究者能够系统性地探索从简单编辑到多工具协作的进阶能力获取路径。
实际应用
在实际应用层面,CanvasCraftSFT所训练的智能体可部署于多个高价值的工业化场景:在数字内容创作领域,能够根据自然语言描述自动执行从图像生成、目标定位、区域裁剪到图层叠加的全流程操作,显著提升设计师与美术创作者的工作效率。在辅助视觉编辑工具中,智能体可准确理解用户的局部修改需求(如替换特定物体、调整构图或增强分辨率),将其转化为底层工具的精确参数调用。此外,该数据集支持的多工具协调能力使其适用于自动化视觉质检、智能广告素材生成以及网页视觉内容定制等对图像精确性与流程可控性要求极高的应用场景,为多模态AI从实验室走向产业实践搭建了可靠的数据桥梁。
数据集最近研究
最新研究方向
CanvasCraftSFT作为CanvasAgent框架的监督微调子集,当前研究前沿聚焦于多模态工具编排的视觉智能体构建。该数据集通过17.28万条可执行轨迹,覆盖图像编辑、生成、OCR、定位等10类工具及51种复合工具链,为复杂视觉任务中的推理-动作-观测循环提供系统化训练范式。其设计呼应了近期多模态智能体领域的热点——工具协同调用与中间视觉状态的可解释追踪,尤其适用于推动从单步图像操作到多轮创作管线的能力跃迁。该数据集作为强化学习优化阶段的前置基石,其影响在于弥合了指令跟随与工具执行间的语义鸿沟,为下一代交互式视觉创作系统奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务