遇见数据集

OpenVisTool-42K

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

OpenVisTool-42K 是一个包含42,048条经过结果验证和工具使用增益过滤的视觉工具使用轨迹数据集。数据集涵盖图表(Chart)、GUI定位(GUI Grounding)、表格(Table)、网页转HTML(Web-to-HTML)和视觉搜索(Visual Search)五个领域。每条轨迹以ms-swift智能体格式保存,包含教师模型的推理过程、函数调用、工具观察结果和最终答案。数据记录为JSONL格式,每个对象包含id(稳定标识符)、domain(领域)、tools(JSON编码的函数模式)、messages(按顺序排列的智能体消息,包括system、user、assistant、tool_call、tool_response角色)和images(相对于快照根目录的图片路径列表,与消息中的<image>标记一一对应)。数据来源包括ChartVerse-SFT-600K、AgentNet、OS-Atlas、UGround、CoSyn-400K、TABLET-Small、DeepEyesV2-RL、Vero-600K和VinciCoder-1.6M-SFT等多个上游数据集,各自适用的许可证延续适用。该数据集适用于多模态工具使用、智能体视觉推理、视觉问答等任务。

OpenVisTool-42K is a dataset of 42,048 visual tool-use trajectories filtered by result verification and tool-use gain. It covers five domains: Chart, GUI Grounding, Table, Web-to-HTML, and Visual Search. Each trajectory is saved in the ms-swift agent format, containing the teacher models reasoning process, function calls, tool observations, and final answers. The data is recorded in JSONL format, with each object including id (stable identifier), domain, tools (JSON-encoded function schema), messages (ordered agent messages with roles system, user, assistant, tool_call, tool_response), and images (list of image paths relative to the snapshot root, corresponding one-to-one with <image> tokens in messages). Data sources include upstream datasets such as ChartVerse-SFT-600K, AgentNet, OS-Atlas, UGround, CoSyn-400K, TABLET-Small, DeepEyesV2-RL, Vero-600K, and VinciCoder-1.6M-SFT, with their respective licenses continuing to apply. The dataset is suitable for tasks such as multimodal tool use, agent visual reasoning, and visual question answering.

创建时间:
2026-08-07
原始信息汇总

OpenVisTool-42K 数据集概述

基本信息

  • 数据集名称:OpenVisTool-42K
  • 规模:42,048 条轨迹(10K < n < 100K)
  • 语言:英语
  • 许可证:其他(需遵循上游数据集许可条款)
  • 任务类型:图像-文本到文本(image-text-to-text)
  • 标签:多模态、工具使用、智能体视觉、视觉推理

数据内容

数据集包含五种领域的视觉工具使用轨迹,每条轨迹保留教师的推理过程、函数调用、工具观察结果和最终答案,格式遵循 ms-swift 智能体格式:

领域 记录数
图表 (Chart) 13,537
GUI 定位 (GUI Grounding) 11,000+
表格 (Table) 4,930
网页转 HTML (Web-to-HTML) 10,674
视觉搜索 (Visual Search) 1,941

数据格式

每条记录为一行 JSON 对象,包含以下字段:

  • id:稳定 ID
  • domain:所属领域
  • tools:JSON 编码的函数模式字符串
  • messages:按顺序排列的智能体消息,角色包括 system、user、assistant、tool_call、tool_response
  • images:相对于快照根目录的图片路径,与消息中的 <image> 标记按顺序对应

数据来源

仅使用源数据集中的图片和查询作为任务输入,不采用预先存在的推理轨迹作为监督。轨迹由教师模型生成,并通过结果有效性和工具使用增益筛选:

领域 来源数据集 许可证
图表 ChartVerse-SFT-600K Apache 2.0
GUI 定位 AgentNet MIT
GUI 定位 OS-Atlas Apache 2.0
GUI 定位 UGround CC BY-NC-SA 4.0
表格 CoSyn-400K ODC-BY 1.0
表格 TABLET-Small CC BY 4.0
视觉搜索 DeepEyesV2-RL 未指定
视觉搜索 Vero-600K Apache 2.0
网页转 HTML VinciCoder-1.6M-SFT 未指定

使用说明

消息中的路径(如 /mnt/data/example.png)为智能体沙箱中的运行时路径,非下载快照路径,训练时不应改写。工具生成的剪裁、掩码、边界框可视化和 HTML 渲染图作为训练轨迹中的观测随原始输入一同打包,其衍生内容受原始图像语料库条款约束。

搜集汇总
数据集介绍
OpenVisTool-42K 数据集图片
构建方式
在视觉推理与工具智能体交叉领域,构建兼具轨迹有效性与工具增益的训练语料已成为提升多模态模型执行能力的关键。OpenVisTool-42K以Chart、GUI Grounding、Table、Web-to-HTML与Visual Search五类任务为对象,仅采用源数据集提供的图像与查询作为任务输入,摒弃既有推理轨迹的监督信号。全部42,048条轨迹由Qwen3.5-Plus教师模型合成,其中推理过程、函数调用与最终答案由教师模型生成,工具观测则通过实际执行对应工具获得,并以ms-swift智能体格式统一保存,最终依据结果有效性与实测工具增益双重标准完成筛选。
特点
该数据集在结构设计与内容组织上呈现出鲜明的工具增强视觉推理特征。每条样本完整保留教师的推理链条、函数调用、工具观测与最终答案,涵盖system、user、assistant、tool_call与tool_response五类角色消息。数据规模介于一万至十万条之间,领域标注明确区分五种任务类型,工具模式以JSON编码字符串形式存储并提供解码副本。图像路径与消息中每一次<image>标记按序对齐,同一图像被多次观察时重复记录亦被有意保留,从而真实反映智能体反复查看与验证的交互过程。
使用方法
使用该数据集时,研究者可借助ms-swift框架直接加载data目录下的JSONL文件,并依据默认配置进行训练。每条JSON对象中的messages字段按序还原完整的智能体交互流程,tools字段提供函数模式以支撑工具调用解析,images字段则以快照根目录为基准定位全部视觉输入。需注意消息中出现的沙箱运行时路径不应在训练阶段被重写,而工具生成的裁剪图、掩码、边界框可视化与HTML渲染结果已随原始输入一并打包,可直接作为工具观测参与监督学习。
背景与挑战
背景概述
多模态大模型对视觉工具调用能力的习得长期受制于高质量轨迹数据的稀缺,现有资源多聚焦单一任务,难以支撑跨域泛化。OpenVisTool-42K于2025年前后由研究团队构建,依托Qwen3.5-Plus作为教师模型合成42,048条结果有效且经工具增益筛选的视觉工具使用轨迹,覆盖图表理解、GUI定位、表格处理、网页转HTML与视觉搜索五大领域。该数据集以ms-swift智能体格式完整保留推理过程、函数调用、工具观测与最终答案,为视觉智能体研究提供了可复用的开放配方,推动了工具增强型多模态推理范式的实证探索。
当前挑战
视觉工具使用所面临的领域问题在于,模型需在开放视觉场景中自主判断何时调用何种工具,并将工具返回的观测无缝融入推理链条,这对跨模态对齐与长程规划构成严峻考验。构建过程中,工具观测的获取依赖真实执行而非模型臆造,如何保证轨迹的结果有效性与工具增益,成为筛选的核心难题。同时,数据来源跨越多种许可协议与上游语料,衍生图像标注与渲染结果需在合规前提下打包分发,进一步加剧了数据治理的复杂性。
常用场景
经典使用场景
多模态智能体领域的核心挑战之一在于如何让视觉语言模型学会自主调用外部工具完成复杂感知任务。OpenVisTool-42K以42,048条经过结果有效性与工具增益双重过滤的视觉工具使用轨迹,覆盖图表解析、图形界面定位、表格理解、网页转HTML以及视觉搜索五大任务域,每条轨迹完整保留教师模型的推理链、函数调用、工具观测与最终答案,成为训练和评测视觉工具使用智能体最具代表性的数据资源。研究者通常直接以ms-swift智能体格式载入该数据集,借助监督微调使模型习得在推理过程中动态调用裁剪、渲染、检索等工具的行为模式,从而突破纯端到端视觉推理在细粒度感知上的固有瓶颈。
衍生相关工作
作为OpenVisTool合成配方论文的配套数据资源,该数据集直接催生了一系列围绕视觉工具使用轨迹合成与过滤的后续研究。其提出的结果有效性与工具增益筛选标准被后续工作广泛借鉴,用于构建更大规模或面向特定领域的工具使用数据集。基于该数据集微调的智能体模型在图表问答、GUI定位与视觉搜索等基准上展现出显著提升,进而激发了关于工具调用策略、观测压缩以及多轮工具编排的新一轮探索,与DeepEyes、Vero、UGround等源头工作共同构成了视觉智能体数据生态的重要一环。
数据集最近研究
最新研究方向
在多模态智能体与视觉推理交叉领域,工具增强型视觉语言模型正成为前沿探索的焦点。OpenVisTool-42K凭借覆盖图表理解、界面定位、表格解析、网页转HTML及视觉搜索五大任务的四万余条经结果有效性与工具增益双重过滤的轨迹数据,为智能体在复杂视觉场景中习得可解释的工具调用策略提供了系统化训练资源。该数据集以教师模型合成推理链与真实工具执行观测相结合的方式,规避了对既有标注轨迹的监督依赖,推动了视觉工具使用从启发式提示向可验证、可泛化的学习范式演进。其构建思路呼应了当前学术界对智能体推理透明度与执行可靠性的双重关切,为后续研究在跨域工具编排、观测反馈建模及轨迹质量评估等方向奠定了可复现的实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务