遇见数据集

Visual_Agent

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

Visual_Agent 是一个用于视觉工具使用的训练轨迹数据集,其特点在于包含了便携式的图像引用。数据集包含总计 3,679 条训练轨迹,这些轨迹来源于两部分:一部分是 2,187 条基于 DeepEyesV2 衍生的轨迹,涵盖了计数、空间关系和属性相关的任务;另一部分是 1,492 条经过单独评审的 P2R Natural V2 轨迹。所有数据被整合在一个名为 all_training_trajectories_with_images.jsonl 的便携式 JSONL 文件中,其中操作所需的图像路径均相对于 training_trajectories_natural/ 目录。该数据集旨在支持与视觉工具使用相关的机器学习训练任务。

Visual_Agent is a training trajectory dataset for visual tool usage, characterized by including portable image references. The dataset contains a total of 3,679 training trajectories, sourced from two parts: one part consists of 2,187 trajectories derived from DeepEyesV2, covering tasks related to counting, spatial relationships, and attributes; the other part consists of 1,492 individually reviewed P2R Natural V2 trajectories. All data is consolidated in a portable JSONL file named all_training_trajectories_with_images.jsonl, where the image paths required for operations are relative to the training_trajectories_natural/ directory. This dataset aims to support machine learning training tasks related to visual tool usage.

创建时间:
2026-07-07
原始信息汇总

数据集概述

  • 数据集名称:Visual_Agent
  • 许可证:CC-BY-NC 2.0(非商业用途)
  • 数据集来源:Hugging Face(https://huggingface.co/datasets/albert13200/Visual_Agent)

数据集内容

Visual_Agent 是一个包含视觉工具使用训练轨迹的数据集,所有图像引用均为便携式路径格式。训练数据由两个子集组成,总共有 3,679 条轨迹

训练轨迹来源

  1. DeepEyesV2 衍生轨迹:共 2,187 条,涵盖计数、空间关系和属性相关的任务轨迹。
  2. P2R Natural V2 轨迹:共 1,492 条,位于 p2r_v2/ 子目录下,每条轨迹均经过单独审核。

数据组织

  • 所有训练轨迹合并存放于统一文件:training_trajectories_natural/all_training_trajectories_with_images.jsonl
  • 数据集中所有操作性的图像路径均为相对路径,相对基准目录为 training_trajectories_natural/

使用说明

数据集包含图像引用,使用时需要相对于 training_trajectories_natural/ 目录解析图像路径。数据集仅限非商业用途(CC-BY-NC 2.0)。

搜集汇总
数据集介绍
Visual_Agent 数据集图片
构建方式
Visual_Agent数据集旨在为视觉工具使用场景提供训练轨迹,其构建融合了多源数据与严格质控。数据集包含3,679条训练轨迹,其中2,187条源自DeepEyesV2,覆盖计数、空间关系及属性识别等核心视觉任务;剩余1,492条来自经人工逐一审核的P2R Natural V2轨迹,存放于p2r_v2/子目录中。所有轨迹被整合为单一JSON Lines文件,图像路径均设为相对路径,确保便携性与结构一致性。
特点
该数据集的核心亮点在于其兼具规模与多样性的高质量训练样本。DeepEyesV2衍生的轨迹专注于细粒度视觉推理,而P2R Natural V2轨迹则经人工核验,保证了真实性与可靠性。整体采用便携式图像引用设计,相对路径的运用使得数据集在不同环境中易于迁移与复用,降低了部署门槛。
使用方法
使用Visual_Agent数据集时,用户可直接加载training_trajectories_natural/目录下的all_training_trajectories_with_images.jsonl文件。由于所有图像路径均为相对路径,需确保运行时的工作目录指向该目录或进行相应配置。数据集适用于视觉语言模型的工具调用训练,尤其适合需要结合图像理解与动作决策的研究场景。
背景与挑战
背景概述
Visual_Agent数据集创建于近年来,由DeepEyesV2研究团队主导开发,旨在推动视觉工具使用领域中智能代理的自主决策能力。该数据集聚焦于将视觉信息与自然语言指令相结合,构建复杂的多步操作轨迹,以模拟智能体在真实场景中执行空间推理、属性识别与计数任务的过程。通过整合2,187条DeepEyesV2衍生的轨迹与1,492条经过人工审核的P2R Natural V2轨迹,Visual_Agent为机器学习模型提供了高质量的视觉交互范例,对于提升代理在视觉环境中的工具调用与任务规划能力具有重要影响。
当前挑战
Visual_Agent所解决的领域问题在于视觉语言模型中代理工具使用能力的匮乏,传统模型难以在视觉指导下完成多步推理与操作。构建过程中,挑战包括确保轨迹中图像引用的便携性与相对路径的可靠性,避免因资源移动导致数据失效;同时,来自不同源的轨迹(如DeepEyesV2自动生成与P2R V2人工审核)在格式与语义一致性上需严格对齐,以防止噪声干扰训练效果。此外,数据规模有限(3,679条轨迹)对模型的泛化能力提出了更高要求,需谨慎设计数据增强与验证策略以平衡过拟合风险。
常用场景
经典使用场景
Visual_Agent数据集在视觉智能体研究中扮演着基石角色,常用于训练和评估具备视觉感知与工具调用能力的多模态智能体。研究人员利用该数据集中丰富的空间计数、属性识别等自然轨迹数据,结合便携图像引用机制,构建能够自主完成视觉任务并调用外部工具的智能系统。该数据集的核心应用场景涵盖视觉问答、目标定位与计数、属性推理等任务,为开发具有环境感知和工具操作能力的复合型视觉智能体提供了标准化的训练基准。
解决学术问题
该数据集有效解决了视觉智能体研究中两个关键学术难题:一是缺乏高质量、多样化的视觉工具使用训练轨迹数据,二是图像引用与操作路径的标准化问题。通过提供DeepEyesV2和P2R Natural V2两种来源的轨迹数据,Visual_Agent显著降低了视觉推理与工具调用任务的训练门槛,推动了多模态学习、视觉推理和人机交互等领域的理论发展。其便携图像引用设计更是为跨数据集的迁移学习与模型泛化研究提供了重要支撑。
衍生相关工作
Visual_Agent数据集的发布催生了一系列具有影响力的学术工作,包括基于该数据集改进的视觉推理模型架构、多模态工具调用方法,以及视觉智能体评估基准。研究者们利用其轨迹数据开发了更高效的视觉语言指令微调策略,探索了不同任务间的知识迁移机制,并衍生出针对复杂场景的视觉工具组合规划算法。这些后续工作进一步拓展了视觉智能体在动态环境中的自适应能力,推动了人机协同智能的边界延伸。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务