MM-Traj
收藏资源简介:
MM-Traj数据集由北京大学智能科学与技术学院等机构创建,包含20,000个多模态任务,涵盖15,000个文件,主要用于工具使用轨迹的生成和验证。数据集通过自动化的查询生成、文件生成和轨迹生成流程创建,确保了数据的高质量和多样性。该数据集主要用于提升视觉-语言模型在实际任务中的工具使用能力,特别是在复杂和多样的轨迹处理方面。
The MM-Traj dataset was created by the School of Intelligence Science and Technology of Peking University and other institutions. It comprises 20,000 multimodal tasks covering 15,000 files, and is primarily used for the generation and verification of tool-use trajectories. The dataset is developed through automated workflows including query generation, file generation and trajectory generation, which ensures its high quality and diversity. It is mainly designed to enhance the tool-use capabilities of vision-language models in real-world tasks, especially in handling complex and diverse trajectories.
数据集概述
数据集名称
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage
数据集简介
该数据集用于多模态代理调优,旨在构建一个由视觉语言模型(VLM)驱动的代理,以实现高效的工具使用。通过自动生成多模态工具使用数据并调优视觉语言模型,该数据集包含20K任务的工具使用轨迹,用于提升工具使用推理能力。
数据集关键信息
- 数据集名称: MM-Traj
- 数据集规模: 包含20K任务的工具使用轨迹
- 数据生成方法: 使用GPT-4o mini模型生成查询、文件和轨迹,并通过查询-文件和轨迹验证器进行数据质量保证
- 应用场景: 用于调优视觉语言模型(VLM),提升工具使用推理能力
- 评估基准: GTA和GAIA
- 性能提升: 在MiniCPM-V-8.5B和Qwen2-VL-7B模型上,T3-Agent的性能比未训练的VLM提升了20%
作者信息
- Zhi Gao: 1,2 ★
- Bofei Zhang: 2 ★
- Pengxiang Li: 2,3 ★
- Xiaojian Ma: 2
- Yue Fan: 2
- Tao Yuan: 2
- Yuwei Wu: ✉3,4
- Yunde Jia: 4,3
- Song-Chun Zhu: 1,2,5
- Qing Li: ✉2
机构信息
- 1: Peking University
- 2: Beijing Institute for Artificial General Intelligence
- 3: Beijing Institute of Technology
- 4: Shenzhen MSU-BIT University
- 5: Tsinghua University
相关链接

- 1Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage北京大学智能科学与技术学院,通用人工智能国家重点实验室,北京理工大学智能信息技术北京市重点实验室,深圳MSU-BIT大学机器感知与智能计算广东省实验室,清华大学自动化系 · 2024年



