ViSpeak-Instruct, ViSpeak-Bench
收藏资源简介:
ViSpeak-Instruct数据集用于训练,ViSpeak-Bench用于评估。这些数据集支持视觉指令反馈任务的研究,该任务要求模型能够主动响应视觉内容,从而增强人机交互。
ViSpeak-Instruct dataset is utilized for model training, while ViSpeak-Bench is designed for model evaluation. These datasets support research on visual instruction feedback tasks, which require models to proactively respond to visual content so as to enhance human-computer interaction.
ViSpeak 数据集概述
数据集简介
ViSpeak 是一个专注于流媒体视频理解的数据集,提出了一个名为视觉指令反馈的新任务。该任务要求模型能够感知视觉内容并从中提取指令,从而增强用户与代理之间的交互。例如,当用户向代理挥手时,代理应识别手势并开始对话。ViSpeak 数据集包括用于训练的 ViSpeak-Instruct 数据集和用于评估的 ViSpeak-Bench 数据集。
数据集内容
- ViSpeak-Instruct:用于训练的数据集,包含与视觉模态高度相关的七个关键子任务。
- ViSpeak-Bench:用于评估的基准数据集,支持对现有模型的评估结果进行分析。
模型
- ViSpeak:一个基于流媒体视频理解的大型多模态模型(LMM),具有 GPT-4o 级别的性能。该模型通过三阶段微调,保留了离线理解能力,并在流媒体视频理解基准测试中达到了 SOTA 性能。
- ViSpeak-s2 和 ViSpeak-s3:提供了两个版本的模型,分别可在 Huggingface 和 ModelScope 上获取。
实验与评估
- 离线基准测试:包括 MME、MVBench 和 Video-MME 等基准测试。
- 在线基准测试:包括 StreamingBench 和 OVO-Bench 等基准测试。
- ViSpeak-Bench:专门用于评估 ViSpeak 模型的基准测试,基于 GPT-4o 进行评估。
数据准备与训练
- 数据准备:数据集包括多个子数据集,如 FunQA、HIVAU、IntentQA、SMILE、social-iq 和 UAL-Bench 等。用户需按照指定路径组织数据。
- 训练环境:使用 PyTorch、Transformers 等工具进行训练,支持多节点分布式训练。
引用
如果使用 ViSpeak 数据集或模型,请引用以下论文: bibtex @article{fu2025vispeak, title={ViSpeak: Visual Instruction Feedback in Streaming Videos}, author={Fu, Shenghao and Yang, Qize and Li, Yuan-Ming and Peng, Yi-Xing and Lin, Kun-Yu and Wei, Xihan and Hu, Jian-Fang and Xie, Xiaohua and Zheng, Wei-Shi}, journal={arXiv preprint arXiv:2503.12769}, year={2025} }
许可证
- 模型和代码遵循 Apache License 2.0。
- 自收集的视频数据遵循 CC BY-NC-SA 4.0 许可证。




