video-SALMONN-o1
收藏资源简介:
这是一个为增强大型语言模型在视频理解任务上的推理能力而开发的开源推理增强音频视觉LLM。该数据集包含具有挑战性的音频视觉问题及其逐步解答。
This is an open-source reasoning-enhanced audio-visual LLM developed to improve the reasoning capabilities of large language models in video understanding tasks. The dataset includes challenging audio-visual questions and their step-by-step solutions.
video-SALMONN-o1 数据集概述
摘要
video-SALMONN-o1是一个开源的推理增强型音频视觉语言模型,专为通用视频理解任务设计。该数据集包含具有挑战性的音频视觉问题及其逐步解答,用于增强模型的推理能力。研究还提出了过程直接偏好优化(DPO)方法,用于对比步骤选择,实现针对多模态输入的步骤级奖励模型的效率。此外,介绍了AVRBench,这是一个全面的音频视觉推理基准,包含超过4000个专家策划的高质量问答对。video-SALMONN-o1在不同视频推理基准上比LLaVA-OneVision基线提高了3-8%的准确性。过程DPO相比仅SFT模型也实现了6-8%的提升。增强的推理能力使得video-SALMONN-o1具备了零样本合成视频检测的能力。
数据集组成
- 包含挑战性的音频视觉问题和逐步解答。
- AVRBench基准,包含不同场景下的4000个高质量问答对,如单口喜剧、学术演讲和合成视频检测。
示例问题与解答流程
-
问题:演讲者在视频结尾说“他不需要知道那件事”时暗示了什么?
- 答案:B. 当你想吃东西时,只需吃,不必优先考虑卡路里。
-
问题:当他被炮塔击中时,图例上显示的是什么?
- 答案:D. 火。
-
问题:视频中没有出现以下哪个元素?
- 答案:B. 月亮。
-
问题:一个由AI生成的视频包含不自然的扭曲事物,如扭曲的手或脸。给定的视频是AI生成的吗?
- 答案:是。
-
问题:一个由AI生成的视频包含不自然的扭曲事物,如扭曲的手或脸。给定的视频是AI生成的吗?
- 答案:是。
模型检查点、训练与推理
- 模型检查点、训练和推理的详细信息即将公布。




