相关数据集
tsinghua-ee/video-SALMONN_2_testset
video-SALMONN 2 Benchmark数据集是一个视频到文本的任务,它要求生成与视频和音频相对应的字幕。数据集以Apache-2.0许可发布,支持英语语言。使用该数据集时,用户需要按照指定的格式组织生成的字幕,并通过提供的脚本进行评估。
Hugging Face2025-08-20 更新360
tsinghua-ee/SACRED-Bench
SACRED-Bench(语音-音频组合对抗性评估基准)是一个设计用来评估多模态大型语言模型在复杂的音频攻击下的鲁棒性的基准。它利用语音-音频组合机制来创建具有挑战性的对抗性场景,包括在良性语音下或旁边嵌入有害提示的语音重叠和多人对话,以及通过在良性语音或音频旁边加入非语音音频来暗示不安全意图的语音音频混合。此外,它还使用各种格式的开放性问题回答和是/否问题来规避仅文本的过滤器。
Hugging Face2025-11-14 更新340
tsinghua-ee/RivaBench
这个数据集是Reasoning-Intensive Video with Audio understanding Benchmark (RivaBench)的三个分区,包括Academic、StandUp和synthetic video detection。Academic和StandUp部分包含视频和音频资源,而synthetic video detection部分则提供了视频及其是否为合成的信
Hugging Face2025-05-14 更新130
tsinghua-ee/AVUTBenchmark
音频中心视频理解基准(AVUT)数据集旨在评估多模态大型语言模型(LLM)对视频的理解能力,特别关注音频信息。该数据集通过使用答案排列过滤机制来解决其他基准中存在的文本捷径问题。数据集包括两个主要的注释文件:一个由人工标注者精心创建,另一个由Gemini模型自动生成。
Hugging Face2025-09-28 更新350
tsinghua-ee/SAVEBench
--- license: apache-2.0 --- Audio: 1. LibriSpeech test clean full set 2. Audio caps test full set Video: 1. NExTQA: nextqa_test.json ID provided in the "image" field Image: 1. Flickr30k: flickr30k_c
Hugging Face2024-10-14 更新170



