VoiceAssistant-Eval
收藏资源简介:
VoiceAssistant-Eval是一个用于评估AI助手在听、说、看等多模态能力方面的基准测试数据集。它解决了现有基准测试的四个关键弱点:缺乏语音个性化评估、对手持自由交互关注有限、忽视真实世界音频环境以及视觉+音频多模态评估不足。该数据集包含多样化的任务,涵盖音频理解、视觉问答和多模态推理等,旨在推动下一代AI助手的平衡发展。
VoiceAssistant-Eval is a benchmark dataset for evaluating the multimodal capabilities of AI assistants across listening, speaking, and visual comprehension. It addresses four critical shortcomings of existing benchmark datasets: lack of personalized speech evaluation, limited attention to free-form interaction on handheld devices, neglect of real-world audio environments, and insufficient vision-audio multimodal evaluation. This dataset includes diverse tasks covering audio understanding, visual question answering, multimodal reasoning and more, aiming to promote the balanced development of next-generation AI assistants.
VoiceAssistant-Eval 数据集概述
数据集基本信息
- 数据集名称: VoiceAssistant-Eval
- 官方论文: VoiceAssistant-Eval: Benchmarking AI Assistants across Listening, Speaking, and Viewing
- 数据规模: 10,497个精心策划的示例
- 任务类别: 13个任务类别
- 主页地址: https://mathllm.github.io/VoiceAssistantEval/
- HuggingFace数据集: https://huggingface.co/datasets/MathLLMs/VoiceAssistant-Eval
核心特点与创新
解决现有基准的四个关键弱点
- W1: 缺乏语音个性化评估 - 测试模型模仿特定声音的能力
- W2: 对免提交互关注有限 - 强调真正的语音优先、免提使用
- W3: 忽视真实世界音频上下文 - 涵盖多样化、现实的音频环境
- W4: 多模态(视觉+音频)评估不足 - 测试联合语音和视觉输入
评估维度
- 听(Listening): 自然声音、音乐和口语对话
- 说(Speaking): 多轮对话、角色扮演模仿和各种场景
- 看(Viewing): 高度异构的图像理解
任务构成
- 听任务: 通用、音乐、声音、语音
- 说任务: 助手、情感、指令遵循、多轮、推理、鲁棒性、角色扮演、安全
- 看任务: 多学科
评估模型
专有模型
- GPT-4o-Audio
开源模型(21个)
- Qwen2.5-Omni-7B
- MiniCPM-o-2_6
- Baichuan-Omni-1d5
- Kimi-Audio
- Step-Audio
- Step-Audio-2-mini
- GLM-4-Voice
- LLaMA-Omni2-32B-Bilingual
关键发现
- 专有模型并不普遍优于开源模型
- 大多数模型在说话任务上表现出色,但在音频理解方面滞后
- 设计良好的较小模型可以与更大的模型相媲美
- Step-Audio-2-mini (7B)的听力准确率是LLaMA-Omni2-32B-Bilingual的两倍多
- 20个模型在说话任务上的得分高于听力任务
评估框架
三元评估系统
- 内容质量: 响应准确性、帮助性和适当性
- 语音质量: 音频自然度和流畅度
- 一致性: 预期内容与实际语音输出的对齐度
最终得分计算
最终得分 = 内容得分 × 语音得分 × 一致性得分 × 100%
技术实现
评估组件
- 情感分析: emotion2vec_plus_large模型
- 说话人相似度: WeSpeaker voxblink2_samresnet100_ft模型
- 内容质量评估: gpt-oss-20b模型
- 语音质量评估: UTMOS22_strong模型
- 一致性评估: Whisper-Large-v3转录 + 改进的WER计算
排行榜
- 官方排行榜: https://mathllm.github.io/VoiceAssistantEval/#leaderboard
- 详细排行榜: https://mathllm.github.io/VoiceAssistantEval/#detailedleaderboard
- 角色扮演排行榜: https://mathllm.github.io/VoiceAssistantEval/#roleplayleaderboard




