遇见数据集

VoxMem

收藏
github2026-09-29 更新2026-10-01 收录
数据链接:
官方服务:

资源简介:

VoxMem是一个用于评估大型音频语言模型多模态记忆的基准数据集,涵盖语音语义、说话人身份、副语言线索和环境声音四种声学证据类型,以及信息提取、多会话推理、时间演化追踪和答案拒绝四种记忆操作,包含多会话口述历史,上下文长度从8K到64K tokens。

VoxMem is a benchmark dataset for evaluating multimodal memory of large audio-language models. It covers four types of acoustic evidence: speech semantics, speaker identity, paralinguistic cues, and environmental sounds, as well as four memory operation tasks: information extraction, multi-session reasoning, temporal evolution tracking, and answer refusal. The dataset includes multi-session oral histories, with context lengths ranging from 8K to 64K tokens.

创建时间:
2026-09-15
原始信息汇总

VoxMem 数据集概述

基本信息

  • 名称:VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models
  • 作者:Yang Xiao、Vidhyasaharan Sethu、Eun-Jung Holden、Ting Dang
  • 机构:University of Melbourne、University of New South Wales、AIMS Lab
  • 论文:arXiv:2609.32607
  • 发布时间:2026-09
  • 数据集地址:https://huggingface.co/datasets/AudioMemory/voxmembench
  • 项目主页:https://swagshaw.github.io/voxmem/
  • 代码许可:MIT
  • 数据许可:CC BY-NC 4.0

核心目标

评估大音频语言模型(LALMs)对多会话语音历史的记忆能力,不仅关注模型是否记住“说了什么”,还关注是否记住“谁说的”、“怎么说的”以及“听到了什么”——即仅存在于音频信号中、无法从文本转录中恢复的信息。

数据集规模

指标 数值
评估实例 3,196(799 问题 × 4 种上下文长度)
语音会话 34,743(177 小时音频)
上下文预算 8K、16K、32K、64K tokens
有效分类单元 15 个(证据类型 × 记忆操作)
评估模型 15 个 LALMs(5 个专有模型、10 个开源模型)

评估框架

两个评估维度

声学证据类型(Acoustic evidence)——需要恢复什么:

类型 含义
speech_semantics 用户说了什么
speaker_information 谁在说话
paralinguistic_information 怎么说的——声音表现
environmental_sound 用户周围能听到什么

记忆操作(Memory operation)——如何使用:

操作 含义
information_extraction (IE) 从单个会话中恢复一个事实
multi_session_reasoning (MSR) 跨会话整合证据
temporal_evolution_tracking (TET) 追踪某事物随时间的变化
answer_refusal (AR) 识别历史记录中不包含答案

两个维度交叉得到 15 个有效单元,其中 speech_semantics × information_extraction 被有意留空。

排行榜(32K 参考预算,总体准确率 %)

排名 模型 类型 语义 说话人 副语言 环境声 总体
1 Qwen3.8-Omni-Flash 专有 60.3 42.2 25.4 25.0 38.5
2 Gemini-3.1-Pro 专有 68.5 29.3 19.7 21.2 35.9
3 Gemini-3.8-Flash 专有 54.3 41.5 20.8 19.2 34.0
4 Qwen3.5-Omni-Plus 专有 56.0 31.3 19.3 23.7 33.0
5 Qwen3-Omni-30B-A3B 开源 38.4 25.2 20.1 18.6 26.0
6 Ultravox-v0.6-Llama-3.1-8B 开源 35.3 31.3 15.5 17.3 24.5
7 Gemini-2.5-Pro 专有 38.8 19.0 14.8 20.5 23.7
8 Gemma-4-E4B-it 开源 35.8 29.3 14.0 16.7 23.7
9 Baichuan-Audio-7B 开源 30.6 35.4 13.3 13.5 22.4
10 MiniCPM-o-4.5 开源 31.0 28.6 11.4 18.6 21.7
11 Audio-Flamingo-Next 开源 31.9 23.8 15.2 13.5 21.3
12 FireRedAudio-9B 开源 28.9 25.9 15.2 14.7 21.0
13 Phi-4-Multimodal 开源 27.6 27.9 14.0 13.5 20.4
14 MiMo-Audio-7B-Instruct 开源 27.2 23.1 13.3 18.6 20.2
15 Baichuan-Omni-1.5-7B 开源 28.9 17.0 12.9 10.3 17.8
专有模型均值(5) 55.6 32.7 20.0 21.9 33.0
开源模型均值(10) 31.6 26.7 14.5 15.5 21.9

关键发现

  1. 当前 LALMs 远未实现可靠的语音对话记忆。32K 下无模型总体超过 40%,最优仅 38.5%。
  2. 非词汇声学信息的可及性远低于语音语义。专有模型在语义上平均 55.6%,但在说话人、副语言、环境证据上仅为 32.7%、20.0%、21.9%。
  3. 难度同时取决于操作与证据类型。时序追踪对语义有效(44.5%),但对副语言(3.4%)和环境(1.2%)证据近乎崩溃。
  4. 答案拒绝与作答表现出不同的模式:模型恰好在难以利用声学证据之处更容易成功弃答。
  5. 随着历史增长,对同一证据的获取能力下降,且不同证据类型下降速率不同。
  6. 错误特征存在质的差异。说话人错误多为绑定失败(48%);副语言错误多为定位失败(63%)。

数据结构与配置

每个数据行即一个基准项目,包含运行所需的全部内容——有序的会话历史、内联用户音频片段以及口述问题。数据集提供以下配置:

配置 条目数 8K 16K 32K 64K
<length> 799 4.03 GB 7.72 GB 15.38 GB 32.83 GB
<length>_speech_semantics 232 1.19 GB 2.26 GB 4.50 GB 9.18 GB
<length>_speaker_information 147 0.73 GB 1.41 GB 2.80 GB 6.52 GB
<length>_paralinguistic_information 264 1.33 GB 2.55 GB 5.12 GB 10.38 GB
<length>_environmental_sound 156 0.79 GB 1.50 GB 2.96 GB 6.75 GB

<length> 为 8k、16k、32k 或 64k。

提示词构成

模型输入依次为:系统提示词、按顺序排列的历史记录、口述问题。每个会话以用户轮次开头,先以文本形式给出 Session timestamp: ...,随后是该轮次的音频;后续用户轮次仅含音频,助手轮次为文本。运行器绝不会将转录文本放入提示词中。

评分方式

  • 指标:准确率,分为两个永不合并平均的层:
    • answerable(2,676 项):当响应在答案归一化下与 gold_json 含义相同时判为正确。
    • answer_refusal(520 项):当响应表示证据不足时判为正确。
  • 使用 LLM 判官判定等价性,判官仅看到问题、金标准与响应,不接触音频与历史。
  • 报告还按上下文长度和 15 个证据类型 × 记忆操作单元细分准确率。

输出格式

predictions.jsonl,每项一个对象,包含评分所需的全部信息,示例如下:

json {"item_id": "q_00006_8k", "question_id": "q_00006", "context_length": "8K", "evidence_type": "speaker_information", "memory_operation": "temporal_evolution_tracking", "expected_response": "answer", "gold_json": "[...]", "answer_type": "ordered_list", "response": "...", "n_audio_clips": 51, "verdict": true, "judge": "gpt-4o-mini"}

基准设计要点

  • 上下文长度:每个问题在 8K、16K、32K、64K 四个音频 token 长度下出现,共享同一 question_id,问题、金标准和证据完全一致,仅周围历史增长,且历史嵌套(sessions(8K) ⊆ sessions(16K) ⊆ ...)。
  • 干扰项:每个历史按会话标注——evidence(证据会话)、samekey_haystack(共享检索键、仅靠问题指定的选择器排除)、topical_haystack(共享主题但不共享查询属性)、filler。

引用

bibtex @article{xiao2026voxmem, title = {VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models}, author = {Xiao, Yang and Sethu, Vidhyasaharan and Holden, Eun-Jung and Dang, Ting}, journal = {arXiv preprint arXiv:2609.32607}, year = {2026} }

搜集汇总
数据集介绍
VoxMem 数据集图片
构建方式
在语音对话系统需回溯多轮交互记忆的背景下,VoxMem以真实多会话语音历史为基础构建评测基准。其构建围绕两个正交维度展开:声学证据类型(语音语义、说话人身份、副语言线索、环境声音)与记忆操作(信息抽取、多会话推理、时间演化追踪、答案拒答)。数据汇集34,743个会话、约177小时音频,形成799道问题,并在8K、16K、32K、64K四种音频令牌预算下对同一问题固定其证据,仅扩展嵌套的干扰会话历史,最终生成3,196个评测实例,覆盖15个有效证据与操作交叉单元。
使用方法
使用者通过run_voxmembench.py从Hugging Face Hub按配置拉取数据,选择整体或按证据类型切分的8k至64k切片,并以--streaming跳过本地下载。评测可接入OpenAI兼容API或本地模型适配器,适配器以函数形式接收含音频路径或数组的消息列表并返回文本。运行需启用--allow-abstention以支撑答案拒答分层,评分由score_voxmembench.py借助LLM裁判完成,输出按答案可答与拒答两层及15个证据操作单元分别报告准确率,并支持断点续跑与矩阵化提交。
背景与挑战
背景概述
随着大音频语言模型(Large Audio Language Models, LALMs)在语音理解与对话系统中的迅速发展,模型对于跨会话语音历史中长期记忆能力的评估需求愈发迫切。现有基准多聚焦于文本语义或单轮音频理解,难以刻画真实听感场景中语义、说话人身份、副语言特征与环境声音等多模态信息的综合记忆。VoxMem由墨尔本大学与UNSW的研究者于2026年提出,首次将四种声学证据类型与四种记忆操作交叉,构建了覆盖8K至64K token的多会话语音历史基准,对15个主流LALMs进行系统评测,揭示其在非词汇声学记忆上的显著短板,为音频语言模型的记忆机制研究提供了重要诊断工具。
当前挑战
VoxMem所应对的领域问题在于,现有音频语言模型能否在长程多会话语音历史中不仅记住“说了什么”,还能记住“谁在说”“如何说”以及“周围有何声响”,这些信息仅存于音频信号而无法从转写文本中恢复。构建过程中面临多重挑战:需设计涵盖语音语义、说话人、副语言与环境声音四类证据与信息抽取、多会话推理、时序演化追踪、答案拒答四类操作交叉的15个有效评测单元;需确保同一问题在8K至64K四种上下文长度下问题与证据固定而仅历史干扰递增;需构造同键与同主题干扰会话以抑制表层词汇检索;尚需解决多音频输入下部分模型生成异常与KV缓存不匹配等工程难题,以保证评测的公平性与可比性。
常用场景
经典使用场景
在语音对话系统与长时程多模态记忆研究领域,VoxMem构筑了一座针对大型音频语言模型记忆能力的严苛试验场。其经典使用场景在于,以多会话语音历史为输入,强迫模型在8K至64K音频标记的膨胀上下文中,同时完成信息抽取、多会话推理、时序演化追踪与答案拒答四类记忆操作,并跨越语音语义、说话人身份、副语言线索与环境声音四种声学证据。每条评测项均绑定固定的问题与证据,仅令周围干扰性历史随长度嵌套增长,从而将记忆衰减与检索鲁棒性置于纯净的受控实验条件之下。
解决学术问题
该数据集直面语音对话记忆研究中的核心空白:既往评测多聚焦于语义内容转录后的文本记忆,却系统性忽略了说话人、副语言与环境声等仅存于音频信号、无法由文字恢复的非词汇信息。VoxMem通过构建十五个有效证据与操作交叉单元,并引入同键干草堆与主题干草堆干扰,解决了长上下文下声学证据可及性下降速率难以量化、不同证据类型记忆衰退模式无法分离等学术难题。其意义在于揭示当前音频语言模型在声学记忆中远未达可靠水平,为多模态记忆机制研究提供了诊断工具与基准标尺。
实际应用
在真实应用层面,VoxMem为智能语音助手、会议记录系统、客服对话分析与情感陪伴机器人等需要对跨会话语音历史进行回溯的场景提供了评测与优化依据。这些系统不仅需记住用户说过什么,更需辨识谁在何时以何种语气说了何话,以及彼时环境中有何声响。基准所揭示的模型在说话人绑定、副语言定位与环境声音利用上的显著短板,直接指导工程实践中记忆模块的检索键设计、音频编码器容量分配与拒答策略的训练,从而提升长时程语音交互的可靠性与可信度。
数据集最近研究
最新研究方向
面向大音频语言模型的多模态长时记忆评测正从单一语义回忆转向对声学证据的多维追踪与跨会话推理。VoxMem以语音语义、说话人身份、副语言特征与环境声四类声学证据为轴,交叉信息抽取、多会话推理、时序演变追踪与答案拒答四类记忆操作,构建了覆盖8K至64K音频令牌的多会话口语历史基准,揭示现有模型在非词汇声学信息上的记忆能力显著滞后于言语内容,并暴露其随历史增长而急剧衰减的检索瓶颈。该工作为口语对话系统的记忆机制设计、长上下文建模与拒答校准提供了统一的诊断框架,推动了音频语言模型从转录理解迈向真正的多模态听觉记忆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务