遇见数据集

INSPIRE

收藏
github2026-08-18 更新2026-08-20 收录
数据链接:
官方服务:

资源简介:

一个用于通过自然语言指令检索口语文档的基准数据集,这些指令描述内容、说话人身份、说话风格、环境声音或这些属性的组合。

A benchmark dataset for retrieving spoken documents via natural language instructions, where the instructions describe content, speaker identity, speaking style, ambient sounds, or combinations of these attributes.

创建时间:
2026-08-17
原始信息汇总

INSPIRE: 指令感知语音检索基准数据集

数据集概述

INSPIRE 是一个用于评估指令感知语音检索(Instruction-Aware Speech Retrieval)的基准数据集。给定一段语音查询和一条自然语言指令,系统需要根据指令描述的属性(如内容、说话人身份、说话风格、环境声音或其组合)对语音文档进行排序。

数据集构成

INSPIRE 提供 Hugging Face 上的 querydocument 两个独立配置,每个子集构成独立的检索语料库:

子集 查询-指令对数量 文档数量 主要检索标准
DailyTalk 200 4,882 对话延续
VCTK 80 3,082 说话人
Expresso 800 3,861 说话人和说话风格
Synthetic 3,000 5,400 语义、说话人、风格和环境

每个查询包含:

  • instruction:自然语言检索条件
  • positive_documents:相关文档的ID
  • excluded_ids:从该查询候选池中排除的文档ID
  • 语音内容和用于分析的属性元数据

文档ID采用零填充字符串格式(如 "00042"),查询和文档仅在同一个子集内进行比较。

支持的检索方法

数据集配套工具包支持以下检索方法:

  • LALM嵌入:基于大型音频语言模型的嵌入表示
  • 级联文本检索:结合ASR转写和音频字幕生成,支持稠密检索、指令感知检索和BM25检索
  • 自监督学习和CLAP:支持HuBERT、WavLM和CLAP模型
  • 重排序:支持Audio-Flamingo-3、Qwen2.5-Omni、Qwen3-Omni、Voxtral和Qwen3文本重排序器

评估指标

默认评估指标为 Recall@k 和 NDCG@k,其中 k 取值为 1、5、10、20、50 和 100。评估过程中会先移除排除的文档,然后基于余弦相似度对文档进行排序。

数据集地址

  • Hugging Face 数据集页面:https://huggingface.co/datasets/lca0503/INSPIRE
  • 论文预印本:https://arxiv.org/abs/2608.16203
搜集汇总
数据集介绍
INSPIRE 数据集图片
构建方式
在语音信息检索领域,传统的查询方式往往局限于文本或语音内容的直接匹配,难以捕捉用户对语音文档中说话人身份、语言风格、背景环境等细粒度属性的意图。为此,INSPIRE基准数据集应运而生,其构建方式匠心独运,集成了DailyTalk、VCTK、Expresso及Synthetic四个子集,涵盖对话延续、说话人区分、风格描述及多模态复合属性等多元检索场景。每个查询样本均包含自然语言指令、相关文档标识及候选池排除列表,并附有语音内容与属性元数据,确保检索任务的高度拟真性与评价的客观性。文档标识采用零填充字符串,且各子集内查询与文档严格对应,独立构成检索语料库,为指令感知的语音检索模型提供了标准化、可复现的评测基准。
使用方法
使用INSPIRE基准时,研究者可依据研究目标灵活调用其工具链。首先,需通过conda环境配置安装依赖,并视需求设置OpenAI或Gemini的API密钥。随后,可选择LALM嵌入提取(如Audio-Flamingo-3、Qwen2.5-Omni等)、级联文本检索(ASR转录与音频描述生成后接稠密或BM25检索)、或直接使用SSL与CLAP特征提取来生成查询与文档的向量表示。所有提取的表示存储于指定目录,经calculate_score.py脚本评分,自动剔除排除文档,按余弦相似度排序,并输出Recall@k与NDCG@k指标至JSON文件。对于重排序场景,提供多种重排序器(如Qwen2.5-Omni)读取初排结果进行优化。整个流程命令简洁,参数可调,便于研究者复现或定制实验。
背景与挑战
背景概述
INSPIRE数据集由Chen-An Li与Hung-yi Lee于2026年创建,旨在填补指令感知语音检索领域的空白。该基准测试涵盖DailyTalk、VCTK、Expresso及Synthetic四个子集,包含自然语言指令描述内容、说话人身份、说话风格及环境声等多维度属性,共计4080条查询-指令对与逾一万条语音文档。其核心研究问题在于如何依据文本指令精准检索相关语音片段,突破了传统语音检索局限于内容匹配的框架。INSPIRE集成了大型音频语言模型、级联文本检索及自监督语音表示等多种方法,为语音检索领域提供了统一评测平台,推动了多模态语义理解与跨模态检索技术的发展,对语音信息检索及人机交互研究具有重要参考价值。
当前挑战
INSPIRE基准面临多维度挑战。在领域问题层面,需跨越语义、说话人身份、风格及环境声的复合属性进行检索,指令与语音间存在显著模态鸿沟,且指令可能隐含抽象或上下文相关的检索意图,要求模型具备深层听觉理解与推理能力。在构建过程中,需确保各子集数据的代表性与平衡性,如Synthetic子集通过程序化生成扩展了属性组合空间,但需避免引入合成噪声;同时,需设计严密的评估方案,包括排除无关文档及处理余弦相似度并列情况,以保证评分公平性。此外,集成多种模型与后端(如BM25、音频语言模型)需解决接口兼容与计算效率问题,确保基准的易用性与可复现性。
常用场景
经典使用场景
INSPIRE数据集最为经典的使用场景是作为指令感知的语音检索基准,用以评估系统根据自然语言指令(如描述内容、说话人身份、说话风格或环境声音)检索相关语音文档的能力。该数据集涵盖四个子集:DailyTalk(对话延续)、VCTK(说话人识别)、Expresso(说话人与风格)以及Synthetic(多维度组合),为研究者提供了多样化的检索挑战。在此框架下,研究者可评测各类模型,包括大型音频语言模型(LALM)、级联文本检索、自监督学习特征(如HuBERT、WavLM)以及CLAP模型,从而深入探索语音检索中语义、声学和说话人特征的融合机制。
解决学术问题
该数据集解决了语音检索领域长期存在的核心学术问题:传统语音检索仅依赖语音内容的语义匹配,忽视了用户通过自然语言指令表达的多模态属性需求。INSPIRE首次系统性地引入指令感知机制,使检索系统能够根据抽象描述(如“寻找一位男性说话人且带休闲风格”)动态调整检索策略,从而填补了指令遵循与语音信息检索之间的空白。这一设计推动了多模态联合嵌入、跨模态对齐和重排序等研究方向的发展,为评估模型对细粒度语音属性的理解提供了标准化基准,其意义在于引领语音检索从单一内容匹配迈向语义与说话人特征的融合时代。
实际应用
在实际应用层面,INSPIRE数据集可催生一系列智能语音交互系统,例如在语音助手或多媒体数据库中,用户可用日常生活语言描述目标音频片段(如“找到昨天录音中那位笑声爽朗的女性发言片段”),系统便能精准定位。此外,该基准可应用于播客检索、会议摘要、电话语音分析等场景,提升人机语音交互的效率与友好度。其稳定的评估流程和多样化的检索条件也有助于部署在真实世界的音频管理系统中,实现跨说话人、跨风格的动态检索,为企业级语音数据治理和内容推荐提供核心技术支撑。
数据集最近研究
最新研究方向
面向指令感知的语音检索技术正成为多模态信息检索领域的前沿焦点,INSPIRE基准的提出恰逢其时,其核心创新在于将自然语言指令融入语音文档检索流程,支持从语义、说话人身份、说话风格到环境声音等多维度属性的细粒度检索。该基准覆盖多种真实语音子集,并配套了从语音理解、文本级联到重排序的完整评估管线,为比较不同模型在复杂指令下的检索性能提供了标准化平台。随着音频大模型如Audio-Flamingo、Qwen-Omni的快速演进,INSPIRE引领了从单一语音匹配走向高层语义与声学属性融合的检索范式转变,推动了语音检索系统在智能助手、多媒体内容管理等场景中的实际应用落地,对多模态检索研究的未来发展具有重要的导向意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务