遇见数据集

slurp-babble-Qwen2.5-Omni-3B-v3

收藏
Hugging Face2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

该数据集是一个多模态数据集,包含音频信号及其对应的文本标注信息。数据集中每个样本包含以下核心字段:唯一标识符(id)、样本类型(kind)、目标文本(target)、采样率为16kHz的音频数据(audio)、信噪比信息(snr_db)、自动语音识别转录文本(asr_transcript)、综合响应文本(omni_response)、丢失信息标记(lost)、交换信息标记(swapped)、分类器判断依据(classifier_reason)、原始数据标识(slurp_id)、原始句子(sentence)以及数据来源(source)。数据集共包含3150个样本,其中训练集3000个样本,测试集150个样本,总数据量约为290MB。从字段结构推断,该数据集适用于语音处理、语音识别质量评估、多模态学习等任务,并提供了数据质量控制的标注信息。

创建时间:
2026-07-18
原始信息汇总
  • 数据集名称:slurp-babble-Qwen2.5-Omni-3B-v3
  • 数据集地址:https://huggingface.co/datasets/keylazy/slurp-babble-Qwen2.5-Omni-3B-v3
  • 数据集规模:总大小约 289 MB,下载大小约 294 MB
  • 数据集拆分
    • 训练集(train):3000 个样本,约 275 MB
    • 测试集(test):150 个样本,约 13.7 MB
  • 数据集特征
    • id:整数类型,样本唯一标识
    • kind:字符串类型,样本类别
    • target:字符串类型,目标值
    • audio:音频数据,采样率为 16000 Hz
    • snr_db:浮点数类型,信噪比(dB)
    • asr_transcript:字符串类型,语音识别转录文本
    • omni_response:字符串类型,模型回答
    • lost:字符串列表,丢失内容
    • swapped:字符串列表,交换内容
    • classifier_reason:字符串类型,分类器判断理由
    • slurp_id:整数类型,原始 SLURP 数据集 ID
    • sentence:字符串类型,句子文本
    • source:字符串类型,数据来源
  • 数据集配置
    • 配置名称:default
    • 数据文件:训练集位于 data/train-*,测试集位于 data/test-*
搜集汇总
数据集介绍
slurp-babble-Qwen2.5-Omni-3B-v3 数据集图片
构建方式
该数据集基于SLURP语料库构建,通过在原始音频中叠加不同信噪比的巴布噪声生成嘈杂语音样本,并利用Qwen2.5-Omni-3B模型进行语音识别与交互响应。具体流程包括:从SLURP数据集中选取特定语音片段,将其与babble噪声混合以模拟真实场景中的多说话人干扰;随后将含噪音频输入Qwen2.5-Omni-3B模型,获取ASR转录文本、模型回复(omni_response)、以及经分类器判定的错误类型(如丢失或替换的词汇)。最终输出包含原始SLURP标识、句子内容和音频源信息,形成结构化的训练与测试集。
特点
该数据集的特点在于深度融合了噪声环境下的语音交互评估与细粒度错误分析。一方面,通过控制信噪比(snr_db)参数,量化了不同噪声强度对ASR和语言模型性能的影响;另一方面,利用分类器诊断出的丢失(lost)和替换(swapped)词汇列表,精准定位模型在嘈杂条件下的错误模式。此外,数据集同时提供了标准ASR转录与Omni模型响应,支持多任务学习(如噪声鲁棒性训练与错误纠正),而3000条训练样本与150条测试样本的规模,兼顾了模型调优的充分性与评估的效率。
使用方法
该数据集可通过Hugging Face的datasets库直接加载,需指定默认配置并选择训练或测试分割。使用时,音频字段以16kHz采样率自动解码,可结合snr_db字段对样本按噪声强度进行分组实验。对于下游任务,既可利用asr_transcript和omni_response进行语音识别与语言模型的联合训练,也可基于lost和swapped标签开发错误检测与纠正模块。推荐使用Qwen2.5-Omni-3B作为基座模型进行微调,以对比其在干净与噪声场景下的性能差异,同时支持多模态评估指标的扩展计算。
背景与挑战
背景概述
该数据集名为slurp-babble-Qwen2.5-Omni-3B-v3,构建于2025年前后,由研究团队基于原始SLURP数据集扩展而来,旨在评估多模态语言模型在嘈杂环境下的口语理解能力。SLURP数据集本身是口语语言理解领域的标杆资源,专注于从语音中提取语义槽和意图。本数据集通过引入多说话人重叠噪声(babble)和不同信噪比(SNR)条件,系统性地测试Qwen2.5-Omni-3B这类轻量级全模态模型在复杂声学场景下的鲁棒性。其核心研究问题在于探索模型对语音失真、目标词丢失或替换等干扰的容错能力,对环境语音处理和智能助手应用具有重要参考价值。
当前挑战
该数据集主要挑战包括:1)领域问题层面,口语理解在真实场景中常因背景噪声(如多人交谈)导致语音模糊、关键信息丢失或混淆,传统模型在低信噪比下性能显著下降,亟需构建噪声鲁棒的理解系统。2)构建过程中,需从SLURP原始语音中人工混合babble噪声并校准SNR值,同时借助大模型生成ASR转录和语义响应,面临噪声级别与语义可懂度之间的平衡难题;此外,需手动标注单词级错误(lost/swapped字段)和分析分类器推理理由,工作量大且一致性要求高。
常用场景
经典使用场景
在语音交互与自然语言处理的交叉领域,SLURP-Babble数据集专为评估和提升多模态对话系统在嘈杂环境下的鲁棒性而设计。其经典使用场景聚焦于构建含噪语音理解基准,研究人员可借助该数据集的音频样本、SNR信噪比标签及人工标注的对话状态(如目标意图、实体丢失与错乱信息),系统性地测试模型在背景人声干扰下的语音识别与语义解析能力,尤其关注设备端语音助手在咖啡馆、聚会等现实喧嚣场景中的性能退化与修复策略。
解决学术问题
该数据集精准解决了学术研究中长期存在的“鸡尾酒会问题”在语义层面的延伸,即如何实现对混合语音流中关键指令的准确解耦与理解。通过提供成对的干净/含噪语音、ASR转录偏差记录以及Omni大模型生成的推理修正响应,它使得研究者能够量化噪声对端到端对话系统的影响,并探索基于决策级融合或跨模态注意机制的噪声鲁棒自然语言理解方案,从而推动多信道听觉场景下语音人机交互的理论边界。
衍生相关工作
该数据集衍生了多项具有影响力的研究工作,例如基于其对话状态变迁(如lost和swapped字段)的噪声环境下语义重构方法,以及利用Omni大模型生成的多轮纠正回复来训练轻量级残差修正网络的范例。此外,一些学者借鉴其数据构造范式,构建了面向特定场景(如医疗问诊、金融服务)的跨说话人、非稳态噪声模拟数据集,从而将SLURP-Babble提出的评估框架扩展至更广泛的垂直领域语音理解任务,形成了含噪口语理解基准的派生家族。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务