nvidia/AudioSkills
收藏官方服务:
资源简介:
AudioSkills-XL是一个大规模的音频问答(AQA)数据集,旨在开发(大型)音频语言模型,使其能够在短时间内对音频片段进行专家级的推理和解决问题。它扩展了原始的AudioSkills集合,新增了约450万个新的问答对,总计约1000万个多样化示例。该数据集按每个音频的来源数据集划分成子集。数据集的授权和使用条款由NVIDIA OneWay非商业许可管理。
AudioSkills-XL is a large-scale audio question-answering (AQA) dataset designed to develop (large) audio-language models capable of expert-level reasoning and problem-solving over short audio clips (≤30 seconds). It expands upon the original AudioSkills collection by adding approximately 4.5 million new QA pairs, resulting in a total of ~10 million diverse examples. The dataset is partitioned into subsets based on each audios source dataset. The use of AudioSkills-XL is governed by the NVIDIA OneWay Noncommercial License.
提供机构:
nvidia搜集汇总
数据集介绍

构建方式
AudioSkills-XL数据集的构建基于对多个开源音频数据源的深度整合与智能标注。研究团队从WavText5K、MusicCaps、AudioSet、VoxCeleb2等近三十个涵盖环境音、语音与音乐的公开数据集中提取短音频片段(≤30秒),并充分利用各数据集的原始元数据(如字幕、转录文本)。在此基础上,借助大语言模型,结合专家设计的推理提示模板,自动生成高质量的问答对。整个构建过程采用人机协同的迭代优化策略,通过人工评估模型输出结果来不断调整提示与数据源,最终形成了约一千万个多样化的音频问答样本。值得注意的是,数据集仅提供文本标注,音频文件需用户依据JSON中的文件名从原始来源自行获取。
特点
该数据集最显著的特点在于其规模宏大与推理能力的全面覆盖。相较于原版AudioSkills,AudioSkills-XL新增约450万问答对,总量逼近千万级别,为音频大语言模型的训练提供了前所未有的数据基础。在技能维度上,数据集精心设计了针对声音与音乐的七项核心推理任务,包括时序推理、属性识别、计数、上下文事件推理等,以及针对语音的六项专项技能,如讽刺识别、情绪推理、信息抽取与摘要生成。这种多维度的技能体系使得模型能够应对从基础感知到高级认知的广泛挑战,填补了现有音频数据集在专家级推理能力上的空白。
使用方法
使用AudioSkills-XL时,研究者需首先通过Git LFS克隆数据仓库,获取包含所有问答对的JSON文件。由于音频文件需从原始数据源(如YouTube-8M、FMA、ESC-50等)独立下载,用户应依据JSON中'sound'字段提供的文件名进行匹配。数据集以标准的JSON格式组织,每条记录包含音频标识符、时长以及由人类与GPT构成的对话对。在训练音频语言模型时,可将这些问答对作为监督信号,结合对应的音频特征进行端到端学习。需注意,JSON中的duration字段可能存在误差,建议在实际应用中重新计算音频时长以确保数据准确性。
背景与挑战
背景概述
多模态音频理解是人工智能领域的前沿研究方向,旨在赋予机器对声音、音乐和语音等复杂音频信号进行高层次推理与交互的能力。然而,现有音频数据集多侧重于分类或简单描述,缺乏对专家级推理任务的系统支撑。为此,NVIDIA研究团队于2025年7月发布了AudioSkills-XL数据集,该数据集在原始AudioSkills基础上扩展了约450万个问答对,总计近1000万个样本,覆盖环境声、音乐和语音三大域。数据集由NVIDIA主导创建,依托Audio Flamingo系列模型的研究框架,旨在推动音频大语言模型在时序推理、属性识别、计数、讽刺理解、情感分析等13项核心技能上的训练与评估,对音频智能领域的研究范式产生了重要影响。
当前挑战
AudioSkills-XL数据集面临多重挑战。在领域问题层面,音频推理任务高度依赖对时间动态、多源混合和细微声学特征的精确建模,例如从嘈杂环境中准确计数事件或识别说话人的情绪状态,远超传统音频分类的难度。在构建过程中,挑战尤为突出:数据来源涵盖29个开源子集,需统一处理不同采样率、编码格式及元数据缺失问题;问答对的生成依赖大型语言模型从原始元数据(如字幕、转录文本)中合成,但合成标注可能引入噪声或语义偏差,需通过人工循环迭代优化提示策略;此外,音频文件因许可限制无法直接托管,用户需自行从分散的原始数据源(如YouTube-8M、LibriSpeech)下载并匹配,增加了数据复用的门槛与一致性维护的复杂性。
常用场景
经典使用场景
在音频理解与人工智能交叉领域,AudioSkills-XL数据集被广泛用于训练和评估大型音频语言模型在专家级推理任务上的表现。该数据集汇集了超过一千万个问答对,覆盖环境声、语音与音乐三大模态,并精心设计了七类核心技能,包括时序推理、属性识别、计数、上下文声学事件推理、信息抽取与通用推理等。研究者常利用该数据集微调Audio Flamingo系列模型,使其能够对不超过三十秒的音频片段进行多维度、高层次的语义解析,从而系统性地提升模型在复杂音频场景中的认知能力。
解决学术问题
AudioSkills-XL的发布有效填补了音频问答领域大规模、高多样性专家级推理数据的空白。以往研究多聚焦于音频分类或基础描述生成,而该数据集首次将时序理解、因果关系推断、情感状态推理与讽刺识别等高级认知任务纳入统一框架。通过提供结构化的训练范例,它帮助学界解决了音频语言模型在复杂推理任务上泛化能力不足的问题,推动了从简单感知向深层理解的范式转变,为构建真正具备听觉智能的通用模型奠定了数据基础。
衍生相关工作
围绕AudioSkills-XL已衍生出一系列具有影响力的学术工作。最为代表性的是NVIDIA发布的Audio Flamingo系列模型,从初代支持少样本学习与对话,到第二代引入长音频理解,再到第三代Audio Flamingo 3实现完全开源的全方位音频智能,该数据集始终作为核心训练与评测基准。此外,研究者基于此数据集探索了合成数据生成中的提示工程与人类反馈迭代方法,催生了关于音频大语言模型推理能力系统评估的新基准,并启发了后续多模态融合与跨任务迁移学习的研究方向。
以上内容由遇见数据集搜集并总结生成



