遇见数据集

StreamAudio-2M

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

StreamAudio-2M 是一个专为音频大语言模型和音频智能体训练设计的大规模流式音频数据集。其核心特点在于以“流”为单位组织数据,每个流是一个共享统一模式的音频回合序列。数据集总计包含约 228 万个独特的音频片段,这些片段被系统地组织成六个任务特定的子集,每个子集针对不同的音频处理场景。这些子集包括:1. 流式音频理解(90,738 行),包含来自 AudioSet 和 FMA 的音频蒙太奇,用于字幕生成、选择和开放式问答任务;2. 实时自动语音识别(28,109 行),包含来自 CommonVoice、GigaSpeech、LibriSpeech 和 VoxPopuli 的 ASR 音频流,其中助手回复为文本转录;3. 流式翻译(11,712 行),包含来自 CoVoST2 的英语到中文语音翻译音频流,助手回复为中文翻译;4. 语音聊天(196,064 行),包含多轮口语对话,每回合都有语音形式的用户和助手交互;5. 主动响应(4,519 行),包含室内/室外场景下的主动响应音频流,来源包括 ElevenLabs 和 AudioX;6. 环境感知音频智能体(50,035 行),包含相同场景下的音频蒙太奇,时长在 90 到 180 秒之间。数据集采用统一的结构化模式:顶层包含流 ID、场景类型、音频类别、回合数、总时长和回合列表等字段。每个回合则包含用户音频、助手音频、情感、关键词、场景类型、音频类别、话题类型、音频文件路径、数据来源以及详细的音频统计信息(如时长、采样率、响度、动态范围等)。音频文件以未压缩的 tar 分片形式提供,解压后可按指定相对路径访问。该数据集适用于多种音频相关的任务,包括音频分类、自动语音识别、语音翻译和音频到音频的生成等,旨在支持流式、多轮交互的音频理解和生成模型的开发。

StreamAudio-2M is a large-scale streaming audio dataset designed for training audio large language models and audio agents. Its core feature is organizing data in streams, where each stream is a sequence of audio turns sharing a unified pattern. The dataset contains approximately 2.28 million unique audio clips, systematically organized into six task-specific subsets, each targeting different audio processing scenarios. These subsets include: 1. Streaming Audio Understanding (90,738 rows), containing audio montages from AudioSet and FMA for caption generation, selection, and open-ended QA tasks; 2. Real-time Automatic Speech Recognition (28,109 rows), containing ASR audio streams from CommonVoice, GigaSpeech, LibriSpeech, and VoxPopuli, with assistant responses as text transcriptions; 3. Streaming Translation (11,712 rows), containing English-to-Chinese speech translation audio streams from CoVoST2, with assistant responses as Chinese translations; 4. Voice Chat (196,064 rows), containing multi-turn spoken dialogues with user and assistant interactions in audio form per turn; 5. Proactive Response (4,519 rows), containing proactive response audio streams in indoor/outdoor scenarios, sourced from ElevenLabs and AudioX; 6. Environment-aware Audio Agent (50,035 rows), containing audio montages in the same scenarios, with durations between 90 and 180 seconds. The dataset adopts a unified structured schema: the top level includes fields such as stream ID, scene type, audio category, number of turns, total duration, and turn list. Each turn contains user audio, assistant audio, emotion, keywords, scene type, audio category, topic type, audio file path, data source, and detailed audio statistics (e.g., duration, sample rate, loudness, dynamic range). Audio files are provided in uncompressed tar shards, which can be accessed via specified relative paths after extraction. This dataset is suitable for various audio-related tasks, including audio classification, automatic speech recognition, speech translation, and audio-to-audio generation, aiming to support the development of streaming, multi-turn interactive audio understanding and generation models.

创建时间:
2026-05-25
原始信息汇总

数据集概览

数据集名称:StreamAudio-2M
许可证:CC-BY-4.0
语言:英语、中文
任务类型:音频分类、自动语音识别、翻译、音频到音频
标签:音频、流式、音频理解、ASR、语音翻译、语音聊天

StreamAudio-2M 是一个大规模流式音频数据集,专为音频大语言模型和音频智能体训练设计。每个数据项是一个(stream),即一系列音频片段按统一模式组织。数据集包含约 228 万条独特的音频片段,划分为 6 个任务子集。

子集说明

子集名称 行数 描述
Stream_Audio_Understanding 90,738 音频理解片段合集(来源于 AudioSet / FMA),包含描述、选择题和开放性问答
Real_time_ASR 28,109 自动语音识别片段流(来源于 CommonVoice / GigaSpeech / LibriSpeech / VoxPopuli);assistant 字段为文本转写
Stream_translation 11,712 英文到中文的语音翻译片段流(来源于 CoVoST2);assistant 字段为中文翻译
Voice_chatting 196,064 多轮口语对话,每轮包含语音形式的 userassistant
Proactive_respond 4,519 室内/室外主动响应流(来源于 ElevenLabs / AudioX)
Environment_awared_audio_agent 50,035 同一场景的音频合集(时长 90–180 秒)

数据模式

顶层字段:

  • id:唯一标识符
  • stream_scene_type:所有轮次一致的场景类型,否则为 mixed
  • stream_audio_category:所有轮次一致的音频类别,否则为 mixed
  • num_turns:流中的轮次数
  • total_duration_s:总时长(秒)
  • turns:轮次列表,每个轮次包含以下字段:
    • user:用户输入
    • assistant:助手输出
    • emotion:情感
    • keywords:关键词
    • scene_type:场景类型,取值范围包括 DrivingTrafficHome SmartCookingFitnessTravelOfficeothers
    • audio_category:音频类别
    • topic_type:话题类型
    • audio_path:音频文件路径
    • source:数据来源
    • audio_stats:音频统计信息,包含 duration_ssample_ratechannelsmeanstdabs_meanrms_dbpeak_dbcrest_factordynamic_range_dbzero_crossing_rate

音频文件

音频以未压缩的 tar 分片形式存储在 audio_tars/ 目录下。下载所有分片并解压到数据集根目录后,可恢复 audio/ 目录树。数据集中每个轮次的 audio_path 字段为相对于 audio/ 的路径,例如 audio/asr/0012/asr_0012345.wav

解压命令示例: bash cat audio_tars/*.tar | tar -xf -

或单独解压每个分片。

搜集汇总
数据集介绍
StreamAudio-2M 数据集图片
构建方式
StreamAudio-2M是一个专为音频大语言模型与音频智能体训练设计的大规模流式音频数据集。其构建以“流”为核心组织单元,将连续的音频轮次归入统一的数据模式,从而模拟真实世界中音频事件的连续性与交互性。数据源涵盖AudioSet、FMA、CommonVoice、GigaSpeech、LibriSpeech、VoxPopuli、CoVoST2、ElevenLabs及AudioX等权威语料库,经过精心剪辑与重组,形成了超过220万条独立音频片段,并依据任务类型划分为六个子集,包括流式音频理解、实时语音识别、流式翻译、语音对话、主动响应及环境感知音频代理。每条记录均包含丰富的元信息,如场景类型、音频类别、情感标签、关键词及详细的音频统计特征,以支持多维度分析与训练。
特点
该数据集的核心特点在于其流式结构与多任务兼容性。每个样本均被构建为包含多个音频轮次的序列,用户与助手角色交替出现,并记录情感、关键词及场景类型等上下文信息,从而支持对话式、翻译型及环境感知等多种交互范式。音频数据以无损tar分片形式存储,保留了原始WAV格式的高保真度,并提供包括采样率、通道数、RMS分贝值、峰值分贝值、波峰因子及过零率在内的全面声学统计指标。场景类型覆盖驾驶、交通、家庭智能、烹饪、健身、旅行、办公等真实应用场景,混合场景则统一归类为“mixed”,增强了模型在多变环境中的泛化能力。
使用方法
使用StreamAudio-2M时,需先下载所有音频tar分片并释放至数据集根目录,以重建完整的音频文件树。每个样本中的audio_path字段提供了相对于该目录的路径,便于直接读取对应WAV文件。数据集以JSONL格式组织,每行对应一个完整的流式样本,可通过HuggingFace Datasets库加载指定配置,如Stream_Audio_Understanding、Real_time_ASR等,以针对特定任务进行微调或评估。用户可根据需求灵活选取子集,利用schema中的场景类型、音频类别等字段进行数据筛选,并结合turns结构中的多轮对话数据进行流式模型的训练与推理任务。
背景与挑战
背景概述
StreamAudio-2M是一个面向流式音频理解的大规模数据集,由研究机构于2023年发布,旨在推动音频大语言模型与智能音频代理的发展。核心研究问题聚焦于如何使模型在连续、动态的音频流中实现实时理解、语音识别、翻译及多轮对话等任务。该数据集整合了来自CommonVoice、GigaSpeech、AudioSet等多个开源音频资源的约228万条音频片段,组织为六大任务子集,为流式音频处理研究提供了统一的训练与评估基准,对音频人工智能领域产生了重要影响。
当前挑战
该数据集所解决的领域问题在于,传统音频数据集多为静态片段,缺乏对时序流式交互的支持,而现实场景中音频常以连续流形式出现,要求模型具备实时处理与多任务协同能力。构建过程中面临的主要挑战包括:跨源音频数据的高效整合与统一标注,确保不同采样率、时长和背景噪声的音频在流式框架下兼容;多元化场景的模拟与覆盖,需精准设计驱动、家居、办公等八类场景以反映真实环境;以及大规模音频文件的管理与高效分发,采用未压缩的tar分片格式,对存储与解压机制提出了严格要求。
常用场景
经典使用场景
StreamAudio-2M数据集的核心应用场景在于助力音频大模型与音频智能体的训练,其独特之处在于以“流”的形式组织音频片段,每个样本包含一系列按时间顺序排列的音频轮次,从而模拟真实世界中连续且交织的音频交互环境。该数据集涵盖了从音频理解、实时语音识别、语音翻译到语音对话、主动响应以及环境感知音频体等六大任务子集,为研究者提供了一个统一且丰富的基准,用以评估和提升模型在动态、多轮音频场景下的泛化能力与交互流畅性。
解决学术问题
该数据集旨在解决当前音频处理领域中,多数数据集仅提供静态、孤立音频片段而缺乏连续交互上下文的问题。它使研究者能够深入探索并攻克诸如多轮语音对话中的上下文保持、流式语音识别中的实时性优化、跨语言语音翻译的语义连贯性维护,以及智能体在复杂环境(如驾驶、家居)中对音频事件的持续感知与主动响应等学术难题。通过提供大规模、结构化的流式音频数据,StreamAudio-2M推动了从单次音频任务到连续音频场景理解的研究范式转变,显著促进了音频基础模型在动态交互能力上的理论突破与实证评估。
衍生相关工作
围绕StreamAudio-2M,学术界和工业界已衍生出一系列具有影响力的研究工作。典型方向包括基于其流式架构设计更为高效的音频编解码与注意力机制,以降低流式推理延迟;利用其多任务特性探索联合训练范式,提升模型在ASR、翻译与对话等任务间的知识迁移效率;以及针对其Proactive_respond子集开发场景驱动的主动交互策略,推动智能体从被动响应向主动服务的演进。这些衍生工作不仅验证了数据集的优异基础性,也为未来构建更通用、更具交互智能的音频大语言模型提供了坚实的实证基础与方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务