遇见数据集

zhifeixie/StreamAudio-2M

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

StreamAudio-2M是一个大规模流式音频数据集,用于训练音频-LLM或音频代理。每个数据行代表一个“流”:即共享统一模式的音频轮次序列。数据集包含约228万个独特的音频片段,并组织成六个任务子集:Stream_Audio_Understanding(音频理解剪辑的蒙太奇,包括字幕、选择和开放问答)、Real_time_ASR(ASR剪辑流,助手字段为转录文本)、Stream_translation(英语到中文的语音翻译剪辑流,助手字段为中文翻译)、Voice_chatting(多轮口语对话,每轮包含用户和助手的语音)、Proactive_respond(室内/室外主动响应流)和Environment_awared_audio_agent(同场景音频蒙太奇,持续90-180秒)。数据模式包括顶层字段(如id、stream_scene_type等)和每个轮次的字段(如user、assistant等)。音频数据以未压缩的tar分片形式提供,需下载并解压以重建音频文件树。

StreamAudio-2M is a large-scale streaming-audio dataset for audio-LLM / audio-agent training. Each row is a stream: a sequence of audio turns sharing one unified schema. Approximately 2.28 million unique audio clips are organized into six task subsets: Stream_Audio_Understanding (montages of audio-understanding clips with captions, choice & open QA), Real_time_ASR (streams of ASR clips where assistant field is the transcript), Stream_translation (streams of EN→ZH speech-translation clips where assistant field is the Chinese translation), Voice_chatting (multi-round spoken dialogues with spoken user and assistant turns), Proactive_respond (indoor/outdoor proactive-response streams), and Environment_awared_audio_agent (same-scene audio montages of 90–180 seconds). The schema includes top-level fields (e.g., id, stream_scene_type) and per-turn fields (e.g., user, assistant). Audio is provided as uncompressed tar shards that must be downloaded and extracted to recreate the audio file tree.

提供机构:
zhifeixie
搜集汇总
数据集介绍
zhifeixie/StreamAudio-2M 数据集图片
构建方式
StreamAudio-2M是一个面向音频大语言模型与音频代理训练的大规模流式音频数据集。其构建理念在于模拟真实世界中音频交互的连续性,将数据组织为统一的“流”(stream)结构,即一系列音频轮次的有序序列。数据集涵盖了六大任务子集:流式音频理解、实时语音识别、流式翻译、语音聊天、主动响应以及环境感知音频代理。每个子集均来源于多个公开音频语料库,如AudioSet、CommonVoice、CoVoST2等,并通过精心设计的构建流程,将独立的音频片段拼接成具有场景连贯性的流式数据。数据格式采用结构化的JSON行文件,每一行包含场景类型、音频类别、轮次数、总时长以及详细的轮次列表,确保了数据的一致性与可扩展性。
特点
该数据集的核心特色在于其流式时间结构,每个样本均表示为一个多轮次的音频序列,精准捕捉了动态音频交互的时序依赖关系。包含约228万个独特的音频片段,覆盖驾驶、交通、家庭智能、烹饪、健身、旅行、办公等多种场景类型,赋予了模型在复杂环境下的泛化能力。每个音频轮次均配备了丰富的元数据,包括情感标签、关键词、场景类型、音频类别及详细的音频统计信息(如均方根分贝、峰值因数、过零率等),这些特性为研究人员提供了深入分析音频内容的机会,并支持多样化的任务建模,从简单的分类到复杂的多轮对话和行为响应。
使用方法
使用StreamAudio-2M数据集时,研究人员需首先下载音频压缩包并将其解压至数据集根目录,以确保音频路径的正确映射。数据集以HuggingFace Datasets库的形式加载,提供了多个配置选项,每个配置对应一个子集,用户可通过指定配置名称加载特定的任务数据。每个样本的结构化JSON行格式便于解析,用户可以根据任务需求提取音频路径与轮次信息。音频文件以WAV格式存储,采样率及声道数等信息均在音频统计字段中提供,方便进行预处理。该数据集特别适用于训练能够处理连续音频流、理解场景上下文并做出实时或主动响应的音频大语言模型与智能音频代理系统。
背景与挑战
背景概述
StreamAudio-2M数据集由相关研究团队于近年创建,旨在为流式音频场景下的大语言模型(Audio-LLM)及音频代理(audio-agent)训练提供大规模、多任务的基础数据资源。该数据集围绕流式音频的核心研究问题展开,即如何让模型在动态、连续的音频流中同时完成理解、识别、翻译与交互等复杂任务。通过将约228万条独特音频片段组织为六类子集,覆盖音频理解、实时语音识别、语音翻译、语音聊天、主动响应及环境感知音频代理等任务,StreamAudio-2M为推进多模态流式音频处理研究提供了标准化训练基准,对提升音频大模型在真实连续场景中的通用能力具有重要影响。
当前挑战
该数据集面临的挑战主要体现在两个层面。在领域问题层面,传统音频数据集多聚焦于静态片段处理,而StreamAudio-2M需解决流式音频场景中多任务并行处理的难题,包括实时性要求下的语音识别与翻译、多轮语音交互中的上下文保持,以及跨场景(如驾驶、家庭、办公)的音频环境感知与主动响应。在构建层面,团队需将来自不同来源(如CommonVoice、GigaSpeech、CoVoST2等)的异构音频数据统一为流式结构,确保每个样本包含多轮音频序列及其对齐的语义信息,同时处理音频片段组合时的时序连贯性与场景一致性,并保证约2.28M条音频片段的质量与标注可靠性。
常用场景
经典使用场景
StreamAudio-2M作为首个大规模流式音频数据集,其最经典的使用场景在于训练具备流式音频理解能力的音频大语言模型(Audio-LLM)与音频代理(Audio-Agent)。该数据集将原始音频片段组织为具有统一结构的连续音频轮次序列,每个样本包含多个交互回合,从而模拟真实世界中音频信息持续流入的场景。研究者可借此开发能够实时感知、理解并响应流式音频输入的智能系统,尤其适用于需要处理音频时序依赖关系的任务,如连续语音识别、实时音频事件检测与上下文感知的音频对话生成。
解决学术问题
该数据集直面传统音频数据集仅支持静态单段音频处理的局限,解决了流式音频场景下模型缺乏交互式上下文理解能力的学术难题。通过提供涵盖多轮对话、语音翻译、环境感知等六种复杂子任务的高质量标注数据,StreamAudio-2M使得研究者能够系统性地探索音频大模型在时间维度的推理与记忆机制。其学术意义在于为流式音频理解领域建立了基准评价框架,推动了音频模型从单次处理向连续感知范式的跨越,显著提升了模型在动态音频环境中的鲁棒性与适应性。
衍生相关工作
StreamAudio-2M的发布催生了多个方向的经典研究工作。在模型架构层面,研究者基于其结构化时序设计提出了流式注意力机制与分层记忆网络,以高效处理长序列音频;在训练范式上,衍生出面向流式数据的强化学习微调策略与对比预训练方法。该数据集还启发了音频-语言联合建模的新范式,推动了一系列适用于实时语音对话、音频事件推理与主动音频交互的基线模型与评估协议。这些工作共同构成了流式音频理解领域的知识基石,持续引领该方向的学术前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务