ConversationalVoice
收藏官方服务:
资源简介:
来自真实对话的全双工语音数据,包括经说话者分离验证的源录音和保留对话上下文的新生成对话。
Full-duplex speech data sourced from real-world conversations, including source recordings validated through speaker separation and newly generated dialogues that preserve conversational context.
创建时间:
2026-08-18
原始信息汇总
ConversationalVoice 数据集详情
概述
ConversationalVoice 是一个将真实世界录音转化为全双工语音模型训练数据的开源项目。该流水线能够识别双人对话片段,分离说话人音轨,验证说话人一致性,标注时间和说话人属性,并基于原始对话生成新的对话内容,同时保留原有对话的轮换、停顿、重叠和副语言特征。
数据产出
每个通过筛选和质量控制的对话生成两类数据集:
- 说话人分离源数据: 从源录音中提取的每个说话人的干净、时间对齐音轨,并经过说话人一致性验证。
- 对话基础扩展数据: 保留源对话上下文和交互模式的可控新对话。
架构特点
- 每个阶段均为独立可安装的 worker,具有独立的依赖和专用队列。
- Worker 基于数据库状态执行任务,写入确定性产物,提交结果后再发布后继任务。
- 数据血缘关系为:
raw_audios(原始录音)→audio_parts(VAD 选择的对话窗口)→chunks(可接受的双人对话片段)。
技术需求
- 核心依赖: Python(uv 管理)、FFmpeg、FFprobe、PostgreSQL、Redis、AWS S3 或兼容对象存储。
- 模型访问: Hugging Face token(VAD、说话人分离、语音分离和转录模型)、OpenRouter API key(说话人档案提取、对话扩展、参考转录和语音合成)。
- 硬件要求: 支持 NVIDIA CUDA 的主机。
处理流程
流水线包含 9 个主要阶段:
- Ingest API: 接收上传的音频和元数据,输出归一化 WAV。
- VAD 分割: 识别对话窗口。
- 说话人分离(Diarization): 生成说话人轮次和参考 WAV。
- 质量过滤: 筛选出干净的双人对话片段。
- 语音分离(Separation): 输出两个固定说话人音轨。
- 转录: 生成英文转录和词级对齐产物。
- 说话人档案提取: 生成结构和说话人档案文档。
- 对话扩展: 生成新对话脚本、转录和两个合成音轨。
使用方式
- 克隆仓库并创建 PostgreSQL、Redis 和对象存储资源。
- 通过
schema/schema.sql应用数据库 schema。 - 配置
.env环境变量(数据库、Redis、S3、模型 token 等)。 - 运行
./start-all.sh启动 API(默认http://localhost:8000)和所有 worker。 - 通过
curl上传音频文件,API 返回202 Accepted和源 UUID,并在/v1/raw-audios/<id>提供状态查询。
许可证
项目软件采用 Business Source License 1.1,允许非生产用途及非商业学术研究、教育、评估、测试和基准测试。每个版本在首次公开发布四年后转换为 MIT 许可证。生产环境其他用途需从 AveraLabs 获取商业许可。
搜集汇总
数据集介绍

构建方式
ConversationalVoice数据集的构建源于对真实世界对话录音的深度加工,其流程始于对双人交流片段的自动识别,继而通过声音分离技术将说话者独立成轨,并辅以说话者一致性验证确保音轨纯净。随后,系统对时间戳与说话人属性进行精细标注,更以原始交流为蓝本,生成保留原有话轮转换、停顿、重叠及副语言特征的新型对话。整个流水线采用分布式架构,各阶段作为独立工作节点,借助PostgreSQL记录数据血缘,从原始音频经活动检测窗筛选至最终的双人对话片段,层层递进,确保数据质量与可追溯性。
使用方法
使用者需先配置包含PostgreSQL、Redis、S3对象存储及模型API密钥的环境,并通过提供的SQL脚本建立数据模式。随后,利用启动脚本拉起API服务与各任务队列,即可通过HTTP接口上传音频文件,系统自动返回任务UUID以供追踪。数据集的访问不仅限于源音频的分离音轨,还涵盖生成的扩展对话,它们均存储于对象存储中,其元数据与状态可经由API查询。项目代码组织为多个独立模块,支持开发者针对特定阶段进行定制与测试,适用于学术研究、模型评估与商业化应用的多重场景。
背景与挑战
背景概述
在智能语音交互技术日新月异的当下,全双工语音对话系统对自然交互体验的追求日益迫切,其训练数据的获取与质量成为制约发展的关键瓶颈。为此,AveraLabs研究团队于近期推出了ConversationalVoice数据集,旨在从真实世界的双人对话录音中,系统性地构建高质量的全双工语音训练语料。该数据集通过一套精细的流水线,涵盖语音活动检测、说话人分离、质量筛选、时间对齐及说话人属性标注等环节,并进一步基于原始对话生成保留轮转、停顿及副语言特征的新对话,从而为全双工语音模型提供兼具真实性与可控性的训练资源。其设计理念与工程实现,为语音交互研究领域注入了新的活力,具有重要的参考价值。
当前挑战
当前,ConversationalVoice数据集面临多重挑战。首要挑战在于全双工语音模型对数据的高保真度要求,即如何从嘈杂的真实世界录音中精准分离出双人语音,并确保说话人身份在长时段内保持一致,这直接影响到模型对自然对话中重叠语音、插话及情感韵律等复杂现象的习得能力。其次,在数据构建层面,工程实现面临严峻考验:各处理阶段需协调多种模型(如VAD、说话人分离、语音识别等)及外部服务(如OpenRouter API),构建高吞吐、低延迟且具备容错机制的分布式流水线,同时保证数据血缘的完整可追溯,以及在不同模型升级或配置变更下,产出数据质量的一致性与稳定性。此外,数据规模与多样性的平衡、计算资源的消耗以及基于BSL许可协议下的合规使用边界,亦是亟需审慎应对的挑战。
常用场景
经典使用场景
ConversationalVoice数据集的经典使用场景聚焦于全双工语音对话模型的训练与评估。该数据集通过精密流程从真实对话录音中提取双人对话片段,精确分离说话人音轨,并验证说话人一致性,同时保留对话中的轮次转换、停顿、重叠及副语言特征。研究者可借此构建具备自然交互节奏的语音对话系统,尤其适用于模拟真实场景中的即时交流,如智能助手的多轮对话、会议记录中的发言分离,以及人机交互中的情感与韵律建模。
解决学术问题
该数据集解决了语音人工智能领域中一个棘手的学术难题:如何获取高质量、带完整交互结构(如重叠语音和自然停顿)的双人对话训练数据。传统数据集往往依赖人工拼接或单声道录音,缺失真实对话的动态特征。ConversationalVoice通过自动化流水线,从海量真实录音中筛选并重构出精确的对话片段,提供了由数据策展、说话人验证到时间对齐的系统性方案。这不仅推动了全双工语音模型的发展,支持了对话场景下的语音分离与识别研究,也为副语言信息建模提供了可靠的数据基础,其开源工具链和明确的数据谱系为复现与延伸研究提供了坚实支撑。
实际应用
在实际应用中,ConversationalVoice数据集可用于开发能够同步听说的语音助手,提升电话客服、在线会议、远程医疗等场景下的语音交互体验。例如,在客服系统中,模型可借该数据集学会在客户说话时实时响应,减少沟通延迟;在会议转录中,能精准区分发言人并捕捉重叠语音,生成更准确的会议纪要。此外,它还可为游戏角色配音、无障碍交流设备以及语言学习应用提供自然的对话语音数据,增强交互亲和力。数据集的可扩展架构和S3存储集成,使其能便捷地适应不同行业的大规模部署需求。
数据集最近研究
最新研究方向
在对话式人工智能领域,全双工语音交互已成为新一代人机交互的前沿焦点,其核心挑战在于如何让机器理解并复现人类对话中自然发生的轮流发言、停顿、重叠及副语言线索。ConversationalVoice数据集直面这一痛点,通过工程化的流水线从真实世界录音中提取高质量的双人对话片段,并基于语音活动检测、说话人日志、音轨分离及一致性校验等步骤,生成既有来源又有扩展性的训练数据。该数据集的构建逻辑与当前语音生成模型对生态化数据的需求高度契合,其对话扩展机制不仅保留了原始交换的语境和交互模式,还为可控对话合成提供了新可能。此项工作对于推动全双工语音模型从实验室走向真实应用具有重要价值,也为语音数据处理的标准化和可追溯性树立了新范式。
以上内容由遇见数据集搜集并总结生成



