遇见数据集

VoiceIsolation-Benchmark-Dataset

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

Voice Isolation Benchmark Dataset是一个用于衡量语音隔离(Voice Isolation)技术对自动语音识别(ASR)性能影响的数据集。该数据集由Krisp团队录制,包含265个真实世界的录音,47位说话人,涵盖三种场景(工作环境、呼叫中心、电话通话),共65个脚本。所有录音均在真实环境中使用真实设备录制,无任何合成混合。数据集旨在评估当第二个说话人出现在麦克风附近时,语音转文字(STT)引擎的准确率下降情况,以及Krisp语音隔离技术对其的修复效果。录音结构通常遵循四段式脚本:主说话人开始、副说话人加入、主说话人静默而副说话人继续、主说话人重新加入。电话通话场景则仅包含主说话人,背景为环境噪音。每个录音均附带人工转录的文本(包含犹豫、重复等真实语音特征),以及时间戳分段标注(主说话人、混合、副说话人、噪音)。元数据包括文件名、唯一ID、说话人ID、性别、完整转录、分段信息、录制设备、环境等。电话通话场景额外提供手机型号和汽车型号(如果在车内录制)。音频格式为32kHz单声道16位PCM WAV。该数据集适用于语音隔离、语音增强、ASR鲁棒性评估等任务,也可用于参考无关的语音质量评估(如DNSMOS)。数据集许可为CC-BY-NC-4.0。

The Voice Isolation Benchmark Dataset is a dataset designed to measure the impact of voice isolation technology on automatic speech recognition (ASR) performance. Recorded by the Krisp team, it contains 265 real-world recordings from 47 speakers, covering three scenarios (work environment, call center, phone call), with a total of 65 scripts. All recordings are made in real environments using real devices, without any synthetic mixing. The dataset aims to evaluate the accuracy degradation of speech-to-text (STT) engines when a second speaker appears near the microphone, as well as the restoration effect of Krisps voice isolation technology. The recording structure typically follows a four-segment script: main speaker starts, secondary speaker joins, main speaker becomes silent while secondary speaker continues, and main speaker rejoins. The phone call scenario includes only the main speaker with background ambient noise. Each recording comes with manual transcriptions (including hesitations, repetitions, and other natural speech characteristics) and timestamped segment annotations (main speaker, mixed, secondary speaker, noise). Metadata includes file name, unique ID, speaker ID, gender, full transcription, segment information, recording device, environment, etc. For the phone call scenario, additional information such as phone model and car model (if recorded in a car) is provided. The audio format is 32kHz mono 16-bit PCM WAV. This dataset is suitable for tasks such as voice isolation, speech enhancement, ASR robustness evaluation, and also for reference-free speech quality assessment (e.g., DNSMOS). The dataset is licensed under CC-BY-NC-4.0.

创建时间:
2026-09-17
原始信息汇总

Voice Isolation Benchmark Dataset

数据集概述

  • 数据集名称:Voice Isolation Benchmark Dataset
  • 发布方:Krisp Technologies, Inc.
  • 许可证:cc-by-nc-4.0
  • 任务类别:automatic-speech-recognition
  • 语言:en
  • 数据规模:n<1K
  • 标签:voice-isolation、speech-enhancement、benchmark、WER、noise

数据集用途

该数据集用于测量第二人声如何影响语音转文本(STT),以及 Krisp Voice Isolation 能在多大程度上修复该问题。支持两类测量:

  • STT 准确率:比较原始音频与经过 Voice Isolation 处理后音频的词错误率(WER)。
  • 感知质量:在主要说话人讲话的片段上,比较处理前后的无参考语音质量(DNSMOS)。

该数据集并非排行榜,不用于对 STT 引擎进行排名。

数据集构成

  • 共 265 条真实录音,涵盖 47 位说话人、3 种场景、65 个脚本。
  • 全部为真实环境、真实设备录制,无合成混音。
  • 提供三个配置:call_center(默认)、phone_calls、work,均为 test 划分。

记录结构

  • 多数 Work 和 Call Center 录音遵循四步脚本:主要说话人开始 → 次要说话人加入 → 主要说话人静默、次要说话人单独继续 → 主要说话人重新加入。
  • 每条录音包含四个标注片段,其中"secondary"片段为压力测试:该段正确的转写文本为空,而多数 STT 引擎仍会转写背景人声。
  • Phone Calls 不遵循该结构,仅包含主要说话人,无刻意的第二人声,背景为环境嘈杂声与环境噪声,用于测试在失真、带限音频上的安全性。

三种场景

Work

  • 96 条录音 · 29 位说话人 · 24 种设备 · 4 种房间类型 · 17 个脚本
  • 典型居家办公与办公室会议场景,房间包括小型房间(10 m² 以下)、中型房间(10–20 m²)、大型房间(20 m² 以上)及开放式办公室。
  • 次要人声为同事、家人或共享空间者。
  • 29 位说话人(15 女,14 男),使用 24 种音频设备,涵盖专业耳机、消费级耳塞和游戏耳机。
  • 脚本较 Call Center 更长、更密集,包含专有名词、数字、日期和术语。
  • 使用的音频设备:Jabra Evolve 10、Jabra Evolve 20 MS、Jabra Evolve2 40、Jabra Evolve 75se、Jabra Engage 50、Poly Blackwire 8225、Poly Voyager Focus、Mpow HC5、Apple AirPods、Apple EarPods、Bose QC35、JBL Tune 500BT、JBL Tune 710BT、Soundcore Life Q30、Soundcore P25i、Samsung Galaxy Buds Live、Redmi Buds 3 Lite、Logitech G435、Logitech G733、Logitech Zone Vibe 100、Razer BlackShark V3 Pro、Livey 805DM、Cyber Acoustics AC-204TR

Call Center

  • 106 条录音 · 7 位说话人 · 13 种耳机 · 4 个地点 · 28 个脚本
  • 在 4 个不同地点的真实呼叫中心环境录制,各地点具有各自的背景噪声特征(邻近坐席的交谈声、键盘声、电话铃声及一般办公活动)。
  • 7 位说话人(4 女,3 男),使用专业耳机。
  • 28 个脚本覆盖银行、保险、医疗、IT 支持、电信、电商、旅游等坐席–客户通话场景,仅录制坐席一侧。
  • 使用的音频设备:Jabra Biz 1500、Jabra Evolve 10、Jabra Evolve2 30、Jabra Evolve2 40、Cyber Acoustics AC-204TR、Cyber Acoustics AC-304TR、Livey 410DM Plus、Livey 500DM AINC、Livey 805DM、Logitech H340、Poly Blackwire 8225、Telekonnectors FS V2、Telekonnectors Sirius QD

Phone Calls

  • 63 条录音 · 26 位说话人 · 18 种手机 · 4 种地点类型 · 20 个脚本
  • 说话人处于移动状态:驾驶、户外步行、通勤或在商店和咖啡馆内,多数录音来自汽车。
  • 挑战在于信号本身而非第二说话人:蓝牙车载麦克风、远离嘴部的扬声器、行驶车辆中的耳塞、电话编解码器、低带宽,叠加街道噪声、音乐、车厢轰鸣和人群嘈杂声。
  • 26 位说话人(10 女,16 男),使用 18 种手机型号,录制自 17 种车型以及步行和公共场所。
  • 使用的手机:iPhone 13、iPhone 13 Pro Max、iPhone 14、iPhone 14 Pro、iPhone 15、iPhone 15 Pro、iPhone 15 Pro Max、iPhone 16、iPhone 16 Pro、iPhone 17、iPhone 17 Pro、Samsung Galaxy S7、Samsung Galaxy S25、Samsung Fold 7、Sony Xperia 5 IV、Redmi 13C、Honor 400 Pro、OnePlus 12

标注

  • 每条录音配有由人工标注员验证的手写转写文本。
  • 转写文本精确记录实际所说内容,保留犹豫、假开头和自我纠正,保留如 ano.., astonishing 或 rec.. resolved 的部分词和重启,即真实值以实际所说为准,而非清理后的版本。

音频片段标签

  • primary:目标说话人(可能包含环境嘈杂声)
  • mix:两位说话人重叠
  • secondary:仅次要说话人
  • noise:无语音,仅背景噪声

片段标签可用于分别在每种条件下测量 STT 与语音隔离效果,而非仅针对整条录音。

音频格式

  • 所有录音为未压缩 WAV 文件(PCM 16-bit signed little-endian),单声道,采样率 32 kHz。

元数据字段

每个场景有一个 metadata.jsonl 文件,每条录音一个条目。所有场景共享以下字段:

  • file_name:音频文件路径
  • id:唯一样本标识符
  • speaker_id:匿名化说话人标签
  • gender:female / male
  • full_transcript:完整真实转写文本
  • segments:带时间戳的对象列表,每个含起止时间、转写文本和片段标签
  • recording_device:耳机(Call Center)、音频设备(Work)或麦克风类型(Phone Calls)
  • environment:呼叫中心地点、房间类型或通话情境

Phone Calls 额外增加两个字段:

  • phone:手机型号
  • car_model:车型(当从汽车录制时)

发布内容

  • 完整数据集以 Collection 形式发布在 Hugging Face:https://huggingface.co/collections/Krisp-AI/krisp-voice-isolation-benchmark-suite
  • 包含录音、转写文本和元数据,以及每个 Voice Isolation 模型在每个文件上的输出。
  • 跨 11 种 STT 配置的基准结果以 Space 形式发布:https://huggingface.co/spaces/Krisp-AI/VoiceIsolation-Benchmark
  • 方法论(通过 jiwer 计算语料级 WER,在 primary 片段上计算 DNSMOS-C NISQA)在该 Space 中记录。

Krisp Technologies, Inc. · 录音已匿名化;说话人 ID 不含任何个人信息。

搜集汇总
数据集介绍
VoiceIsolation-Benchmark-Dataset 数据集图片
构建方式
在真实语音交互场景中,共话人干扰对语音转写系统构成严峻挑战,而现有公开基准多依赖合成混音,难以反映现实声学复杂性。为填补这一空白,Krisp团队在真实办公空间、活跃呼叫中心及户外移动环境中采集了265段录音,涵盖47名说话人、65段脚本与多种拾音设备。录音遵循结构化脚本设计,依次呈现主说话人独白、双人重叠、次说话人独白及纯噪声段落,并针对电话通话场景单独采集仅含主说话人的带限失真音频。全部音频以未压缩WAV格式存储,经人工逐字转写并标注分段标签,最终按工作、呼叫中心、电话通话三类场景组织为可复现的评测数据集。
使用方法
使用者可通过Hugging Face平台加载该数据集,其配置分为call_center、phone_calls与work三个子集,均以test划分提供。每个场景附带metadata.jsonl文件,其中记录文件路径、说话人匿名标识、性别、完整转写文本、带时间戳与标签的段落列表,以及录音设备与环境信息;电话通话场景额外提供手机型号与车型字段。典型使用流程为:从metadata中读取原始音频与分段标签,对原始音频及经语音隔离模型处理后的音频分别运行自动语音识别系统,计算词错误率以量化隔离效果,并在主说话人段落上采用DNSMOS等无参考指标评估感知质量。分段标签支持按主说话人、重叠、次说话人及噪声条件分别统计,从而定位语音隔离在不同声学情境下的具体影响。
背景与挑战
背景概述
语音分离与增强领域长期缺乏针对真实竞争语音场景的公开基准。现代STT引擎在稳态噪声下表现稳健,却在第二人近场说话时频繁转写错误说话人或错误断句,而现有资源多依赖合成混音,难以反映实际部署中的声学复杂性。Krisp团队于2024年发布了VoiceIsolation-Benchmark-Dataset,收录265段真实录音,覆盖工作、呼叫中心与移动通话三大场景,涉及47名说话人和65个脚本,全部采用真实房间、真实耳机与手机录制,未经过任何合成混音。该数据集旨在量化第二人声对STT的破坏程度,并评估语音隔离技术对该破坏的修复效果,为语音前端处理与自动语音识别社区提供了首个面向竞争语音的公开评测资源,对鲁棒语音交互系统的研发具有基准性影响。
当前挑战
该数据集所应对的领域问题在于,当第二说话人靠近麦克风时,STT引擎不仅会转写错误说话人,还会在语音代理交互中错误触发话轮转换,而现有基准无法在真实声学条件下系统评估这一失效模式。构建过程中的挑战同样显著:在活跃呼叫中心、移动车辆与公共场所采集自然重叠语音,需在保持说话人隐私的同时确保脚本覆盖专有名词、数字和日期等困难语言现象;人工转写需忠实保留犹豫、重启与部分词,增加了标注复杂度;此外,跨设备、跨房间与跨噪声条件的录音一致性控制,以及为每段音频精确切分主说话人、混合、次说话人与纯噪声四类片段,均对数据采集与标注流程提出了严格要求。
常用场景
经典使用场景
在语音交互与自动语音识别领域,竞争性人声始终是难以逾越的屏障。该数据集的经典使用场景在于构建对照评测基准,以原始录音与经语音隔离处理后的录音为双轨输入,系统性地测算词错误率(WER)与无参考感知质量(DNSMOS)。工作、呼叫中心与移动通话三类场景,搭配人工标注的primary、mix、secondary与noise时间片段,使得研究者能够在说话人切换、重叠语音及纯背景人声等严苛条件下,精确诊断语音隔离模块对下游识别性能的增益,而无须依赖合成混音或受控消融。
解决学术问题
长久以来,学术界对于第二人声干扰下语音识别退化的量化研究缺乏公开、真实且带标注的基准。该数据集填补了这一空白,解决了三个相互关联的问题:其一,双人同时说话时识别系统错误归属说话人、错误触发语音活动检测的机制难以被系统评测;其二,带限、失真且含环境噪声的电话频段音频中,语音隔离是否安全无副作用缺乏实证;其三,语音增强与识别准确率之间的关联缺乏片段级的细粒度分析。其意义在于,将“竞争性人声”从偶发噪声提升为可复现、可分解的实验变量,为鲁棒语音处理研究提供了方法学锚点。
实际应用
在真实工程部署中,该数据集直接服务于语音隔离算法的验证与选型。呼叫中心可借助其评测自动语音识别引擎在相邻坐席串扰、键盘敲击与电话铃响环境下的转写可靠性;远程办公工具可据此判断耳机麦克风在开放办公空间中对同事人声的抑制效果;车载与移动通信场景则能评估蓝牙免提、扬声器远场拾音及低带宽编解码器叠加街道噪声时,语音隔离对通信质量的保真度与安全性。此外,该数据集亦可支撑语音代理的轮次检测与打断管理策略的离线评估。
数据集最近研究
最新研究方向
在真实声学场景下,针对竞争性人声对自动语音识别系统造成的干扰,VoiceIsolation-Benchmark-Dataset 提供了265段经人工标注的实录音频,涵盖呼叫中心、居家办公与移动通话三类场景,其核心价值在于突破传统语音增强基准多依赖合成噪声或单一说话人设定的局限。当前前沿研究正借助该数据集深入探究语音隔离技术对词错误率的实际修复能力,并利用分段标签(主说话人、混合、次说话人、纯噪声)精细评估重叠语音与说话人转换条件下的系统鲁棒性。该基准亦推动无参考感知质量指标与识别准确率的联合优化,为构建在多人近场对话中仍能正确判读目标说话人的下一代语音交互系统提供关键实证依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务