遇见数据集

realtime-turn-detection-test-data

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

这是一个用于实时语音API黑盒测试的合成语音数据集。数据集由OpenAI文本转语音模型生成的未修改WAV音频文件组成,专为Speaches项目的Realtime API行为测试而设计。每个录音文件均包含合成语音,测试者需自行添加静音、组合多个录音以及选择流式块边界来构建测试场景。元数据文件metadata.jsonl遵循Hugging Face AudioFolder格式,每条记录详细记录了生成输入参数、文件摘要、预期文本、转录文本,以及通过whisper-1模型获得的单词时间间隔和语音活动区间。这些时间间隔为模型推导的参考标注,并非精确的样本级真值,因此在实际测试中应设置显式容差。用户可根据speech_start_ms和speech_end_ms字段对录音进行裁剪。数据集的生成清单和脚本是权威来源,但由于托管模型可能随调用和版本变化,因此重新生成是过程化而非比特精确可复现的。该数据集适用于语音活动检测(VAD)、语音合成测试、实时音频处理等场景。

This is a synthetic speech dataset for black-box testing of real-time speech APIs. The dataset consists of unmodified WAV audio files generated by OpenAIs text-to-speech model, specifically designed for testing the behavior of the Realtime API of the Speaches project. Each recording file contains synthetic speech, and testers need to add silence, combine multiple recordings, and select streaming chunk boundaries to construct test scenarios. The metadata file metadata.jsonl follows the Hugging Face AudioFolder format, with each record detailing generation input parameters, file summary, expected text, transcribed text, as well as word time intervals and voice activity intervals obtained via the whisper-1 model. These time intervals are reference annotations derived by the model and are not precise sample-level ground truth, so explicit tolerance should be set in actual testing. Users can trim recordings based on the speech_start_ms and speech_end_ms fields. The datasets generation checklist and scripts are authoritative sources, but since the hosted model may vary with calls and versions, regeneration is procedural rather than bit-exact reproducible. This dataset is suitable for scenarios such as voice activity detection (VAD), speech synthesis testing, and real-time audio processing.

创建时间:
2026-08-23
原始信息汇总

数据集概述

名称:Realtime speech test recordings(实时语音测试录音)

简介:这是一个用于黑盒测试实时API行为(Realtime API behavior)的合成语音录音数据集,主要服务于Speaches项目。每个WAV文件均为OpenAI文本转语音(text-to-speech)模型的未修改输出,测试场景通过添加静音、合并录音及选择流式块边界来实现。


数据集内容

  • 音频格式:WAV文件
  • 数据类型:合成语音(synthetic speech)
  • 文件结构:每个录音文件对应一条元数据记录,存放在metadata.jsonl中。
  • 元数据字段(按照Hugging Face AudioFolder布局):
    • 生成输入(generation inputs)
    • 文件摘要(file digest)
    • 期望文本(expected text)
    • 转录文本(transcription)
    • 单词/语音间隔(word/speech intervals)

主要用途

  • 黑盒测试:用于测试实时语音API的响应行为,特别是语音活动检测(voice-activity-detection)相关场景。
  • 模型基准:提供参考标注(源自whisper-1模型转录),用于评估语音切割、时间对齐等任务。

重要说明

  • 时间间隔属性:元数据中的speech_start_msspeech_end_ms字段为模型推导的参考注释,并非样本级精确的真实值(ground truth),测试时应设定显式容差(tolerance)。
  • 数据可裁剪性:消费者可根据需要利用时间间隔字段对录音进行裁剪。
  • 可再现性:数据集的生成过程是程序化的(procedural),但并非位级可复现(bit-for-bit reproducible),因为托管语音和转录模型在调用间或版本更新时可能发生变化。已提交的生成清单(manifest)和脚本是数据生成的权威来源。

标签信息

  • audio:音频数据
  • synthetic:合成数据
  • voice-activity-detection:语音活动检测相关
  • speaches:关联Speaches项目

使用建议

  1. 测试时需自行添加静音、拼接录音或定义流式分块边界。
  2. 对时间间隔标注应采用容差处理,避免严格精确匹配。
  3. 若需裁剪音频,可参考speech_start_msspeech_end_ms字段。
  4. 重新生成数据时,以仓库中的清单和脚本为准。
搜集汇总
数据集介绍
realtime-turn-detection-test-data 数据集图片
构建方式
面向实时语音交互系统的行为验证需求,该数据集以合成语音为媒介构建测试语料。所有WAV音频文件均为OpenAI文本转语音服务的原始输出,未经后续修剪或混音处理,生成清单与脚本作为可追溯的权威依据。配套的metadata.jsonl遵循Hugging Face AudioFolder规范,逐一记录生成输入、文件摘要、期望文本、转写结果以及由whisper-1模型推导的词级与语音区间标注。受托管模型版本更迭影响,重新生成仅具程序性一致而非逐位可复现。
特点
数据集以黑盒测试为导向,刻意保留纯净语音片段,将静音填充、音频拼接与流式分块边界的控制权交由下游测试逻辑。其标注并非样本级精确真值,而是模型衍生的参考区间,需配合显式容差使用。每条记录中的speech_start_ms与speech_end_ms字段为语音裁剪提供便利。整体规模精简、语义明确,适用于语音活动检测与实时接口的鲁棒性评估,且不涉及真实用户隐私。
使用方法
使用时可借助Hugging Face datasets库的AudioFolder加载器读取metadata.jsonl,获取音频路径、期望文本及时间区间。测试流程应依据场景需求自行注入静音、组合多条录音并设定流式块边界,再调用目标Realtime API进行行为比对。评估转写或端点检测时,须以whisper-1派生区间为参考并施加合理容差,避免将其视为精确标注。如需调整语音片段范围,可直接利用speech_start_ms与speech_end_ms执行裁剪。
背景与挑战
背景概述
实时语音交互系统的性能评估依赖于可复现的测试语料,然而真实录音涉及隐私且难以覆盖多样化的边界场景。realtime-turn-detection-test-data由Speaches社区于2024年前后构建,旨在为Realtime API的黑盒行为测试提供受控的合成语音素材。该数据集以OpenAI文本转语音模型的原始输出为唯一音频来源,配套元数据记录生成输入、期望文本及基于whisper-1的转录与词级时间区间,为语音活动检测与轮次判定研究提供了可审计的基准,推动了实时语音接口测试方法论的规范化。
当前挑战
该数据集所应对的核心领域问题在于实时语音轮次检测与语音活动检测的鲁棒性评估,传统方案多依赖真实录音,难以兼顾隐私合规与场景覆盖。构建过程中的主要挑战包括:合成语音缺乏自然停顿与背景噪声,测试需自行拼接静音与流式分块边界;时间区间来自whisper-1的模型推断而非样本级精确标注,存在系统性偏差;此外,托管语音与转录模型随版本更迭产生漂移,导致数据再生成仅具程序性可复现而非逐位可复现,对跨版本实验的严格对照构成制约。
常用场景
经典使用场景
在实时语音交互系统的性能评估领域,该数据集充当了黑盒测试的基准语料库。其经典使用场景聚焦于检验实时API在流式传输条件下的端点检测与语音活动识别能力。研究者利用每段合成语音的纯净WAV文件,人为构造静音区间与流式数据块边界,模拟真实通话中的断续与延迟。借助metadata.jsonl提供的词级与语音区间标注,测试框架可精确评估系统对语音起止时刻的判别精度,并依据显式容差容忍模型衍生标注的微小偏差,从而系统性地量化实时接口在动态音频流中的响应行为。
解决学术问题
该数据集直面实时语音处理研究中长期存在的可复现性与基准缺失问题。传统评估多依赖真实录音,受环境噪声、说话人变异及版权限制影响,难以开展受控实验。本数据集以合成语音为媒介,提供标准化的文本、音频与时间区间参考,使不同团队能在统一条件下比较端点检测算法的鲁棒性与延迟特性。其引入的模型衍生标注与显式容差机制,为处理非样本精确真值提供了方法论参考,推动了语音活动检测与流式推理评估的规范化,对实时人机交互领域的基准建设具有先导意义。
衍生相关工作
该数据集衍生了一系列围绕实时语音接口测试与评估的经典工作。基于其标注格式与生成流程,研究者构建了自动化测试框架,用于持续集成环境下的API行为验证与性能监控。部分工作扩展了静音注入与流式分块策略,形成了针对不同实时场景的测试套件。另一些研究则利用其词级区间标注,探索端点检测与语音识别联合优化的可能性,并催生了面向流式推理的容差评估指标。这些衍生工作共同丰富了实时语音系统的黑盒测试方法论,并为后续基准数据集的构建提供了可借鉴的范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务