遇见数据集

Open Yap 1K

收藏
github2026-09-01 更新2026-09-03 收录
官方服务:

资源简介:

世界上最大的自然双人英语对话开放数据集,包含1000小时的分声道音频。

The world's largest open dataset of natural two-person English conversations, containing 1,000 hours of separately channeled audio.

创建时间:
2026-08-24
原始信息汇总

Open Yap 1K 是一个大规模开源数据集,包含1000小时、1602段自然双人英语对话,共239位说话人,音频以48kHz、16-bit PCM格式录制。

该数据集的特点在于对话双方并不被指定话题或搭档,参与者自行邀请熟人进行自由交谈。数据集为此提供了每段对话的重叠、说话轮次间隔和语速等标注信息。

内容概况:

  • 音频时长: 1,000小时
  • 对话数量: 1,602段
  • 说话人数: 239人
  • 采样率: 48 kHz, 16-bit PCM

相关的文档资料包括数据集说明、架构文档、测量方法和访问指引等,存放于代码库中。文档涵盖了数据集的制作背景、使用授权和获取流程等信息。

搜集汇总
数据集介绍
Open Yap 1K 数据集图片
构建方式
Open Yap 1K数据集由The Agentic Data Company构建,是世界上最大的自然双人英语对话开源数据集。其构建方式独特,摒弃了传统语料库如Fisher和Switchboard中指定陌生搭档和话题的做法,而是鼓励参与者邀请自己熟悉的人进行自由对话。数据采集自239位说话者,录制了1,602段对话,总计1,000小时的音频,且采用48kHz采样率和16-bit PCM格式进行双声道分离录制,确保了高保真度和清晰的声道分离。
特点
该数据集的核心特点在于其自然性:由于对话双方为熟人,对话中包含了更多的打断、反馈词和较短的说话间隔,更贴近真实日常交流。此外,数据集为每个对话提供了重叠、话轮转换间隔和语速等详细注释,这些元数据对于研究对话动态至关重要。与现有可比数据集相比,Open Yap 1K是最大的商用授权自然双人对话数据集,且音频为宽带,提供了更丰富的语音信息,超越了传统窄带语料库。
使用方法
研究人员可通过Hugging Face平台预览样本,并使用提供的Python工具下载免费样本。完整语料库需通过官方网站请求获取,并遵循相应数据使用协议。数据集附带详细的文档,包括数据表、模式定义、归档布局、测量方法、来源描述和访问指南,以及机器可读的统计文件和JSON Schema。这便于用户进行深度集成,如用于训练和评估会话AI系统,或研究自然对话中的打断和重叠现象。
背景与挑战
背景概述
Open Yap 1K是The Agentic Data Company于2026年发布的大规模自然双人英语对话数据集,由239位参与者贡献了1602段、总计1000小时的通道分离音频,采样率为48kHz,位深16-bit。其核心研究问题在于突破传统对话语料库(如Fisher、Switchboard)中陌生人配对与限定话题的局限,通过支持熟人间的自由对话,捕捉更真实的交互特征,如频繁打断、重叠话语及短轮换间隙。该数据集以宽频带、高质量音频和开放的商用许可,为语音识别、对话系统及交互分析提供了宝贵资源,被誉为目前最大的开放自然双人英语对话语料库。
当前挑战
该数据集面临的挑战主要体现在两方面。其一,在领域问题层面,自然对话研究长期受限于语料获取难度,已有语料多由陌生人围绕指定话题展开,缺乏对自由交流中动态交互的捕捉;Open Yap 1K虽采集了熟人对话,但如何准确量化重叠语音、回馈词和轮换间隙等复杂交互行为,仍是语音处理技术的一大难点。其二,在构建过程中,需在保证语音自然性的同时,应对多说话人分离导致的串扰、不同环境噪声干扰以及声道一致性等技术难题。此外,数据采集涉及大量隐私与同意事宜,需建立严格伦理流程,平衡数据开放性与个人权益保护。
常用场景
经典使用场景
Open Yap 1K数据集的核心使用场景聚焦于自然双人英语对话的语音研究,其独特之处在于未指定话题或搭档,由参与者与熟悉之人自由交谈,从而捕捉到打断、回馈词及短话轮间隔等真实对话特征。该数据集提供1,000小时、48kHz宽频、声道分离的音频,为训练和评估对话式AI系统(如语音识别、说话人分离、对话状态跟踪)提供了高保真、贴近真实的基准资源,尤其适用于研究非脚本化、高交互性的口语对话建模,突破了传统配对陌生人、窄带电话语料的局限。
衍生相关工作
该数据集的发布催生了一系列相关研究工作,涵盖对话语音识别系统的鲁棒性提升、基于自监督学习的说话人表征优化,以及面向对话场景的语音合成模型。研究者利用其标注的说话人重叠和时间戳,开发了精细的对话事件检测算法,并探索了跨说话人情感迁移的新途径。此外,Open Yap 1K已被用作生成合成对话数据的种子,以扩充训练语料,服务于少样本场景下的语音助手个性化。其在数据集文档中采用的测量与质控方法,也为后续语料库构建树立了参考标杆,激励了更符合伦理规范的数据收集实践。
数据集最近研究
最新研究方向
随着语音人工智能技术的飞速发展,真实、自然的人机对话系统对训练数据的需求日益迫切。Open Yap 1K数据集以1000小时、239位说话人、1602场对话的规模,填补了自然双人英语对话数据在公开领域的空白,其核心创新在于摒弃了传统的陌生人配对与指定话题模式,通过鼓励熟人间的自由交谈,捕获了打断、回馈语、话轮间隔等真实对话中的关键韵律特征。该数据集采用48kHz宽带采样与声道分离技术,相较于早期窄带语料库,显著提升了语音细节的保真度,为语音识别、说话人验证、对话建模等前沿研究提供了高价值资源。其商业可用的许可协议更是打破了学术研究与产业应用之间的壁垒,有望推动语音AI在辅助沟通、情感计算及人机协同等热点领域的实质性突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务