遇见数据集

kyutai/interactivity-alignment-samples

收藏
Hugging Face2026-06-10 更新2026-06-14 收录
官方服务:

资源简介:

该数据集包含论文《多层面交互对齐在全双工语音模型中》的音频样本。这些样本是在Full-Duplex-Bench v1(使用预录制输入的静态评估)和Full-Duplex-Bench v2(与GPT-Realtime进行实时多轮对话)上生成的,用于博客文章和演示页面。每个文件都是立体声WAV格式,其中通道0承载输入说话者,通道1承载模型的输出。样本比较了基础模型(Moshi、PersonaPlex)与经过强化学习后训练版本(在Fisher和Seamless Interaction数据集上训练)的表现。数据集按任务和变体组织,包括合成暂停处理、坦诚轮转、ICC反馈、合成用户中断等任务,以及不同模型变体的音频文件。

This repository hosts the audio samples generated on Full-Duplex-Bench v1 (static evaluation with pre-recorded input) and Full-Duplex-Bench v2 (real-time multi-turn dialogue with GPT-Realtime), used in the blog post and demo page. Each file is a stereo WAV where channel 0 carries the input speaker and channel 1 carries the models output. The samples compare base models (Moshi, PersonaPlex) against our RL post-trained versions on Fisher and Seamless Interaction datasets. The dataset is organized by tasks and variants, including tasks such as synthetic pause handling, candor turn taking, ICC backchannel, synthetic user interruption, and audio files for different model variants.

提供机构:
kyutai
搜集汇总
数据集介绍
kyutai/interactivity-alignment-samples 数据集图片
构建方式
该数据集收录了论文《Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models》中生成的音频样本,基于Full-Duplex-Bench v1(静态评估,使用预录输入)与Full-Duplex-Bench v2(实时多轮对话,借助GPT-Realtime)两大基准构建。所有文件均为立体声WAV格式,其中通道0承载输入说话人语音,通道1承载模型输出。数据集通过对比包括Moshi和PersonaPlex在内的基础模型及其经过强化学习后训练版本的音频表现,系统性地评估模型在全双工语音交互中的对齐效果。
特点
该数据集的一大特色在于其多层次、多维度的交互对齐评估设计。v1版本涵盖四项静态任务,如合成暂停处理、坦诚话轮转换、智能回馈及合成用户打断,而v2版本则包含日常对话、纠正、实体追踪与安全四项实时多轮任务。每个样本均配有明确的变体标识,清晰区分基础模型与分别基于Fisher数据集和Seamless Interaction数据集后训练的版本,便于研究者进行细粒度的性能对比与复现分析。
使用方法
用户可通过浏览文件结构便捷地访问样本,路径格式为fdb_v1/<任务>/<样本ID>/<变体>.wav或fdb_v2/<任务>/<样本ID>/<变体>.wav。建议使用支持立体声WAV的音频播放器或编程库(如Python的soundfile)加载文件,其中左声道(通道0)用于聆听输入语音,右声道(通道1)用于分析模型输出。研究者可根据变体键选择感兴趣的模型版本,并结合论文中的评估指标,系统性地比较不同后训练策略对全双工语音模型交互能力的影响。
背景与挑战
背景概述
全双工语音模型旨在实现人机之间自然、实时的对话交互,其核心挑战在于如何准确捕捉并响应对话中的多维度交互信号,如话轮切换、打断、回馈等。2026年,由Kyutai研究机构的Atsumoto Ohashi、Neil Zeghidour、Alexandre Défossez和Eugene Kharitonov等人提出的“Multi-Faceted Interactivity Alignment”研究,首次系统性地探索了通过强化学习后训练对齐全双工语音模型交互行为的方法。该数据集作为论文的配套音频样本,构建了Full-Duplex-Bench v1(静态评估)和Full-Duplex-Bench v2(实时多轮对话)两个基准,比较了Moshi、PersonaPlex等基础模型与经Fisher数据集或Seamless Interaction数据后训练版本的表现。这一工作为全双工语音交互的定量评估提供了标准化平台,对推动实时对话系统的发展具有重要影响力。
当前挑战
该数据集所解决的领域问题核心挑战在于:全双工语音模型需同时处理话语内容与交互行为(如打断、暂停、回馈等),而现有模型常缺乏对多维度交互信号的精细控制,导致对话不自然。构建过程中面临两大挑战:一是设计包含多种交互任务(如暂停处理、坦率话轮切换、回馈、打断)的静态基准Full-Duplex-Bench v1,需确保任务场景覆盖真实对话中的关键交互模式;二是构建实时多轮对话基准Full-Duplex-Bench v2,要求评估框架能够捕捉动态对话中模型的响应速度与语境连贯性,同时实现基础模型与后训练版本的公平对比,这对数据同步、标注一致性及重放机制提出了严格要求。
常用场景
经典使用场景
在语音交互技术的演进中,全双工语音模型因其能够实现如同人类对话般的同步交流而备受关注。该数据集的核心应用场景在于评估和对比不同阶段的全双工语音模型在多维度交互对齐上的表现。通过提供Full-Duplex-Bench v1静态评估与v2实时多轮对话基准上的立体声样本,研究者能够直观地聆听基准模型(如Moshi、PersonaPlex)及其经由强化学习后训练所得版本在暂停处理、轮流说话、打断处理等任务中的差异。这一设置使得数据集成为检验全双工语音模型交互自然度与流畅性的标准工具。
解决学术问题
学术研究中,全双工语音模型面临的关键挑战在于如何实现多方面的交互对齐,即模型需在听觉感知、语言理解、生成与时机控制上达到和谐统一。该数据集依托Full-Duplex-Bench v1与v2,系统性地量化了模型在合成暂停处理、坦诚轮流说话、交互式反馋背信道以及合成用户打断等任务中的表现。它解决了传统评估方法仅关注单轮响应或离线处理的局限,为衡量模型在动态、实时对话中的交互质量提供了可靠基准。其意义在于推动交互对齐理论的发展,揭示了强化学习后训练在优化模型交互行为中的核心作用。
衍生相关工作
作为全双工语音模型交互对齐研究的伴随资源,该数据集衍生了一系列重要工作。其依托的论文引入的多方面交互对齐框架,为后续探索模型在社会信号感知与生成方面的对齐提供了方法论基础。基于此,研究人员进一步拓展了Full-Duplex-Bench评估体系,衍生出针对非语言线索(如韵律、情感)的专项基准。同时,数据集中的RL后训练方法激发了关于利用大规模对话数据增强模型交互灵活性的研究热潮,例如将Fisher数据集与Seamless Interaction数据集结合的改进策略,已被后续的语音交互一致性模型所借鉴。这些工作共同推动了全双工语音系统从实验室原型向实用化、人性化方向迈进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务