遇见数据集

Seamless Interaction dataset

收藏
arXiv2026-07-07 更新2026-07-08 收录
官方服务:

资源简介:

SPEARBench基准构建于Seamless Interaction数据集之上,该数据集由研究团队从人类对话语料库中精心构建,旨在评估流式语音到语音语言模型的自然度。数据集包含5419条精选的双人对话片段,总计约37.33小时音频,源自2007段原始对话,覆盖即兴和自然主义两种子集,数据来源于真实的人类互动录音,并经过转录和说话人分离处理。其创建过程通过特定协议从原始对话中提取包含上下文、问题和回答的有效对话结构,确保每个片段均以问题结束并配有真实人类答案。该数据集主要应用于语音到语音模型的自然度评估领域,旨在系统量化模型在响应延迟、语音质量、方言一致性、情感自然度及人际姿态等多维度的表现,以解决现有基准在全面衡量对话行为自然性方面的不足。

SPEARBench is built upon the Seamless Interaction dataset, which was meticulously constructed by a research team from human conversational corpora to evaluate the naturalness of streaming speech-to-speech large language models. The dataset includes 5,419 curated two-party dialogue segments, totaling approximately 37.33 hours of audio, derived from 2,007 original conversations and covering two subsets: impromptu and naturalistic dialogues. The data originates from real human interaction recordings, and has undergone transcription and speaker diarization processing. Its creation process extracts valid dialogue structures containing context, questions and answers from original conversations via a specific protocol, ensuring that each segment ends with a question and is paired with a genuine human response. This dataset is primarily applied in the field of naturalness evaluation for speech-to-speech models, aiming to systematically quantify model performance across multiple dimensions including response latency, speech quality, dialect consistency, emotional naturalness and interpersonal stance, so as to address the shortcomings of existing benchmarks in comprehensively measuring the naturalness of conversational behaviors.

创建时间:
2026-07-07
搜集汇总
数据集介绍
Seamless Interaction dataset 数据集图片
构建方式
Seamless Interaction数据集汇聚了长达113.80小时的英语双人对话录音,涵盖即兴与自然对话两类子集,旨在捕捉真实人际互动中的丰富语用特征。为构建适用于语音到语音模型的评估基准,研究人员从原始对话中提取了逾5000个有效片段,每个片段包含至少三轮对话:前若干轮作为上下文,倒数第二轮为提问,最后一轮为人类回答。这一选段策略确保了每段交互具有完整的问答结构,同时保留了原始人际交流的语境信息,为模型生成回答的自然性评估提供了可靠的对照基准。
特点
该数据集的核心特色在于其多维度的自然性标注与评估框架。基于对话录音的双通道分离特性,数据集不仅保留了原始音频的韵律、语速和情绪等副语言信息,还通过人工标注记录了说话者的人际立场与关系类型。更重要的是,数据集的构建与SPEARBench基准测试深度耦合,可自动计算响应延迟、打断频率、方言一致性、情绪同步性、轮换自然度以及声学特征分布等超过十项指标,从而全面量化模型回答与人类行为之间的差距。
使用方法
在使用该数据集时,研究者需将上下文与提问音频输入待评估的语音到语音模型,由模型生成对应的语音回答。基准测试管道会记录回答的波形与启动时间,并与原始人类回答进行对比分析。具体操作包括使用语音活动检测模型计算响应延迟与打断时长,利用预训练的轮换预测模型评估对话轮换的自然度,以及通过情感识别、方言识别、立场检测等模型自动打分。此外,代码与评估平台均已开源,支持研究者提交新模型结果并通过统一网页进行横向比较。
背景与挑战
背景概述
Seamless Interaction数据集由约翰霍普金斯大学与亚马逊公司的研究人员于2026年联合创建,主要研究者包括Thomas Thebaud、Yuzhe Wang、Hao Zhang等。该数据集聚焦于流式语音到语音语言模型在自然对话中的交互质量评估,核心研究问题在于如何量化模型在响应延迟、轮流转换、韵律表达、语言与方言一致性、情感适配及人际立场等维度上的自然度。基于该数据集开发的SPEARBench基准测试,首次构建了从双人问答交互中提取的受控对话提示,并整合了多维自动评估协议,为语音到语音系统的自然度评价提供了标准化平台。该数据集涵盖即兴与自然主义两种对话子集,包含超过5400个有效对话样本,对推动全双工语音交互系统的研究具有重要影响力。
当前挑战
该数据集所解决的领域问题在于现有语音基准无法全面捕捉对话自然度——传统指标如词错误率和语音质量仅关注信号层面,忽略了时序协调、情感共鸣、方言保持等交互维度。构建过程中面临的核心挑战包括:1)从长达10分钟的双人对话中自动识别包含问题的有效交互片段,需确保上下文、问题与答案的三段式结构完整性;2)针对流式系统需精确测量响应延迟与打断行为,负延迟时间即模型在用户未结束提问时提前发声,需通过语音活动检测模型进行毫秒级标注;3)方言轮廓建模需克服语言识别模型在不同方言间的高精度分类难题,同时评估方言适应性与变异度;4)情感自然度评估需结合语音情感识别、对话上下文嵌入及人际关系编码,构建多模态预测器以区分模型与人类在情绪动态上的差异。
常用场景
经典使用场景
在语音交互系统的演进浪潮中,Seamless Interaction dataset为评估流式语音到语音模型在真实对话中的自然性提供了不可替代的基石。该数据集最经典的使用场景聚焦于构建两说话人问答交互的受控对话提示,通过提取自然对话中连续话轮构成的三段式结构(上下文、问题、人类作答),据此驱动模型生成答案并与原始人类应答进行多维度比对。这一范式使得研究者能够在时序、韵律、情感适配、方言一致性以及人际立场等关键维度上,系统性地量化模型输出与流畅人类互动之间的差距,从而成为衡量当代语音语言模型是否真正具备类人对话特质的标准实验平台。
实际应用
在实际部署层面,Seamless Interaction dataset为智能语音助手的自然度优化提供了可复现的评估基准。产品团队可借助该数据集构建的问答片段库对全双工语音系统进行自动化压力测试,涵盖对用户查询的响应延迟控制、重叠语音中的话轮交接流畅性、跨方言上下文的语调一致性,以及情感共鸣的实时适配。该数据集支持的评估体系已被用于对比商业级流式模型如Gemini 3.1 Flash Live和Qwen3-Omni的交互表现,并已整合至公开在线平台供开发者提交新模型并追踪进展,为语音对话产业从功能正确向体验优雅的跃迁铺设了标准化验证路径。
衍生相关工作
围绕Seamless Interaction dataset,学术界衍生了一系列开创性工作,共同构筑了对话自然性评估的方法论网络。其中,TRACE模型利用该数据集的双通道音频和关系标注训练了基于时序感知的情感互动检测器,实现了对对话中情绪同步性的高精度自动评分。TurnNat模型则基于数据集中的话轮结构,构建了预测性话轮交接自然度评估系统,能够区分简单的延迟统计与复杂的时序模式异常。此外,StanceBench借助该数据集的即兴会话子集中人际立场标注,定义了包含礼貌、温暖、专注等十个维度的立场量化协议。这些工作不仅各自催生了可复用的评测工具,也共同推动了语音交互系统评估从单点指标向结构化多维体系的转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务