遇见数据集

DeepSpeak-Agentic

收藏
arXiv2026-06-02 更新2026-06-04 收录
官方服务:

资源简介:

DeepSpeak-Agentic是由加州大学伯克利分校和斯坦福大学联合创建的大规模人机交互数据集,专注于研究具身AI代理与人类之间的实时对话动态。该数据集包含200段半结构化对话视频,总计37小时的多模态记录,涵盖了对话、专业、协作规划和创意四种场景,数据来源于143种不同的大语言模型、合成语音和视觉化身组合配置。数据采集通过定制化视频流系统实现,自动配对人类参与者和AI代理进行录制,并经过音频分离和内容审核处理。该数据集旨在支持多模态取证分析、人机交互模式研究,并为评估AI代理的逼真度和检测技术提供基准测试平台。

DeepSpeak-Agentic is a large-scale human-computer interaction dataset jointly created by the University of California, Berkeley and Stanford University, focusing on the real-time conversational dynamics between embodied AI agents and humans. This dataset contains 200 semi-structured conversational videos, totaling 37 hours of multimodal recordings, covering four scenarios: dialogue, professional tasks, collaborative planning, and creative creation. The data is sourced from 143 distinct combinations of large language models (LLMs), synthetic speech, and visual avatars. Data collection was implemented via a custom video streaming system that automatically pairs human participants with AI agents for recording, and the collected data underwent audio separation and content moderation processing. This dataset aims to support multimodal forensic analysis and research on human-computer interaction patterns, while providing a benchmark platform for evaluating the fidelity of AI agents and advancing relevant detection technologies.

创建时间:
2026-06-02
搜集汇总
数据集介绍
构建方式
DeepSpeak-Agentic数据集通过一套可扩展的自动化采集系统构建,该系统整合了开源或商业大语言模型、合成语音与视觉化身,生成具身化AI智能体。研究团队通过Prolific平台招募200名经过知情同意的成年参与者,利用定制化视频流应用将人类与随机配置的智能体配对,进行跨对话、专业、协作规划与创意四类场景的半结构化实时视频对话。整个采集过程实现了智能体创建、人机配对、视听记录及后续人机分离的全流程自动化,最终累积超过37小时的多模态交互数据。
特点
该数据集的核心特点在于其动态交互性与多模态融合——不仅包含完整的视听对话记录,还提供了经说话人分离的独立音视频流、带时间戳的ASR转录文本以及涵盖智能体配置、场景类型、设备信息的元数据。与静态深度伪造数据集不同,DeepSpeak-Agentic捕捉了语言模型、合成语音与视觉化身在实时对话中的协同表现,支持对对话轮次、响应延迟、语速密度等交互动力学指标的量化分析。研究还发现,人类参与者平均需3.79秒才能获得智能体响应,且智能体语言密度显著高于人类。
使用方法
该数据集适用于多模态取证检测与人类-智能体交互研究双重场景。研究者可提取分离后的人机音视频流,分别训练或评估文本、语音、视频三类深度伪造检测器,论文已提供Desklib、DF-Arena等12种检测器的基线性能。此外,数据集内置的对话场景标签与智能体配置元数据支持控制变量实验,例如对比不同大模型或语音合成引擎对交互真实感的影响。167个样本经自动化审核与人工复核后保留,确保了数据合规性,而附带的代码库便于复现统计分析与检测基准。
背景与挑战
背景概述
DeepSpeak-Agentic数据集由加州大学伯克利分校与斯坦福大学的Sarah Barrington、Maty Bohacek及Hany Farid于2026年联合创建,旨在捕捉真实时交互中具身化AI代理的视听行为。该数据集包含200段半结构化人机对话视频,总时长超过37小时,由143种不同的大语言模型、合成语音与视觉化身的组合驱动。研究核心聚焦于多模态AI代理的司法鉴别、人机交互动力学分析,以及为嵌入式AI技术构建可扩展的评测基准,填补了从静态深度伪造研究向动态交互式合成媒体跃迁的关键空白。
当前挑战
该领域面临的核心挑战体现在三方面:其一,现有深度伪造检测方法主要针对静态编辑内容,难以泛化到实时交互式AI代理的视听信号,实验中最佳音频检测器的等错误率仅达23%,视频检测器更达33%,揭示出传统检测范式的失效。其二,数据构建过程中需协调多个商业与开源生成管线,设计实时视频流应用以配对人类被试与AI代理,同时通过音视频说话人分离、自动审核(初期68次误判)及隐私过滤等技术环节保障数据质量。其三,代理的响应延迟(平均3.79秒)显著高于人类对话的自然间隙(约250毫秒),成为提升交互真实性的关键瓶颈。
常用场景
经典使用场景
DeepSpeak-Agentic数据集的经典使用场景聚焦于多模态人机交互的真实性评估,尤其是针对具备视觉化身、合成语音与大语言模型能力的具身AI智能体。研究者可借助该数据集中超过37小时的半结构化对话视频,系统性地分析人类在与AI智能体实时互动中的感知偏差与判断线索。该场景不仅涵盖了对话内容的真实性甄别,更延伸至面部表情、口型同步、语音韵律、响应延迟等非语言维度的综合考察,为理解人在何种维度上能够或无法区分人与智能体提供了丰沛的实验素材。
衍生相关工作
围绕DeepSpeak-Agentic数据集已衍生出多项具有前瞻性的研究工作。在取证领域,研究者基于该数据集的分离音视频流,对现有的文本检测器(如Desklib、Binoculars)、音频检测器(如AASIST3、DF-Arena)以及视频检测器(如GenConViT、CLIP-GDD)进行了系统性基准测试,揭示了不同模态检测器在面对实时交互生成内容时的性能差异与瓶颈。在交互研究方面,该数据集被用于分析人类识别AI智能体的多模态线索——从面部运动异常到对话节奏的非自然性——推动了关于人机信任边界与感知阈值的理论探索。此外,数据集配套的可扩展数据采集系统也为未来构建更大规模、更多样化的人机对话语料库奠定了技术基础。
数据集最近研究
最新研究方向
DeepSpeak-Agentic数据集的问世,标志着生成式人工智能研究从静态深度伪造媒体向实时、具身化交互智能体的关键转向。该数据集聚焦于人类与由大语言模型、合成语音及视觉化身驱动的AI代理之间的半结构化对话,记录了超过37小时的音视频交互,不仅为多模态法医鉴定(文本、音频、视频)提供了全新基准,更深刻揭示了人机对话中的动态特征,如话轮转换、响应延迟及言语密度差异。研究显示,尽管人类参与者能迅速辨别AI身份,但现有深度伪造检测器在音频和视频模态上表现乏力,凸显了开发面向交互式、实时生成内容的新型检测范式的紧迫性。这一工作为理解AI代理在现实场景中的说服力与真实性提供了实证基础,也为人机协作伦理与安全治理开辟了前沿探索路径。
相关研究论文
  • 1
    The DeepSpeak-Agentic Dataset加州大学伯克利分校; 斯坦福大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务