5a-academia-attractions/QUACK
收藏官方服务:
资源简介:
来自QUACK多模态社交推理基准的原始结构化事件日志(game.jsonl)。
Raw structured event logs (game.jsonl) from the QUACK multimodal social deduction benchmark.
搜集汇总
数据集介绍

构建方式
QUACK数据集专为多模态社会推理智能体研究而构建,通过模拟经典“鹅与鸭”社交推理游戏,系统性地收集了270场完整对局的结构化日志。实验设计涵盖9种条件,包括3种同质条件(所有玩家均为同一视觉语言模型,如GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro)和6种异质条件(鹅与鸭角色分别由不同模型担任)。每类条件运行30个随机种子(种子1-30),确保了数据的统计稳健性与可复现性。每条对局日志以事件驱动格式存储,包含事件类型、时间戳、状态及配置信息,支持完整的游戏回放与深度分析。
使用方法
研究者可直接加载日志文件中的事件流,从`game_started`事件提取初始状态与配置,重现任意对局的完整演化过程。通过分析不同模型组合在“鹅”与“鸭”角色下的决策模式、信息共享策略及社会感知能力,可量化评估视觉语言模型的推理鲁棒性。配套的评估工具与渲染代码已在GitHub仓库中提供,支持事件筛选、可视化回放及自定义指标计算。建议结合论文中的基准设置,对模型在欺骗检测、角色识别和协作沟通等维度进行系统性剖析。
背景与挑战
背景概述
QUACK数据集诞生于2026年,由Ye Yuan、Rui Song等多位研究者联合打造,旨在探索多模态社会推理智能体的沟通与知识验证机制。该数据集聚焦于社交推理任务,模拟“鹅与鸭”类多智能体博弈场景,通过270场游戏日志记录智能体在异质性与同质性条件下的交互行为。作为首个专门针对多模态大型语言模型(VLM)社会推理能力设计的基准,QUACK填补了现有数据集在智能体间知识共享与欺骗检测方面的空白,为验证模型在复杂社交情境中的推理、协作与信息审计能力提供了标准化测试平台,对推动多智能体系统与视觉语言模型融合发展具有重要学术价值。
当前挑战
QUACK数据集所解决的领域问题在于,现有视觉语言模型评估多集中于单智能体任务,缺乏对多智能体社交推理情境中知识沟通与欺骗行为的建模能力。构建过程中面临两大挑战:一是如何设计9种实验条件(包含3种同质性与6种异质性模型组合)以系统模拟真实社交博弈,确保日志结构(如事件类型、时间戳)的可复现性与评估一致性;二是需要协调多模型(如GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro)在30个随机种子下的交互日志采集,平衡计算资源消耗与数据多样性,同时避免因模型版本差异引入系统性偏差。
常用场景
经典使用场景
QUACK多模态社交推理基准数据集,专为探究视觉语言模型在复杂社交互动中的推理与沟通能力而设计。其经典使用场景聚焦于多智能体环境下的社交推理任务,特别是“鹅与鸭”角色扮演游戏,其中部分智能体被赋予欺骗性角色(鸭子),其余为诚实角色(鹅)。研究者借助该数据集可系统评估模型在信息不对称情境中,如何通过多模态线索(如视觉场景与文本对话)进行身份推理、意图识别与策略沟通。270场实验覆盖同构与异构模型组合,为对比不同视觉语言模型的社交推理性能提供了标准化平台。
解决学术问题
该数据集解决了当前多模态大模型研究中的一个关键盲区:在需要协同推理与欺骗检测的社交场景中,模型是否具备超越单轮问答的动态交互智能。传统基准多聚焦于事实问答或单一模态推理,而QUACK通过引入多智能体博弈框架,使学界得以探究模型在欺骗识别、信任建模与信息审计等高级认知任务中的表现。其意义在于揭示了视觉语言模型在社交推理中的系统性弱点,推动研究者关注智能体间的沟通可靠性问题,为构建更具社会感知能力的人工智能系统奠定了实证基础。
实际应用
在实际应用中,QUACK数据集为多智能体协作系统、虚拟角色扮演游戏及人机交互安全评估提供了可复现的测试基准。游戏开发者可借助该日志分析非玩家角色的语义一致性,检测其在复杂社交情境中是否产生误导性行为;社交机器人设计者则能利用异构模型条件下的数据,优化助手在信息不对等环境下的表达策略。此外,该数据集还可服务于对话审计系统的开发,通过对比不同视觉语言模型在欺骗场景中的表现差异,制定更可靠的通信协议与异常行为检测标准。
数据集最近研究
最新研究方向
QUACK数据集为多模态社会演绎推理智能体提供了一个创新性的基准测试框架,其核心在于模拟“鹅与鸭”的社交欺骗场景,以评估视觉语言模型在复杂社交流程中的推理、沟通与欺骗检测能力。当前前沿研究聚焦于同质与异质智能体组合(如GPT-5、Claude Opus、Gemini Pro配对)下的行为模式差异,探索VLMs在猜疑、合作与误导性信息传递中的表现。这一方向紧密关联人工智能安全与对齐领域的热点事件,特别是关于多智能体系统中鲁棒性与诚实性的公开辩论,QUACK通过量化推理链条的可靠性,为构建可信赖的自主对话系统提供了关键性评估手段,推动社会演绎AI向更透明、可审计的方向演进。
以上内容由遇见数据集搜集并总结生成



