遇见数据集

FANTOM

收藏
arXiv2023-11-01 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

FANTOM是由艾伦人工智能研究所和卡内基梅隆大学等机构合作开发的一个新型基准数据集,旨在通过问答形式测试机器在信息不对称对话情境中的心理理论(ToM)能力。该数据集包含256个多角色围绕特定主题的对话,涉及角色进出讨论,导致信息不对称下的不同心理状态。FANTOM的目标是有效测量模型在对话中跟踪多个角色信念的能力,特别是在某些信息对某些参与者不可访问的情况下。数据集创建过程中,利用了心理学理论和大型语言模型的实际考虑,设计了多种类型的挑战性信念问题,以识别模型在ToM能力上的幻觉。FANTOM的应用领域主要集中在评估和提升语言模型在社交互动中的理解和推理能力,特别是在需要理解他人心理状态的复杂情境中。

FANTOM is a novel benchmark dataset developed collaboratively by institutions including the Allen Institute for AI and Carnegie Mellon University. It aims to test machines’ Theory of Mind (ToM) capabilities in conversational scenarios with information asymmetry via question-answering formats. The dataset contains 256 multi-role dialogues centered on specific topics, where characters join and leave the discussion, leading to distinct mental states under information asymmetry. The core goal of FANTOM is to effectively measure models’ ability to track multiple agents’ beliefs during conversations, particularly in cases where certain information is inaccessible to some participants. During the dataset construction process, psychological theories and practical considerations for large language models (LLMs) were leveraged to design various types of challenging belief questions, aimed at identifying hallucinations in models’ ToM capabilities. The primary application scenarios of FANTOM focus on evaluating and enhancing language models’ comprehension and reasoning capabilities in social interactions, especially in complex contexts that require understanding others’ mental states.

创建时间:
2023-10-24
搜集汇总
数据集介绍
FANTOM 数据集图片
构建方式
FANTOM的构建基于信息不对称的多方对话场景,通过大语言模型InstructGPT自动生成包含角色进出讨论的对话,并设计管道分三步构建:首先生成带有信息不对称的对话,随后提取事实问答对,最后将事实问答转化为六类心理理论问题,包括自由回答、多项选择和是非判断等格式。所有对话和问答对均经过众包人工验证,确保质量与安全性。
特点
该数据集的核心特点在于以自然对话为媒介,模拟真实社交互动中的心理理论推理,避免了叙事文本中的报告偏差。通过角色进出对话造成的信息不对称,自然产生不同的心理状态,并设计具有高词汇重叠度的错误答案以检测模型的捷径模式匹配。数据集涵盖256段对话、约1万道问题,包含多种问题类型以识别模型的虚假心理理论能力。
使用方法
FANTOM通过问答形式评估模型对对话中角色信念的追踪能力。输入为完整或截取的对话上下文,模型需回答关于角色知识状态的多种问题,包括信念选择、列表列举和是非判断。评估时,模型作为全知观察者,需区分自身可获取信息与特定角色不可获取信息,通过准确率、F1分数及跨问题类型的一致性指标衡量心理理论推理的稳健性。
背景与挑战
背景概述
心理理论(Theory of Mind, ToM)是认知科学与社会智能领域中的核心概念,指个体理解他人心理状态(如信念、意图与知识)的能力。长期以来,针对机器心理理论的评估主要依赖于静态叙事文本,这类评估范式天然缺乏交互性,且易受报告偏差影响,导致模型可能展现出虚假的心理理论能力。为解决这一局限,来自艾伦人工智能研究所、华盛顿大学、卡内基梅隆大学及首尔国立大学的研究团队于2023年联合提出了FANTOM基准数据集。该数据集以多轮对话为媒介,通过设置角色进出对话所引发的信息不对称情境,系统性地构建了包含约1万道问题的测评体系,旨在从问答层面深度检验大语言模型在动态交互中追踪他人信念的连贯性与鲁棒性。FANTOM的发布为心理理论评估开辟了以交互为核心的新方向,对推动人工智能通用智能的发展具有重要启示意义。
当前挑战
FANTOM所应对的核心领域挑战在于现有心理理论评估过度依赖叙事文本,难以真实反映模型在自然交互中的社会推理能力,且模型常利用文本中的表面线索产生虚假的心理理论表现。在数据集构建过程中,研究团队面临多重技术挑战:首先,需要设计出自然且信息不对称的多方对话,确保角色间的心理状态天然分离,满足心理学中“非融合”与“心理化”的理论要求;其次,需自动生成多种类型的心理理论问题,以识别模型在不同问题格式下表现出的不一致性,即虚幻的心理理论现象;此外,还需通过人工验证确保对话的连贯性与安全性,并剔除约8.6%的错误问题集,以保障数据集的高质量与可靠性。这些挑战共同使得FANTOM成为当前最具难度的大语言模型心理理论评测基准之一。
常用场景
经典使用场景
FANTOM作为一项专为压力测试机器心理理论而设计的基准,其经典使用场景聚焦于多轮对话中信息不对称情境下的问答任务。该数据集模拟了现实社交互动中角色进出对话的自然动态,通过构建角色间信息获取的差异,评估模型追踪与推断他人信念的能力。例如,当一个角色暂时离开讨论后返回,其无法获知缺席期间交换的信息,模型需据此回答关于该角色信念的各类问题,从而检验其对他人心理状态的深层理解。
衍生相关工作
FANTOM的提出催生了一系列衍生工作,包括探索基于信念图谱的插件式多角色信念追踪方法,以及通过交互式学习增强模型社会推理的策略。此外,该基准启发了将心理理论评估与视觉信息、语用推理相结合的跨模态研究方向。这些工作共同深化了对大语言模型内部一致性的理解,并为构建更稳健的社会推理系统奠定了方法论基础,推动了从简单叙述测试向复杂交互场景评估的范式转变。
数据集最近研究
最新研究方向
在人工智能与认知科学的交叉领域,心智理论(Theory of Mind, ToM)的评估正从静态叙事向动态交互场景转型。FANTOM基准数据集应运而生,它通过构建信息不对称的多方对话环境,系统性地检验大语言模型在真实社交互动中的心理状态推理能力。该数据集巧妙模拟了人类对话中角色进出、信息片段化等自然现象,设计出涵盖信念追踪、信息可及性判断等多层次问题,有效揭示了当前顶尖模型在连贯性推理上的显著短板——即便采用思维链推理或微调策略,其表现仍与人类存在巨大鸿沟。这一前沿方向不仅触及了人工智能通用智能发展的核心争议,更为评估语言模型的社会认知能力提供了更具生态效度的新范式,对推动人机交互系统的认知真实性具有里程碑式的意义。
相关研究论文
  • 1
    FANToM: A Benchmark for Stress-testing Machine Theory of Mind in Interactions艾伦人工智能研究所 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务