遇见数据集

Hi-ToM/Hi-ToM_Dataset

收藏
Hugging Face2023-10-29 更新2024-03-04 收录
官方服务:

资源简介:

# Hi-ToM Dataset This is the dataset for the paper "Hi-ToM: A Benchmark for Evaluating Higher-Order Theory of Mind Reasoning in Large Language Models". <img src=media/Picture1.png height=430> ### The `Hi-ToM_data` folder Contains ToMh data consisting of story-question pairs and the corresponding answers. The names of subfolder branches have the following meanings: - `Tell` / `No_Tell`: whether or not the stories contain communications among agents. - `MC` / `CoT`: the prompting style. `MC` corresponds to Vanilla Prompting (VP) in the paper, while `CoT` stands for Chain-of-Thought Prompting (CoTP). - `length_n`: the story length, i.e. the number of chapters in a story. From 1 to 3. - `sample_n`: the numbering of different sample stories. - `order_n`: the ToM order of the question. From 0 to 4. ### The `Hi-ToM_prompt` folder Contains prompt files that can be directly input to API. The data in it are almost the same as `Hi-ToM_data`, except that answers are eliminated. ### Generate new data and prompts Run the script `generate_tomh.sh`.

# Hi-ToM 数据集 本数据集配套论文《Hi-ToM:评估大语言模型(Large Language Model, LLM)高阶心理理论推理能力的基准测试集》。 <img src=media/Picture1.png height=430> ### `Hi-ToM_data` 文件夹 该文件夹包含高阶心理理论(Theory of Mind, ToM)数据,由故事-问题对与对应答案组成。子文件夹分支的命名规则说明如下: - `Tell` / `No_Tell`:表示故事中是否存在智能体间的通信交互。 - `MC` / `CoT`:代表提示词范式。其中`MC`对应论文中的 Vanilla 提示(Vanilla Prompting, VP),`CoT`即思维链提示(Chain-of-Thought Prompting, CoTP)。 - `length_n`:表示故事长度,即故事的章节数,取值范围为1至3。 - `sample_n`:不同示例故事的编号。 - `order_n`:问题对应的心理理论阶数,取值范围为0至4。 ### `Hi-ToM_prompt` 文件夹 该文件夹包含可直接输入API的提示词文件。其数据内容与`Hi-ToM_data`基本一致,仅移除了答案字段。 ### 生成新数据与提示词 运行脚本`generate_tomh.sh`即可生成全新数据与提示词。

提供机构:
Hi-ToM
原始信息汇总

Hi-ToM 数据集

数据集概述

Hi-ToM 数据集是为论文 "Hi-ToM: A Benchmark for Evaluating Higher-Order Theory of Mind Reasoning in Large Language Models" 创建的。

数据结构

Hi-ToM_data 文件夹

该文件夹包含 ToMh 数据,包括故事-问题对及其对应答案。子文件夹名称的含义如下:

  • Tell / No_Tell: 故事是否包含代理之间的通信。
  • MC / CoT: 提示风格。MC 对应论文中的 Vanilla Prompting (VP),而 CoT 代表 Chain-of-Thought Prompting (CoTP)。
  • length_n: 故事长度,即故事中的章节数,范围从 1 到 3。
  • sample_n: 不同样本故事的编号。
  • order_n: 问题的 ToM 阶数,范围从 0 到 4。

Hi-ToM_prompt 文件夹

该文件夹包含可以直接输入 API 的提示文件。数据与 Hi-ToM_data 几乎相同,但答案被删除。

数据生成

运行脚本 generate_tomh.sh 可以生成新的数据和提示。

搜集汇总
数据集介绍
构建方式
Hi-ToM数据集源于对高阶心智理论推理能力评估的迫切需求,旨在系统性地衡量大语言模型在复杂社会认知任务中的表现。该数据集通过精心设计的故事-问题对形式构建,故事内容涵盖多智能体间的通信情境(Tell/No_Tell),并依据故事章节数量(length_1至length_3)划分复杂度层级。每个故事对应从0阶到4阶的心智理论问题(order_0至order_4),从而形成层次化的推理挑战。数据集的生成依托自动化脚本(generate_tomh.sh),确保结构一致性与可扩展性,同时提供两种提示风格版本(MC与CoT),分别对应论文中的基础提示与思维链提示范式。
使用方法
使用Hi-ToM数据集时,研究者可直接从Hi-ToM_prompt文件夹中调用预构建的提示文件,这些文件已去除答案,适合直接输入至大语言模型API进行推理测试。对于需要定制化实验的场景,可通过运行generate_tomh.sh脚本生成新的故事-问题对,并灵活调整故事长度、通信条件或问题阶数等参数。评估时,建议采用两种提示风格(MC与CoT)分别测试,以对比基础推理与思维链推理下的性能差异。数据集对应的论文提供了完整的评估协议,包括答案匹配与错误分析策略,确保实验结果的可复现性与可比性。
背景与挑战
背景概述
在人工智能领域,心智理论(Theory of Mind, ToM)作为理解他人信念、意图与知识状态的核心认知能力,长期以来被视为通用人工智能的重要基石。然而,现有基准测试多聚焦于零阶或一阶心智推理,难以评估高阶认知的复杂性。Hi-ToM数据集由研究团队于近期提出,旨在填补这一空白,其核心研究问题在于系统性地评估大语言模型在高阶心智理论推理中的表现,涵盖从零阶到四阶的推理层次。该数据集通过精心设计的故事情境与问答对,揭示了当前模型在处理嵌套信念与多智能体交互时的局限性,为认知科学与人机交互领域提供了关键的评估工具,推动了AI高阶认知能力的可量化研究。
当前挑战
Hi-ToM数据集所面临的挑战首先体现在领域问题的复杂性上:高阶心智理论推理要求模型在多重嵌套的信念、知识传播与沟通情境中保持逻辑一致性,而现有大语言模型往往在超过一阶推理时性能急剧下降,暴露出对递归认知结构的理解不足。在构建过程中,挑战尤为突出:如何确保故事情境中智能体间的通讯信息(Tell/No_Tell)与推理阶数(order_0至order_4)精确匹配,同时控制故事长度(length_1至length_3)对认知负荷的影响,需要严谨的实验设计。此外,提示策略(MC与CoT)的标准化与数据生成的自动化脚本维护,也增加了数据集构建的复杂度与可复现性要求。
常用场景
经典使用场景
在认知科学与人工智能的交叉领域中,心智理论(Theory of Mind, ToM)作为理解他人心理状态的核心能力,一直是评估机器社会智能的重要标尺。Hi-ToM数据集应运而生,专为高阶心智理论推理任务设计,其经典使用场景在于构建多轮叙事故事与问答对,通过控制故事中智能体间的信息传递(如Tell与No_Tell条件)以及故事章节长度,系统性地测试大语言模型在零阶至四阶心智理论推理中的表现。这一设计使得研究者能够精准剖析模型在嵌套信念、意图推断等复杂认知过程中的能力边界。
解决学术问题
该数据集的核心贡献在于填补了高阶心智理论推理基准的空白,解决了以往评估任务仅聚焦于一阶或二阶推理的局限性。通过引入阶次递增的ToM问题(order_0至order_4),Hi-ToM使学术界得以量化大语言模型在递归心理状态建模上的脆弱性,揭示了模型在需要多级信念嵌套推理时常见的逻辑断裂与归因偏差。其意义不仅在于提供标准化评测框架,更在于推动了认知架构与神经符号方法在机器心理模拟中的融合,为理解人工智能的社会认知缺陷提供了关键实验依据。
实际应用
在实际应用层面,Hi-ToM数据集所定义的高阶心智推理能力直接关联于人机协作、智能辅导与社交机器人等需深度理解人类意图的领域。例如,在对话系统中,模型需通过多轮交互推断用户的潜在需求或误解,而Hi-ToM的Tell/No_Tell条件模拟了信息不对称场景,可助力开发更敏锐的共情式AI助手。此外,该数据集在自动化心理评估、教育场景中的学生认知状态追踪,以及游戏AI的非玩家角色行为设计中也展现出显著潜力,推动机器从表面应答迈向真正的社会智能。
数据集最近研究
最新研究方向
在当前人工智能与认知科学交叉的前沿领域,高阶心智理论(Higher-Order Theory of Mind, ToM)推理能力的研究正成为评估大语言模型社会认知深度的关键维度。Hi-ToM数据集应运而生,它通过精心设计的多章节叙事与多阶心理状态追问,系统性地考察模型从零阶至四阶的心智推理层次。该数据集不仅引入了角色间是否存在通信的变量(Tell/No_Tell),还对比了标准提示与思维链提示对推理表现的影响,从而揭示了当前大模型在追踪嵌套信念、理解递归意图方面的能力边界与瓶颈。这一基准的建立,对于推动具备深层社会交互能力的智能系统发展具有里程碑式的意义,也为探索AI在复杂协作、教育辅导及心理评估等场景中的可信应用提供了重要的评估工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务