遇见数据集

sileod/mindgames

收藏
Hugging Face2023-11-22 更新2024-03-04 收录
官方服务:

资源简介:

--- language: - en license: apache-2.0 multilinguality: - monolingual task_categories: - text-classification task_ids: - natural-language-inference - multi-input-text-classification tags: - theory of mind - tom - Logical-Reasoning - Modal-Logic - Reasoning - Logics - Logic - nli - model-checking - natural language inference dataset_info: features: - name: premise dtype: string - name: smcdel_problem dtype: string - name: n_announcements dtype: int64 - name: pbcheck dtype: string - name: hypothesis dtype: string - name: setup dtype: string - name: hypothesis_depth dtype: int64 - name: n_agents dtype: int64 - name: label dtype: string - name: names sequence: string - name: index dtype: int64 - name: s-l dtype: string - name: deberta_pred dtype: int64 - name: deberta_confidence dtype: float64 - name: difficulty dtype: float64 splits: - name: train num_bytes: 8702021 num_examples: 11174 - name: validation num_bytes: 2904084 num_examples: 3725 - name: test num_bytes: 2909341 num_examples: 3725 download_size: 2989857 dataset_size: 14515446 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* --- Mindgame dataset Code: https://github.com/sileod/llm-theory-of-mind Article (Accepted at EMNLP 2023 Findings): https://arxiv.org/abs/2305.03353 ``` @article{sileo2023mindgames, title={MindGames: Targeting Theory of Mind in Large Language Models with Dynamic Epistemic Modal Logic}, author={Sileo, Damien and Lernould, Antoine}, journal={arXiv preprint arXiv:2305.03353}, year={2023} } ```

语言: - 英语(en) 许可证:Apache-2.0 多语言属性: - 单语言 任务类别: - 文本分类 任务子类型: - 自然语言推理(natural-language-inference) - 多输入文本分类 标签: - 心理理论(theory of mind,ToM) - ToM - 逻辑推理(Logical-Reasoning) - 模态逻辑(Modal-Logic) - 推理(Reasoning) - 逻辑学(Logics) - 逻辑(Logic) - NLI(nli) - 模型检验(model-checking) - 自然语言推理(natural language inference) 数据集信息: 特征: - 名称:前提(premise),数据类型:字符串型 - 名称:smcdel_problem(smcdel问题),数据类型:字符串型 - 名称:n_announcements(公告数),数据类型:整型 - 名称:pbcheck,数据类型:字符串型 - 名称:hypothesis(假设),数据类型:字符串型 - 名称:setup(场景设定),数据类型:字符串型 - 名称:hypothesis_depth(假设深度),数据类型:整型 - 名称:n_agents(智能体数),数据类型:整型 - 名称:label(标签),数据类型:字符串型 - 名称:names(名称列表),数据类型:字符串序列型 - 名称:index(索引),数据类型:整型 - 名称:s-l,数据类型:字符串型 - 名称:deberta_pred(DeBERTa预测结果),数据类型:整型 - 名称:deberta_confidence(DeBERTa置信度),数据类型:浮点型 - 名称:difficulty(难度),数据类型:浮点型 数据集划分: - 名称:训练集(train),字节数:8702021,样本数:11174 - 名称:验证集(validation),字节数:2904084,样本数:3725 - 名称:测试集(test),字节数:2909341,样本数:3725 下载大小:2989857字节 数据集总大小:14515446字节 配置项: - 配置名称:默认(default),数据文件: - 训练集:对应路径data/train-* - 验证集:对应路径data/validation-* - 测试集:对应路径data/test-* 心理游戏(MindGames)数据集 代码仓库:https://github.com/sileod/llm-theory-of-mind 已被EMNLP 2023发现论文(Findings of EMNLP 2023)接收的学术论文:https://arxiv.org/abs/2305.03353 引用格式: @article{sileo2023mindgames, title={MindGames: Targeting Theory of Mind in Large Language Models with Dynamic Epistemic Modal Logic}, author={Sileo, Damien and Lernould, Antoine}, journal={arXiv preprint arXiv:2305.03353}, year={2023} }

提供机构:
sileod
原始信息汇总

数据集概述

基本信息

  • 语言: 英语
  • 许可证: Apache-2.0
  • 多语言性: 单语
  • 任务类别: 文本分类
  • 任务ID:
    • 自然语言推理
    • 多输入文本分类
  • 标签:
    • 理论思维
    • 逻辑推理
    • 模态逻辑
    • 推理
    • 逻辑
    • 自然语言推理
    • 模型检查

数据集特征

  • premise: 字符串
  • smcdel_problem: 字符串
  • n_announcements: 整数
  • pbcheck: 字符串
  • hypothesis: 字符串
  • setup: 字符串
  • hypothesis_depth: 整数
  • n_agents: 整数
  • label: 字符串
  • names: 字符串序列
  • index: 整数
  • s-l: 字符串
  • deberta_pred: 整数
  • deberta_confidence: 浮点数
  • difficulty: 浮点数

数据集分割

  • 训练集:
    • 字节数: 8702021
    • 示例数: 11174
  • 验证集:
    • 字节数: 2904084
    • 示例数: 3725
  • 测试集:
    • 字节数: 2909341
    • 示例数: 3725

数据集大小

  • 下载大小: 2989857
  • 数据集大小: 14515446

配置

  • 默认配置:
    • 训练数据路径: data/train-*
    • 验证数据路径: data/validation-*
    • 测试数据路径: data/test-*
搜集汇总
数据集介绍
sileod/mindgames 数据集图片
构建方式
MindGames数据集由Damien Sileo与Antoine Lernould于2023年构建,旨在评估大语言模型在心理理论(Theory of Mind)推理方面的能力。该数据集基于动态认知模态逻辑(Dynamic Epistemic Modal Logic)框架,通过生成包含多智能体知识更新与公告逻辑的复杂场景来构建样本。每个样本由前提(premise)、假设(hypothesis)及标签(label)组成,其中前提描述了初始认知状态与一系列公告事件,假设则需模型判断其真假。数据集包含18624个样本,划分为训练集(11174例)、验证集(3725例)与测试集(3725例),并附有DeBERTa模型的预测结果与置信度作为参考基准。
使用方法
该数据集适用于文本分类与自然语言推理任务,用户可直接加载预划分的训练、验证与测试集进行模型微调与评估。典型用法是将前提与假设拼接为输入序列,预测标签(如蕴含、矛盾或中立)。研究者可借助n_agents、hypothesis_depth等特征进行细粒度分析,探究模型在不同复杂度场景下的表现。数据集以Apache-2.0许可证发布,代码与论文已公开于GitHub与arXiv,便于复现实验与拓展研究。
背景与挑战
背景概述
在人工智能领域,心智理论(Theory of Mind, ToM)的建模与评估一直是认知科学与自然语言处理交叉研究中的核心议题。2023年,由Damien Sileo和Antoine Lernould联合推出的MindGames数据集,发表于EMNLP 2023 Findings,旨在系统性地评估大型语言模型在动态认知逻辑推理中的心智理论能力。该数据集基于动态认知模态逻辑(Dynamic Epistemic Modal Logic)构建,通过精心设计的自然语言推理(NLI)任务,考察模型对他人信念、知识状态的推断与更新能力。MindGames的诞生填补了现有基准在形式化、可扩展的ToM评估方面的空白,为理解语言模型是否具备类人的社会认知能力提供了严谨的测试平台,对推动可解释人工智能与认知架构的发展具有重要影响。
当前挑战
MindGames数据集所面临的挑战首先源于其核心研究问题:如何通过自然语言推理任务准确衡量语言模型的心智理论能力。传统NLI基准多聚焦于事实性逻辑,而ToM涉及对他人信念的递归建模与动态更新,这对模型的结构化推理与模态逻辑理解提出了极高要求。在构建过程中,研究者需要将复杂的形式逻辑问题(如多智能体知识更新)转化为自然语言表述,同时确保标签的准确性与覆盖的多样性,这涉及从逻辑公式到文本的映射难题。此外,数据集的难度分层(如hypothesis_depth参数)揭示了模型在应对深层嵌套信念时的性能瓶颈,当前主流模型在此类任务上的表现仍远低于人类水平,凸显了在动态社会推理领域评估与改进语言模型的持续挑战。
常用场景
经典使用场景
MindGames数据集的核心应用场景在于评估与训练大型语言模型在心理理论(Theory of Mind)推理方面的能力。该数据集基于动态认知模态逻辑(Dynamic Epistemic Modal Logic)构建,通过生成涉及多智能体知识状态更新与逻辑推理的文本对(前提与假设),要求模型判断假设是否在给定情境下成立。典型任务涵盖自然语言推理(NLI)与模型检测(Model Checking),例如模拟智能体在多次公开声明后对彼此信念的推断,从而检验模型对他人心理状态建模的精准度。
解决学术问题
该数据集精准回应了当前自然语言处理领域的一个关键学术挑战:如何系统性地评测大语言模型在复杂逻辑推理与心理理论任务上的局限性。传统基准多聚焦于常识推理或简单逻辑,而MindGames通过引入模态逻辑与多智能体知识动态更新,揭示了现有模型在理解嵌套信念、公共知识及推理深度递增时的显著短板。其意义在于为学术界提供了一个可控、可扩展的测试平台,推动了对语言模型认知架构的深入剖析,并为后续研究如何增强模型的抽象推理与社会认知能力奠定了方法论基础。
实际应用
在实际应用层面,MindGames所评测的能力直接关联到人机交互与协作智能系统的效能提升。例如,在智能客服、教育辅导或虚拟角色扮演场景中,系统需准确推断用户的隐含意图、误解或知识状态,从而提供更具适应性的回应。此外,该数据集引导的推理能力可应用于法律文本解析、医疗诊断辅助等需要严格逻辑推演的领域,确保AI在信息不对称或动态变化的环境中做出合理决策,减少因缺乏心理理论而导致的沟通失误。
数据集最近研究
最新研究方向
基于动态认知模态逻辑的心智理论推理评估与增强研究
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务