遇见数据集

ALMANAC

收藏
arXiv2026-06-05 更新2026-06-08 收录
官方服务:

资源简介:

ALMANAC是由东北大学等机构构建的首个人类协作数据集,专注于为智能体协作提供动作级心理模型标注。该数据集包含2,987条协作动作,源自25个双人会话的50名参与者,每条数据均包含结构化心理模型标注(自我推理、感知伙伴意图、团队目标)及自由形式原理阐述。数据集基于经典地图任务范式构建,通过会话中检查点与会话后回溯标注相结合的方法采集,将空间元素标准化为网格坐标以实现文本编码。该数据集旨在解决当前智能体缺乏协作能力的问题,为评估和提升大语言模型对人类协作行为及底层心理状态的模拟与推理能力提供关键资源。

ALMANAC is the first human collaboration dataset constructed by Northeastern University and other institutions, focusing on action-level mental model annotations for AI agent collaboration. This dataset comprises 2,987 collaborative action instances, derived from 25 two-person collaborative sessions involving a total of 50 participants. Each entry includes structured mental model annotations (covering self-reasoning, perceiving partners' intentions, and team goals) alongside free-form explanatory rationales. Built on the classic map task paradigm, the dataset is collected via a combined approach of in-session checkpoints and post-session retrospective annotations, and standardizes spatial elements into grid coordinates to enable text encoding. This dataset aims to address the current lack of collaborative capabilities in AI agents, serving as a critical resource for evaluating and enhancing the ability of Large Language Models (LLMs) to simulate and reason about human collaborative behaviors and their underlying mental states.

创建时间:
2026-06-05
原始信息汇总

数据集概述

Almanac 是一个用于研究人类协作中基础行为、心理模型和下一步动作预测的数据集,基于指导者-跟随者协作重现地图的任务场景。

数据集规模

  • 数据量范围:1K 至 10K 样本
  • 语言:英语
  • 许可协议:MIT License

任务类型

  • 文本生成(text-generation)
  • 对话式(conversational)

标签与关键词

  • 人类协作、基础行为、心理模型、地图任务、多智能体

实验条件

实验分为两种画布可见性条件:

条件 画布可见性 描述
c1 画布不可见 跟随者的画布对指导者隐藏,指导者无法看到跟随者的绘图进展
c2 画布可见 跟随者的画布对指导者可见,指导者能够看到跟随者的绘图进展

数据集组成

组件 位置 描述
原始会话 data/raw_sessions/{c1,c2}/{study}/ 每次实验中指导者和跟随者的完整时间线、动作日志及计分板
SFT 训练/测试分割 data/sft/{task}/train.jsonl, test.jsonl 用于 4 个预测任务的聊天格式微调数据
基础行为标注 data/grounding/{c1,c2}/{study}/ 大语言模型在每个时间步标注的基础行为
扁平化表格 data/raw_timeline/, data/grounding_timeline/ 每行一个时间步的数据,含训练/测试集及全集
元数据 metadata/ 数据集划分协议、研究索引、基础行为清单

SFT 子任务

数据集提供 4 个 SFT 子任务配置:

  1. follower_next_action — 预测跟随者的下一步动作(消息、绘制、擦除、撤销、重置)
  2. guide_next_action — 预测指导者的下一步动作
  3. follower_mental_model — 预测跟随者每个时间步的心理模型字段
  4. guide_mental_model — 预测指导者每个时间步的心理模型字段

每个 JSONL 行包含对话式的 messages(system / user / assistant)以及任务、角色、画布条件、研究名称、参与者名称、时间线索引、步骤索引等元数据。

基础行为标注

基础行为标签(grounding_act, grounding_rationale)使用 Azure OpenAI 的 gpt-5.5 生成,标注提示词位于 Grounding Acts Human Annotation/llm_propmt.txt。每个研究的文件路径记录在 metadata/grounding_manifest.json 中,动作计数记录在 metadata/studies_index.json 中。

数据集划分

划分基于完整的会话(研究)级别,而非随机采样时间步。

训练集 — c1: study3, study9, study12, study14, study18, study24, study27, study30, study31
训练集 — c2: study2, study4, study6, study10, study11, study13, study20, study22, study35, study37

测试集 — c1: study8, study21, study25
测试集 — c2: study15, study17, study36

完整定义见 metadata/split_protocol.json

使用示例

python from datasets import load_dataset

加载 SFT 数据

ds = load_dataset("NEU-HAI/Almanac", "follower_next_action", split="train") print(ds[0]["messages"])

加载扁平化基础行为时间线数据

g = load_dataset("NEU-HAI/Almanac", "grounding_timeline", split="test") print(g[0]["grounding_act"], g[0]["action_content"])

引用

如果使用 Almanac 数据集,请引用相关的 EMNLP 2026 论文(bibtex 待添加)。

搜集汇总
数据集介绍
ALMANAC 数据集图片
构建方式
在人工智能与人类协作日益密切的背景下,语言智能体在规划、推理与工具使用方面虽已取得长足进步,却仍缺乏对协作过程中伙伴意图与共同目标的持续建模能力。为此,ALMANAC数据集基于社会科学经典的双人路径规划任务——Map Task,通过一个可配置的在线研究平台,采集了50名参与者在25次双人会话中的协作行为。研究团队设计了一套融合协作理论的标注框架:在任务进程中,系统于25%、50%与75%进度节点设置简短检查点,诱发参与者对自身推理、伙伴意图与团队目标的即时汇报;任务结束后,参与者借助行动轨迹截图与检查点记忆锚点,对每一条行动进行事后的细化标注,最终形成2,987条带有行动层面心智模型标注的高质量协作数据。
特点
ALMANAC的核心价值在于首次将理论驱动的心智模型标注与真实人类协作行为在行动层级上加以融合。每一条数据不仅记录了参与者的具体协作动作,更包含了自我推理、感知到的伙伴意图与对团队目标的理解三个结构化的心智模型维度,并附有开放式解释以揭示行动背后的认知过程。数据集通过操纵引导者能否实时观察跟随者画布这一条件,引入了可见与不可见两种协作情景,使数据自然呈现出在心智模型对齐程度、任务进展阶段与协作风格上的系统变异。标注框架紧密结合团队过程、情境意识与共同基础等成熟理论,使得数据既保留了自然交互的生态效度,又具备理论指导下的标注质量。
使用方法
ALMANAC旨在为评估与训练具备协作能力的大语言模型提供基准。研究者可通过两种互补任务来使用该数据集:下一行动预测任务要求模型基于交互历史与参与者画像,预测人类协作者接下来最可能执行的动作类型及其内容;心智模型预测任务则要求模型推断协作者在特定时刻的团队目标理解、伙伴意图感知与自我推理状态。数据集提供了标准的训练与测试划分,并支持两种评估范式:其一为基于提示词的方法,直接向通用大语言模型提供参与者画像与历史信息进行零样本或少样本预测;其二为监督微调方法,利用ALMANAC的行动与心智模型标注来微调较小规模的语言模型,从而弥合与大模型的性能差距,为研发真正理解协作过程的智能体奠定数据基础。
背景与挑战
背景概述
ALMANAC数据集由 Northeastern University 的研究人员于2026年创建,旨在填补当前大语言模型(LLM)智能体在协作过程中缺乏深层认知建模能力的空白。研究团队基于社会科学中的经典二元路径任务——Map Task,设计并采集了50名参与者在25个协作会话中的2,987个行动级数据。每个行动均配备基于协作理论的心智模型标注,涵盖自我推理、感知的伙伴意图以及共享的团队目标三个维度。该数据集的核心研究问题在于,如何利用真实的、带有精细认知标注的人类协作数据,引导LLM智能体从单纯的任务完成优化转向过程层面的协作能力发展。ALMANAC的发布为评估与提升智能体在模拟人类协作行为及推断潜在认知状态方面的能力提供了开创性的基准资源,对人工智能与人类-智能体协作领域产生了重要的推动作用。
当前挑战
ALMANAC数据集所应对的核心领域挑战在于,现有LLM智能体虽在复杂任务推理与规划上取得进展,但其协作能力仍主要停留在表面任务执行,缺乏在协作过程中持续维护并同步自我推理、伙伴意图及团队目标等心智模型的能力。当前多数智能体基准评测聚焦于任务完成度,而忽略了协作过程中的认知层建模。在数据集构建过程中,研究团队面临两大关键挑战:其一,如何在不干扰自然协作行为的前提下,实时且准确地捕捉参与者行动级的心智模型,为此设计了会话内定时检查点与会话后回顾标注相结合的两阶段框架,并通过语音记录与截图回放减轻回忆偏差;其二,如何处理诸如画布可见性等条件变量对协作行为多样性的影响,研究通过将参与者随机分配到不同视觉条件来丰富行为模式,最终形成了包含2,987个标注行动的高质量数据集,为后续协作智能体的认知建模研究奠定了坚实基础。
常用场景
经典使用场景
ALMANAC数据集最经典的应用场景在于人机协作领域中,作为评估和训练大语言模型(LLM)能否模拟人类协作行为与心智模型的基准平台。该数据集基于经典的Map Task双人路由任务构建,记录了2,987个协作动作及其配套的、以协作理论为指导的心智模型标注,涵盖自我推理、感知的伙伴意图和共享团队目标。研究者借助该数据集,通过下一行为预测和心智模型预测两项互补任务,系统性地审视现有LLM在模拟人类协作动态方面的能力边界,揭示其在推断内部认知过程中的局限性。
解决学术问题
该数据集瞄准的核心学术问题是现有协作数据集普遍缺失认知层面的深度标注,导致LLM被优化为单纯的任务完成者,而非具有协作意识的伙伴。ALMANAC通过提供行动级别的、理论驱动的心智模型标注,填补了过程级协作信号的空白。其意义在于:其一,揭示了共享心智模型成分(如团队目标)较私有自我推理更易预测的现象,量化了模型在认知推理上的根本性缺陷;其二,证明了心智模型标注作为超越交互历史以外的额外信号,能为协作行为建模提供更丰富的监督信息,从而指引未来研究朝着构建真正具备协作能力的智能体方向迈进。
衍生相关工作
基于ALMANAC,学界已衍生出一系列重要的后续工作。一方面,研究者通过在其提供的标注数据上进行微调,成功缩小了小型模型与大型专有模型在协作行为预测上的性能差距,证明了针对性的协作监督训练的有效性。另一方面,该数据集中的心智模型预测任务催生了对角色特异性认知机制的研究,揭示了指导者(Guide)和跟随者(Follower)在行为可预测性与心智模型可推断性之间的分离现象。此外,其标注框架被推广至面向多轮人类行为模拟的基准构建,为探索智能体构建和动态更新伙伴心智模型的能力铺平了道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务