遇见数据集

internlm/RNGBench-Game-Trajectories

收藏
Hugging Face2026-06-23 更新2026-07-22 收录
官方服务:

资源简介:

RNGBench-Game-Trajectories是一个用于监督微调(SFT)的轨迹数据集,作为RNGBench(重构性非马尔可夫游戏)评估框架的组成部分。该框架旨在测试多模态语言模型是否能够从记忆中重构隐藏状态,并在封闭循环环境中基于这些状态采取行动(即记住并行动场景,其中当前观察不足以决策,模型必须回忆相关历史)。数据集涵盖两个游戏:Matching Pairs(静态分类隐藏状态游戏,如记忆卡匹配游戏)和3D Maze(动态空间隐藏状态游戏,如第一人称视角迷宫导航)。对于每个游戏,提供两种多轮代理轨迹:Optimal(基于规则的最优策略生成)和Roll(从强模型如Kimi-K2.5和Qwen3.5-397B收集的滚动轨迹)。数据以LLaMA-Factory的ShareGPT格式存储,包括图像和文本模态,部分为纯文本。

RNGBench-Game-Trajectories is a supervised fine-tuning (SFT) trajectory dataset accompanying RNGBench (Reconstructive Non-Markov Games), an evaluation framework that tests whether multimodal language models can reconstruct hidden state from memory and act on it in closed-loop environments (the remember-to-act setting, where the current observation alone is insufficient and the model must recall relevant history before deciding). The dataset covers two games: Matching Pairs (a static, categorical hidden-state game, such as a memory card-matching game) and 3D Maze (a dynamic, spatial hidden-state game, like egocentric first-person maze navigation). For each game, it includes two types of multi-turn agent trajectories: Optimal (produced by a rule-based optimal policy) and Roll (rollout trajectories collected from strong models like Kimi-K2.5 and Qwen3.5-397B). The data is stored in LLaMA-Factorys ShareGPT format, with multimodal (image+text) and text-only subsets.

提供机构:
internlm
搜集汇总
数据集介绍
internlm/RNGBench-Game-Trajectories 数据集图片
构建方式
RNGBench-Game-Trajectories数据集专为多模态语言模型在非马尔可夫游戏环境中的记忆与行动能力评估而设计,涵盖Matching Pairs与3D Maze两类游戏。该数据集通过两种策略构建轨迹:其一为规则驱动的最优策略,生成高效解决任务的理想路径;其二为强模型(如Kimi-K2.5与Qwen3.5-397B)的交互轨迹,反映真实模型在复杂情境下的决策行为。数据以LLaMA-Factory的ShareGPT格式组织,每条轨迹包含交替的人机对话、对应图像路径及系统提示,确保结构清晰且易于集成到微调框架中。
特点
数据集的核心特色在于其非马尔可夫性——模型必须依赖历史记忆而非当前观测做出决策,这模拟了真实世界的记忆依赖挑战。Matching Pairs呈现静态隐藏状态,要求模型通过位置回忆卡片身份,而3D Maze则提供动态第一人称视角,需要构建空间地图以导航至目标。此外,数据包含视觉与纯文本两种模态,Optimal与Roll两类轨迹分别代表理想执行与模型实际表现,为评估模型的规划能力与泛化边界提供了多维视角。
使用方法
使用该数据集时,需先解压各图像归档至统一目录,确保路径解析正确。随后通过LLaMA-Factory框架,利用提供的dataset_info.json注册子集(如rngbench_mp_optimal、rngbench_3d_maze_roll等),并将数据集目录与媒体目录指向相应位置,即可进行监督微调。每条轨迹的conversations字段适配标准对话格式,images字段与<image>占位符一一对应,便于直接用于训练图像-文本到文本的多模态模型。
背景与挑战
背景概述
RNGBench-Game-Trajectories数据集由上海人工智能实验室(InternLM团队)于2026年创建,旨在应对多模态大语言模型在非马尔可夫环境中的推理与记忆挑战。该数据集随RNGBench评估框架一同发布,核心研究问题聚焦于模型能否在闭环环境中从历史记忆中重构隐藏状态并据此执行决策,即“记忆-行动”范式。通过涵盖Matching Pairs和3D Maze两类游戏,数据集提供了基于规则的最优轨迹与来自Kimi-K2.5、Qwen3.5-397B等强模型的rollout轨迹,为多模态智能体的监督微调提供了标准化基准,对推动具身智能与记忆增强推理的研究具有重要影响。
当前挑战
该数据集解决的核心领域问题包括:传统多模态模型仅依赖当前观测进行决策,在非马尔可夫(部分可观测)环境下表现不佳;模型需有效利用长程记忆来重构隐藏状态并制定策略。构建过程中面临的主要挑战有:如何设计具有明确隐藏状态且可重复评估的游戏环境;如何确保rollout轨迹来自具备稳定推理能力的强模型以避免劣化数据;以及如何在图像与文本多模态数据中保持对话格式的一致性,以适配LLaMA-Factory等微调框架的输入要求。此外,大规模轨迹数据的收集与图像归档管理也增加了工程实现的复杂性。
常用场景
经典使用场景
RNGBench-Game-Trajectories数据集的核心应用场景在于监督微调(SFT)多模态大语言模型,使其具备在非马尔可夫游戏环境中基于记忆重建隐藏状态并采取行动的能力。该数据集涵盖了“Matching Pairs”和“3D Maze”两种代表性游戏,分别对应静态分类隐藏状态与动态空间隐藏状态的任务范式。通过提供规则最优轨迹和来自强模型(如Kimi-K2.5、Qwen3.5-397B)的交互式轨迹,研究人员能够系统训练模型在闭环环境中整合历史信息与当前观测,从而突破传统模型仅依赖即时输入的局限。这种“记忆-行动”联合训练范式,为评估和提升多模态智能体在复杂、非完全可观测环境中的决策连贯性奠定了坚实基础。
解决学术问题
该数据集精准指向了多模态大语言模型研究中的一个关键学术问题:如何使模型在非马尔可夫任务中有效利用历史信息进行决策。传统评估框架往往假设当前观测足以推断状态,而真实世界中模型常需回忆过去的事件。RNGBench-Game-Trajectories通过设计两种隐藏状态游戏,系统性地测试了模型对序列上下文的理解、记忆提取与行动推理能力。该数据集的发布,使得学术界得以量化模型在“remember-to-act”场景下的表现,并揭示当前多模态模型在隐式状态追踪中的脆弱性。其意义在于,推动研究界从关注单步感知转向重视长程记忆与状态重构,为非完全可观测环境下的智能体设计提供了标准化评估基石。
衍生相关工作
基于RNGBench-Game-Trajectories数据集,学术界已衍生出多项开创性工作。其配套论文《Beyond the Current Observation》率先提出了非马尔可夫游戏评估框架,并利用该数据集揭示了主流多模态大语言模型(如Qwen3.5-397B)在记忆依赖型任务中的系统性缺陷。后续研究沿此方向,进一步探索了基于强化学习的轨迹优化方法,以及利用隐式状态重建损失函数进行自监督预训练的新范式。此外,该数据集催生了针对多模态智能体记忆机制的可解释性分析工作,以及将记忆增强模块集成到VLM架构中的设计尝试。这些衍生工作共同构成了一个围绕“记忆-行动”耦合研究的前沿领域,显著拓展了多模态学习和智能体研究的理论边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务