遇见数据集

RNGBench-Game-Trajectories

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

RNGBench-Game-Trajectories数据集是RNGBench(重构性非马尔可夫游戏)评估框架的配套监督微调轨迹数据。该框架旨在测试多模态语言模型在记住-行动场景下的能力,即模型需要从历史记忆中重建当前观察所无法提供的隐藏状态,并据此在闭环环境中做出决策。数据集包含两种游戏环境:1) Matching Pairs(匹配对),一种静态的、分类隐藏状态游戏,模拟需要根据位置回忆卡片身份的记忆卡片匹配游戏;2) 3D Maze(3D迷宫),一种动态的、空间隐藏状态游戏,提供以自我为中心的第一人称视角,需要组合成地图以达到目标。对于每种游戏,数据集提供两种类型的多轮次智能体轨迹:Optimal(由基于规则的最优策略生成)和Roll(从强模型如Kimi-K2.5和Qwen3.5-397B收集的推演轨迹)。数据模态包括图像+文本组合以及纯文本版本。数据格式采用LLaMA-Factory的ShareGPT格式,每个轨迹样本包含交替的human和gpt对话回合、对应的图像路径列表以及描述游戏规则和输出格式的系统提示。该数据集适用于多模态语言模型的监督微调,特别是在需要记忆和历史信息推理的序列决策任务中。

RNGBench-Game-Trajectories dataset is the companion supervised fine-tuning trajectory dataset for the RNGBench (Reconstructive Non-Markovian Game) evaluation framework. This framework is designed to evaluate the capabilities of multimodal large language models in "remember-act" scenarios, where models must reconstruct hidden states unavailable from current observations via historical memory, then make decisions in a closed-loop environment based on these states. The dataset includes two types of game environments: 1) Matching Pairs, a static, categorical hidden-state game that simulates the memory card matching task where agents need to recall card identities based on their positions; 2) 3D Maze, a dynamic, spatial hidden-state game that provides an egocentric first-person perspective, requiring agents to construct mental maps to reach target goals. For each game, the dataset offers two categories of multi-turn AI agent trajectories: Optimal (generated by rule-based optimal policies) and Roll (inference trajectories collected from high-performing models such as Kimi-K2.5 and Qwen3.5-397B). The dataset supports two data modalities: image-text paired formats and plain text versions. It adopts the ShareGPT format from LLaMA-Factory, where each trajectory sample consists of alternating "human" and "gpt" dialogue turns, a corresponding list of image paths, and a system prompt that details the game rules and required output format. This dataset is well-suited for supervised fine-tuning of multimodal large language models, particularly for sequential decision-making tasks that demand memory retention and historical information reasoning.

提供机构:
InternLM
创建时间:
2026-06-23
原始信息汇总

数据集概述

  • 名称: RNGBench-Game-Trajectories
  • 许可协议: MIT
  • 任务类别: 图像+文本到文本(image-text-to-text)
  • 语言: 英语
  • 标签: agent, trajectory, multimodal, game, sft, non-markov
  • 关联资源:
    • 论文: https://arxiv.org/abs/2606.19338
    • 项目页面: https://internlm.github.io/RNGBench/
    • 代码仓库: https://github.com/InternLM/RNGBench

数据集描述

该数据集是RNGBench评估框架的配套SFT(监督微调)轨迹数据。RNGBench是一个用于测试多模态语言模型在闭环环境中,能否从记忆中重构隐藏状态并据此行动(即“记忆-行动”设定,当前观察不足以决策,模型必须回忆相关历史)的评估框架。

数据内容

数据集涵盖RNGBench中的两个游戏的智能体轨迹:

  1. Matching Pairs (MP):一种静态、分类隐藏状态游戏,即记忆卡片配对游戏,需要根据位置回忆卡片身份。
  2. 3D Maze:一种动态、空间隐藏状态游戏,需要将第一人称视角信息整合成地图来到达目标。

每个游戏提供两种类型的多轮智能体轨迹:

  • Optimal:由基于规则的最优策略生成的轨迹。
  • Roll:从强模型(Kimi-K2.5和Qwen3.5-397B)收集的 rollout 轨迹。

文件结构

文件名 游戏 类型 模态
data/MP_Optimal.jsonl Matching Pairs Optimal 图片 + 文字
data/MP_Roll.jsonl Matching Pairs Roll 图片 + 文字
data/MP_Roll_text.jsonl Matching Pairs Roll 仅文字
data/3D_Maze_Optimal.jsonl 3D Maze Optimal 图片 + 文字
data/3D_Maze_Roll.jsonl 3D Maze Roll 图片 + 文字

对应图片+文字子集的图片以压缩包形式存放在 images/ 目录下(MP_Optimal.zip, MP_Roll.zip, 3D_Maze_Optimal.zip, 3D_Maze_Roll.zip)。MP_Roll_text 是纯文本集,无图片。

数据格式

每个 data/*.jsonl 文件的一行是一条符合 LLaMA-Factory ShareGPT 格式的轨迹。JSON对象包含以下字段:

  • conversations: 交替的 human / gpt 对话轮次。每条轮次的 value 中的 <image> 占位符按顺序对应顶层 images 列表中的一个条目。
  • images: 图片路径列表,格式为 <subset>/<relative_path>,与对应 images/<subset>.zip 压缩包内的布局一致(每个压缩包的文件存储在顶层 <subset>/ 文件夹下)。
  • system: 系统提示词,包含游戏规则和输出格式。
  • MP_Roll_text 是纯文本集,没有 images 字段。

使用方式

  1. 下载仓库,将所有图片压缩包解压到同一目录。
  2. 使用 LLaMA-Factory 时,通过提供的 dataset_info.json 注册子集(设置 --dataset_dir / media_dir 指向存放 data/ 和解压后图片的目录),然后训练指定子集(如 rngbench_mp_optimal, rngbench_3d_maze_optimal 等)。

引用

bibtex @article{rngbench2026, title = {Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games}, author = {Ding, Shengyuan and Wei, Xilin and Fang, Xinyu and Duan, Haodong and Lin, Dahua and Wang, Jiaqi and Zang, Yuhang}, journal = {arXiv preprint arXiv:2606.19338}, year = {2026}, }

搜集汇总
数据集介绍
RNGBench-Game-Trajectories 数据集图片
构建方式
RNGBench-Game-Trajectories数据集专为多模态大语言模型在非马尔可夫游戏环境中的监督微调(SFT)而设计,覆盖Matching Pairs(静态类别隐藏状态记忆配对游戏)和3D Maze(动态空间隐藏状态第一人称视角导航游戏)两种任务。数据集包含两类轨迹:Optimal子集由基于规则的最优策略生成,提供完美的决策示范;Roll子集则采集自Kimi-K2.5和Qwen3.5-397B等强模型的多轮交互行为。每条轨迹均以LLaMA-Factory的ShareGPT格式存储,图像和文本信息通过JSON结构对齐,支持多模态或纯文本训练需求。
使用方法
使用前需下载仓库并解压所有图像压缩包至同一目录,例如通过循环解压命令将images/*.zip解压至images_extracted文件夹。在LLaMA-Factory框架中,可利用提供的dataset_info.json注册子集,并指定--dataset_dir和media_dir指向data目录及图像提取目录。训练时可根据需求选择如rngbench_mp_optimal、rngbench_3d_maze_optimal等具体配置,轻松切换不同游戏类型与轨迹质量,进行模型微调与评估。
背景与挑战
背景概述
RNGBench-Game-Trajectories数据集由InternLM团队于2026年创建,旨在评估多模态大语言模型在非马尔可夫游戏环境中的记忆与行动能力。该数据集聚焦于“回忆-行动”范式,即模型必须从历史交互中重构隐藏状态并基于此做出决策,而非仅依赖当前观测。作为RNGBench评估框架的配套数据,它涵盖Matching Pairs与3D Maze两类游戏,分别测试静态类别记忆与动态空间记忆能力。通过提供最优策略轨迹与强模型(如Kimi-K2.5、Qwen3.5-397B)的采样轨迹,该数据集为多模态智能体在复杂环境中的闭环推理研究提供了关键基准,推动了记忆增强型AI系统的发展。
当前挑战
该数据集旨在解决多模态语言模型在非马尔可夫任务中的根本性挑战:当前观测不足以决策时,模型需主动回忆并利用历史信息,这对长程依赖建模与记忆检索能力提出了严苛要求。构建过程中,面临多重困难:一是游戏环境的隐藏状态设计需同时兼顾可控性与多样性,确保测试的信效度;二是轨迹数据收集需平衡最优策略的确定性输出与强模型采样的随机行为,避免数据偏差;三是多模态对齐问题,即在图像与文本交织的序列中精确同步视觉信息与动作指令,保障训练样本的一致性。
常用场景
经典使用场景
RNGBench-Game-Trajectories数据集专为多模态大语言模型在非马尔可夫游戏环境中的监督微调而设计。其核心使用场景涵盖两种经典游戏:Matching Pairs(匹配对)与3D Maze(三维迷宫)。前者检验模型在静态、分类性隐藏状态下的记忆与推理能力,后者则挑战模型在动态、空间隐状态中借助多视角图像重建地图并规划路径。通过提供基于规则的最优轨迹和来自强模型(如Kimi-K2.5、Qwen3.5-397B)的滚动轨迹,该数据集为训练模型在“先记忆后行动”的闭环交互中恢复历史状态并做出决策提供了珍贵的训练资源。
解决学术问题
该数据集直面多模态大语言模型在非马尔可夫游戏中的关键学术难题:如何从记忆(而非当前观测)中重建隐藏状态并据此行动。传统评估往往假设观测独立或仅需即时信息,而现实中的决策任务(如迷宫导航、记忆匹配)依赖于对历史信息的检索与整合。RNGBench-Game-Trajectories通过构造需要跨时间步推理的环境,揭示了当前模型在长程记忆、状态回溯与闭环策略规划上的短板。其意义在于为学术界提供标准化基准,推动研究者关注并解决“记忆-行动”耦合问题,从而提升模型在复杂、非完全可观测场景下的鲁棒性与智能水平。
实际应用
在实际应用中,该数据集可用于训练和微调具备记忆能力的多模态智能体,使其胜任需要持续感知与回溯的交互任务。例如,在机器人导航中,模型可利用类似3D Maze的视角记忆构建环境拓扑并避开障碍;在智能助手领域,模型可借鉴Matching Pairs的模式,从历史对话中准确调用早期信息以应答用户复杂需求。此外,该轨迹数据可直接适配LLaMA-Factory等主流训练框架,便于开发者快速部署至游戏代理、虚拟现实交互系统或需要长程上下文理解的语音/图像对话系统,从而显著提升智能体在真实世界中的适应性与决策可靠性。
数据集最近研究
最新研究方向
在非马尔可夫游戏环境中评估多模态大语言模型的记忆与决策能力是当前前沿研究方向。RNGBench-Game-Trajectories数据集围绕“记住并行动”的核心挑战,通过匹配对与3D迷宫两类游戏,提供了规则最优策略与强模型(如Kimi-K2.5、Qwen3.5-397B)的轨迹数据,支撑闭环环境中模型对隐藏状态的记忆重构与行动推理研究。该数据集的出现呼应了智能体领域从静态感知向动态记忆推理的范式迁移,为探索多模态模型在长程依赖与部分可观测场景下的泛化瓶颈提供了标准化评测基准,对提升AI在复杂交互任务中的可靠性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务