遇见数据集

MMBench2

收藏
arXiv2026-06-26 更新2026-06-29 收录
数据链接:
官方服务:

资源简介:

MMBench2是由加州大学圣地亚哥分校研究团队构建的大规模多任务视觉世界建模数据集,旨在系统研究生成世界模型中的幻觉问题。该数据集包含65,600条轨迹,总计427小时的224×224分辨率视频(15帧/秒),覆盖210个连续控制任务,数据来源包括10个不同领域如DMControl、Meta-World等。数据集创建过程通过扩展MMBench基准,整合了真实动作标签、奖励信号及实时仿真环境。其核心应用在于探究世界模型幻觉的预测与预防机制,通过提供行为多样性数据支持模型在低覆盖区域的适应性研究。

MMBench2 is a large-scale multi-task visual world modeling dataset developed by a research team from the University of California, San Diego, aiming to systematically study hallucination issues in generative world models. This dataset contains 65,600 trajectories, totaling 427 hours of 224×224 resolution videos at 15 frames per second (fps), covering 210 continuous control tasks. Its data sources span 10 distinct domains including DMControl, Meta-World, and others. The dataset was constructed by extending the MMBench benchmark, integrating real action labels, reward signals, and real-time simulation environments. Its core application lies in exploring the prediction and prevention mechanisms of world model hallucinations, and supporting adaptive research of models in low-coverage regions by providing behaviorally diverse data.

创建时间:
2026-06-26
原始信息汇总

数据集概述

数据集名称: MMBench2

数据集规模:

  • 总时长:427 小时
  • 任务数量:210 个任务
  • 领域数量:10 个领域
  • 轨迹数量:未明确给出具体数字,但每个任务包含等量的轨迹数,帧数分布不均,帧数范围从 25(ManiSkill3)到 1000(Atari)步。

任务与领域:

  • 任务类型涵盖:运动控制、操作、导航、街机风格环境等。
  • 涉及的领域包括:DMControl、DMControl Ext.、Meta-World、ManiSkill3、MuJoCo、Box2D、RoboDesk、OGBench、MiniArcade、Atari。

数据内容:

  • 包含 ground-truth 动作(actions)、奖励(rewards)、语言指令(language instructions)。
  • 每个任务都配备实时模拟器(live environment)。

数据特点:

  • 帧数分布呈重尾分布,非均匀,用于研究数据覆盖问题。

开源状态:

  • 完全开源(fully open-source)。

相关资源:

  • 代码:提供训练和评估世界模型的代码。
  • 数据集:包含 427 小时、210 个任务的数据。
  • 模型:提供预训练和微调后的 350M 参数模型。
搜集汇总
数据集介绍
MMBench2 数据集图片
构建方式
MMBench2的构建基于MMBench的200个现有环境,通过整合多样性策略扩充至210个任务。数据收集融合了专家策略、随机动作、零动作、结构化噪声、好奇心驱动探索及人类键盘交互等多种行为模式,生成了65,600条轨迹,总计23百万帧224×224分辨率、15帧/秒的视频。每条轨迹均包含真实动作标签、奖励信号以及实时仿真器,覆盖了10个领域(如DMControl、Meta-World、Atari等)的连续控制任务。200个任务用于预训练,剩余10个作为未见过的迁移测试任务,以评估模型在分布外场景的泛化能力。
使用方法
MMBench2可直接用于训练和评估视觉世界模型。使用者可基于其预训练语料(200个任务)训练Tokenizer和动力学模型(遵循Dreamer 4架构),并利用保留的10个未见任务进行迁移测试。论文提出了三种无需额外训练或标签的幻觉预测器(编码器往返残差、流不稳定性、跨种子方差),可用于运行时检测模型失败。在缓解方面,可采用覆盖感知采样(任务均匀重采样)进行预训练,或利用预测器作为好奇心奖励,在在线数据收集中引导模型探索覆盖不足区域,从而以仅50条真实轨迹微调预训练模型以适应全新环境。
背景与挑战
背景概述
MMBench2由加州大学圣迭戈分校的Nicklas Hansen与Xiaolong Wang于2026年提出,旨在填补可视化世界模型领域缺乏大规模、多任务、含真实动作与奖励标签及可交互环境的基准数据集的空白。该数据集包含427小时、210个任务的65,600条轨迹,覆盖10个领域如DMControl、Meta-World和Atari等,提供混合质量的行为数据(包括人类操作)。其核心研究问题聚焦于世界模型中的幻觉现象——视觉流畅但偏离真实动力学的生成结果,被认为主要由状态-动作空间的覆盖不足引起。MMBench2为研究幻觉的检测、预测与缓解提供了系统平台,推动了基于数据的模型改进方向,对机器人、游戏AI及仿真规划领域具有深远影响。
当前挑战
MMBench2所解决的领域挑战在于世界模型生成过程中普遍存在的幻觉问题,表现为三种模式:感知幻觉(编码-解码器将分布外场景映射到分布内示例)、动作边缘化(动力学头忽略输入动作)和场景发散(多步滚动中累积物理违例)。这些幻觉源于训练数据对状态-动作空间的覆盖缺失。构建数据集时面临的挑战包括:需同时提供真实动作与奖励标签、维护210个任务的实时交互环境、收集行为多样的轨迹(如随机策略、专家演示与人类操作),并确保数据规模与非均匀分布(任务间帧数差异可达千倍)的平衡,同时支持对200个预训练任务与10个未见任务的零样本迁移评估。
常用场景
经典使用场景
MMBench2作为面向视觉世界建模的大规模多任务数据集,在生成式世界模型的幻觉现象研究中扮演着核心基准的角色。其经典使用场景在于为研究者提供一个包含427小时、210个任务的多样化训练与评估平台,涵盖从机器人操作到街机游戏的广泛连续控制领域。借助该数据集,学者能够系统性地探索世界模型在感知编码、动作条件化以及多步自回归推演各阶段产生的幻觉模式,为理解生成式模型在分布外区域的行为退化提供了不可替代的实验基础。
解决学术问题
MMBench2精准回应了学术界长期面临的难题——如何量化和预测生成式世界模型中的幻觉现象。该数据集通过提供完整的真值动作、奖励标签以及实时仿真环境,使得研究者首次能够将幻觉归因于状态-动作空间中的覆盖度不足,而非单纯的架构局限。基于此,论文提出了三类幻觉检测信号(分词器往返残差、流不稳定性与种间方差),并以高达0.80的Spearman相关系数证明了其与推演质量的强关联,为从数据层面缓解模型幻觉提供了全新的理论视角与方法论基石。
实际应用
在实际应用中,MMBench2所衍生出的数据驱动干预策略展现出显著的工程价值。论文提出的覆盖感知采样技术能够在无需额外计算成本的前提下,同时降低三种幻觉模式的严重程度;而基于幻觉预测信号设计的好奇心奖励机制,则使得预训练的350M参数世界模型仅需50条真实环境轨迹即可高效迁移至完全未见过的任务场景。这种数据高效的微调方案,对于机器人领域中的零样本适应、低资源环境下的模型部署等现实需求,提供了一条兼具经济性与实用性的可行路径。
数据集最近研究
最新研究方向
MMBench2的最新研究方向聚焦于揭示并解决生成式世界模型中的幻觉问题,将幻觉从根本上归因于状态-动作空间的数据覆盖不足。前沿工作通过构建一个包含427小时、210个任务的大规模多任务视觉世界建模数据集,训练了3.5亿参数的世界模型,并识别出感知幻觉、动作边缘化幻觉和场景发散幻觉三种不同模式的失败类型。研究进一步开发了无需额外标签及训练的运行时检测指标,如分词器往返残差、流不稳定性及种子间去噪方差,这些指标与 rollout 误差的斯皮尔曼相关系数高达约0.80。基于此,研究者提出了覆盖感知采样策略与利用检测信号作为好奇心奖励的定向数据收集方法,实现了在仅需50条真实轨迹的条件下将预训练模型高效微调至全新环境,显著提升了世界模型的泛化能力与鲁棒性,为构建更可靠、可解释的生成式世界模型开辟了数据驱动的新路径。
相关研究论文
  • 1
    Hallucination in World Models is Predictable and Preventable加州大学圣地亚哥分校 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务