遇见数据集

OmniGameArena

收藏
arXiv2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

OmniGameArena是由多机构联合创建的一个综合性基准测试数据集,旨在系统评估视觉语言模型在游戏环境中的智能体表现。该数据集包含12款全新构建的虚幻引擎5游戏,涵盖单人、玩家对战与合作三种模式,数据来源于定制开发的游戏实例,确保了评估场景的新颖性和低预训练污染风险。数据集的创建过程涉及精心设计游戏机制、视觉资产整合以及统一动作接口的开发,以支持异构智能体的公平比较。其核心应用领域是推进视觉语言模型智能体在实时、多模态交互环境中的能力评测,旨在解决现有基准测试在衡量智能体持续改进、多智能体交互以及避免数据污染等方面的不足。

OmniGameArena is a comprehensive benchmark dataset jointly developed by multiple institutions, targeting the systematic evaluation of vision-language model agents' performance in gaming environments. This dataset contains 12 newly constructed Unreal Engine 5 games, spanning three gameplay modes: single-player, player-versus-player (PvP), and cooperative play. All data is sourced from custom-built game instances, ensuring the novelty of evaluation scenarios and minimizing the risk of pre-training data contamination. The development of this dataset entails meticulous design of game mechanics, integration of visual assets, and construction of unified action interfaces, enabling fair comparisons between heterogeneous agents. Its core application focus is to advance the assessment of vision-language model agents' capabilities in real-time, multimodal interactive environments, with the goal of addressing the limitations of existing benchmarks in three key aspects: measuring agents' continuous improvement, supporting multi-agent interaction, and preventing data contamination.

创建时间:
2026-06-09
原始信息汇总

OmniGameArena 数据集概述

基本信息

  • 全称: OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics
  • 发布机构: 香港大学、LIGHTSPEED、香港中文大学、清华大学
  • 论文: arXiv:2606.09826
  • 资源链接:
    • arXiv: https://arxiv.org/abs/2606.09826
    • GitHub: https://github.com/mxlin043/OmniGameArena
    • Hugging Face Model: https://huggingface.co/mxlin043/OmniGameArena
    • ModelScope Environment: https://modelscope.cn/mxlin043/OmniGameArena

核心贡献

  1. 12款UE5游戏基准测试: 涵盖单人(7款)、PvP(3款)和合作(2款)模式,统一动作接口,所有游戏实例均为全新创作。
  2. Improvement Dynamics Curve (IDC): 一种智能体反思框架,通过工具使用反射器在多轮迭代中自动优化技能提示。
  3. 跨智能体实证发现: 不同游戏和智能体之间领导权轮换,无单一VLM主导;初始任务改进与保留任务变体迁移可能不一致。

基准测试套件

12款自定义游戏与7大能力维度

每个游戏针对视觉感知、空间导航、反应、记忆、规划、对抗交互和合作的不同组合进行设计。

游戏名称 模式 核心能力
ObstacleRun2D 单人 反应性平台跳跃
ObstacleRun3D 单人 3D跑酷
LastStand 单人 危险环境生存
MonsterShoot 单人 持续瞄准射击
SceneEscape 单人 任务链解谜
CueChase 单人 线索引导搜索
SoloCraft 单人 物流配送
SkyDuel PvP 1v1直接对抗
CrystalGuard PvP 攻防对抗
MidlineClash PvP 竞争性资源争夺
SharedFloor 合作 对称合作
HandoffRun 合作 非对称协作

IDC框架

每轮流程包括:

  1. 探索: 检查当前轮的K个回合轨迹
  2. 诊断: 跨回合比较原因,解释成功与失败案例
  3. 验证: 在持久技能集提交前测试候选技能
  4. 提炼: 为下一轮总结、优化和存储技能提示

冷启动性能结果

排行榜(按平均归一化分数)

排名 智能体 分数
1 GPT-5.5 0.434
2 Claude Opus 4.6 0.375
3 Gemini 3.1 Pro Preview 0.374
4 Claude Opus 4.7 0.289
5 GPT-5.4 0.250
6 Claude Sonnet 4.6 0.227
7 Gemini 3.1 Flash-Lite Preview 0.208
8 Kimi K2.5 0.161
9 Qwen3.5-397B-A17B 0.092
10 Qwen3.5-122B-A10B 0.051
11 NitroGen 0.050
12 Open-P2P 0.035

智能体类别标记:

  • 商业VLM: GPT-5.5, Claude Opus 4.6/4.7, Gemini 3.1 Pro Preview/Flash-Lite Preview, GPT-5.4, Claude Sonnet 4.6
  • 开源VLM: Kimi K2.5, Qwen3.5-397B-A17B/122B-A10B
  • 专用策略: NitroGen, Open-P2P

改进动态(IDC)结果

  • 无单一获胜者: 不同游戏间领导权轮换,商业智能体显著领先开源VLM和专用策略。
  • 改进峰值出现在曲线中期: 所有4个顶级智能体通过反思超过冷启动基线,但峰值性能通常出现在最终轮之前。
  • 迁移可能不一致: 原始任务改进和保留变体迁移可能产生分歧,这是冷启动排行榜分数未揭示的。
搜集汇总
数据集介绍
OmniGameArena 数据集图片
构建方式
OmniGameArena构建于Unreal Engine 5之上,包含十二款全新开发的实时游戏,涵盖单人(七款)、对抗(三款)与合作(两款)三种交互模式。所有游戏均采用统一的动作接口,支持键盘鼠标和游戏手柄两种控制方式,从而确保商业视觉语言模型、开源视觉语言模型以及专用游戏策略可以在完全对等的环境条件下进行公正评估。每款游戏的得分被归一化至[0,1]连续区间,以提供跨任务的统一度量标准。
使用方法
研究者可直接利用Gym风格的接口将OmniGameArena与各类视觉语言模型对接。对于冷启动评估,智能体在无技能提示下直接执行游戏循环,系统记录每回合得分。对于改进动力学曲线评估,智能体在多轮循环中交替进行回合执行与技能反思:反射器LLM通过工具调用自主探索轨迹、诊断失败模式、验证并提炼技能提示,最终生成跨回合的改进轨迹。该框架还内置了最佳技能回滚机制,防止技能漂移导致性能崩溃,从而为智能体的自适应学习能力提供多维度的量化揭示。
背景与挑战
背景概述
近年来,视觉语言模型智能体在交互式游戏环境中的部署日益广泛,而游戏场景凭借其动态视觉、时间压力及延迟奖励等特性,成为评估基础模型行为能力的天然试金石。然而,既有游戏基准普遍存在诸多局限:通常仅以单次尝试得分作为评价指标,侧重于单人模式,且缺乏统一协议来公平评估不同类型智能体(如商业闭源视觉语言模型、开源视觉语言模型及专用游戏策略)。为填补这一空白,由香港大学、腾讯光子、香港中文大学及清华大学的研究人员于2026年提出了OmniGameArena。该基准包含十二款全新开发的虚幻引擎5游戏,横跨单人、对抗及合作模式,并配有统一动作接口与基于智能体反思的改进动力学曲线(IDC)。其核心研究问题在于:如何系统度量智能体在多次交互中的改善轨迹及其习得策略对未见变体的迁移能力。这一工作显著推动了游戏智能体评价范式的演进,揭示了超越单次排行榜得分的深层能力维度。
当前挑战
OmniGameArena直面视觉语言模型游戏智能体评价领域的几重核心挑战。其一,领域问题层面,现有基准通常仅报告智能体与游戏组合的首次尝试得分,却忽视了反复交互下性能的演化轨迹;同时,对抗与合作场景因涉及对手建模、角色分配及从队友失误中恢复等独特能力而长期未被充分覆盖。其二,构建过程中面临的挑战主要有三:首先,为规避预训练数据污染,团队需要设计全新的游戏场景,确保游戏名称、规则和任务描述在互联网上不可被检索及辨识,这要求每一款游戏从零开始构建,而非直接复用现成的商业标题;其次,必须建立统一且鲁棒的评价协议,使得商业闭源模型、开源模型与专用游戏策略能在完全一致的环境条件下进行比较;最后,学习到的技能对原始任务变体的迁移能力难以预测——实验表明,原始任务的增益未必能泛化到变体场景,这种分歧在单轮排行榜得分下完全不可见,成为IDC暴露的核心可观测挑战。
常用场景
经典使用场景
在多模态智能体与游戏环境交互的研究浪潮中,OmniGameArena作为一套基于虚幻引擎5构建的实时游戏基准测试,为视觉语言模型(VLM)游戏智能体提供了涵盖单机、对抗与协作三大模式的十二款全新游戏环境。其最经典的使用场景在于对异构智能体——包括商业闭源VLM、开放权重VLM以及专用游戏策略——在同一统一动作接口下进行公平的冷启动性能评测,并借助改进动态曲线(IDC)框架,系统性地追踪智能体在多轮自我反思中的能力演进轨迹,从而突破了传统单次得分榜单的信息瓶颈。
解决学术问题
该数据集精准回应了当前游戏智能体评估中存在的三大核心学术难题:一是既有基准多依赖于公开商业游戏,存在严重的预训练数据泄露风险,OmniGameArena通过完全自研的UE5环境将游戏识别率降至0%,从根源上消解了记忆性先验对评测结论的污染。二是传统评测仅报告单次首次尝试得分,忽视智能体在反复交互中的适应能力;IDC框架通过多轮反思实验揭示了原始任务提升与变异任务迁移之间的非单调关系,证明峰值性能往往出现于曲线中段而非最终轮次,为理解智能体的学习动态提供了全新观测维度。三是缺乏统一协议来比较不同类别的智能体;该数据集为此提供了标准化的评估基础设施。
实际应用
在实际应用层面,OmniGameArena所构建的评估体系对游戏人工智能研发、多模态模型部署优化以及人机协作系统设计具有直接指导意义。其评估结果清晰揭示了商业VLM在游戏操控能力上对开源模型和专用策略的显著领先优势,同时暴露出即便是最强模型在协作任务中完成率仍不足40%的严重瓶颈,为多智能体协调这一尚未饱和的能力维度指明了技术攻坚方向。此外,通过对比暂停决策质量与延迟受控实时两种时钟协议下的性能差异,该数据集量化了推理延迟对反应型任务与吞吐型任务的不同影响机制,为VLM智能体从实验室环境向真实实时部署的迁移提供了关键参照。
数据集最近研究
最新研究方向
在视觉语言模型智能体领域,OmniGameArena的前沿研究聚焦于突破传统单次、单智能体游戏基准的局限,通过构建覆盖单机、玩家对战与合作三种模式的十二款全新Unreal Engine 5实时游戏环境,并引入改进动态曲线(IDC)这一自主反思框架,系统评估智能体在多轮交互中的自学习演化轨迹。该研究揭示了冷启动分数无法体现的关键现象:多数模型在IDC下通过反思实现显著提升,但峰值表现通常出现在曲线中段而非最终轮次,且原始任务增益与保留任务迁移能力之间存在潜在分离。这一发现直接回应了当前大语言模型和视觉语言模型从“回答问题”向“交互行动”评估范式转型的热点需求,为衡量智能体在真实动态环境中的自适应能力与技能泛化性提供了统一、可复现的基准架构,对推动通用游戏智能体的标准化评估与可迁移学习研究具有深远意义。
相关研究论文
  • 1
    OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics香港大学; LIGHTSPEED; 香港中文大学; 清华大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务