遇见数据集

gamecraft-web-qwen3.8-27b-baseline

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

GameCraft-Bench Web 是一个用于评估语言模型生成 Web 游戏能力的基准测试数据集。该数据集包含141个由 qwen3.8-27B 模型(通过 OpenRouter 使用1M上下文窗口)驱动 OpenGame agent 框架生成的游戏任务。每个任务包含完整的游戏项目(源代码、构建产物、演示回放轨迹、agent 对话记录和评分结果),以及评分文件(包含维度分解、裁判日志、CTRF 报告和奖励值)。评分采用公式:BUILD * (0.15*Mechanics + 0.35*Dynamics + 0.15*Visual + 0.35*Aesthetic),其中 BUILD 表示游戏是否成功构建(141个任务中125个通过)。数据集的整体平均奖励为0.2940,中位数为0.3292。与使用相同任务集、评分标准和裁判模型(GPT-5.5)的 GPT-5.5 臂相比,qwen3.8-27B 臂在四个维度上均存在差距(Mechanics: 0.296 vs 0.456, Dynamics: 0.200 vs 0.292, Visual: 0.301 vs 0.473, Aesthetic: 0.384 vs 0.557),整体奖励达到 GPT-5.5 的67%。此外,有20个任务因生成过程中被终止而缺少演示回放,随后使用独立的录制 agent 重新生成了回放轨迹,这些任务的分数作为质量下限。数据集提供了原始运行奖励和重录后奖励的对比。该数据集适用于评估和比较不同语言模型在生成交互式 Web 游戏方面的能力,特别关注游戏机制、动态、视觉和美学四个维度的质量。

GameCraft-Bench Web is a benchmark dataset for evaluating the ability of language models to generate web games. It contains 141 game tasks generated by the OpenGame agent framework driven by the qwen3.8-27B model (using a 1M context window via OpenRouter). Each task includes a complete game project (source code, build artifacts, demo replay trajectories, agent conversation logs, and scoring results), as well as scoring files (containing dimension breakdowns, judge logs, CTRF reports, and reward values). The scoring formula is: BUILD * (0.15*Mechanics + 0.35*Dynamics + 0.15*Visual + 0.35*Aesthetic), where BUILD indicates whether the game was successfully built (125 out of 141 tasks passed). The overall average reward of the dataset is 0.2940, and the median is 0.3292. Compared to the GPT-5.5 arm using the same task set, scoring criteria, and judge model (GPT-5.5), the qwen3.8-27B arm shows gaps in all four dimensions (Mechanics: 0.296 vs 0.456, Dynamics: 0.200 vs 0.292, Visual: 0.301 vs 0.473, Aesthetic: 0.384 vs 0.557), achieving 67% of GPT-5.5s overall reward. Additionally, 20 tasks lack demo replays due to generation termination, and replays were regenerated using an independent recording agent, with scores for these tasks serving as a lower bound of quality. The dataset provides a comparison between original run rewards and re-recorded rewards. This dataset is suitable for evaluating and comparing the ability of different language models to generate interactive web games, with particular attention to the quality of four dimensions: game mechanics, dynamics, visual, and aesthetics.

创建时间:
2026-09-03
原始信息汇总

GameCraft-Bench Web — 141 个由 qwen3.8-27B 生成的游戏(基准测试集)

数据集概览

  • 内容:GameCraft-Bench 的 141 个 Web 游戏任务,由 OpenGame 代理框架基于 qwen3.8-27B(1M 上下文)生成,并使用与 GPT-5.5 对照组完全相同的裁判模型和评分标准进行评估。
  • 用途:基准测试集,禁止用于训练
  • 许可:其他(other)。

数据布局

  • games/game-<task>.tar.gz:代理生成的项目,包括 src/public/dist/(被评分的构建)、demo_outputs/(回放轨迹)、conversation.txt(代理运行记录)、result.json
  • scores/scores-<task>.tar.gz:验证器看到的文件,包括 breakdown.jsonjudge_log.jsonctrf.jsonreward.txt 以及评分所用的采样帧和录像。
  • scores/breakdown.json:所有 141 个任务分解在一个对象中。
  • scores/dimensions.csv:每个任务一行:奖励、BUILD、四个维度均值、需求数量。
  • rewards.json:任务到奖励的映射。

评分结果

评分公式:BUILD * (0.15*M + 0.35*D + 0.15*V + 0.35*A),其中 M=机制,D=动态,V=视觉,A=美学。

维度 权重 均值 中位数
Mechanics 0.15 0.296 0.300
Dynamics 0.35 0.200 0.160
Visual 0.15 0.301 0.275
Aesthetic 0.35 0.384 0.440
  • 平均奖励 0.2940,中位数 0.3292。
  • 125/141 通过 BUILD 门槛,16 个未通过的任务在所有需求上得分为 0,这是差距的主要来源。

与 GPT-5.5 对照组比较

维度 qwen3.8-27B GPT-5.5 差值
Mechanics 0.296 0.456 −0.159
Dynamics 0.200 0.292 −0.093
Visual 0.301 0.473 −0.173
Aesthetic 0.384 0.557 −0.173
reward 0.2940 0.4371 −0.1431

qwen3.8-27B 达到 GPT-5.5 对照组的 67%,差距分布在所有四个维度,最大的单一因素是 BUILD 门槛(125/141 对比 140/141)。

数据来源

  • 推理模型qwen3.8-27b,通过 OpenRouter,1M 上下文。
  • 框架:OpenGame 代理,任务和评分标准未修改。
  • 图像生成和裁判:与 GPT-5.5 对照组保持一致,保证两组可比较;改变任一条件将导致配对失效。
  • 每个任务只进行一次,无 best-of-N。

上传前移除内容

  • node_modules/:61 个包中存在(每个约 18k 条目,占文件数 99%);package-lock.json 已包含,可通过 npm install 复现。
  • .qwen/:框架的系统提示,所有 141 个包中相同。
  • 绝对路径、主机名和内部端点改为中性占位符。

精度注意事项

所有分数仅为一次评分运行。在证据稀少(2 个约 1.7 秒的演示)的独立语料中,重新评分同一构建使奖励变动 0.072,并改变了 18 个需求中的 10 个。本数据集每个任务提供 4+ 个演示,帧数更多,因此波动预计更小但尚未测量。应谨慎对待小的任务级差异,整个对照组均值更为可靠。

重新录制的演示轨迹(20 个任务)

  • 在原始运行语料中,20 个任务因生成运行提前终止(进程退出/超时)而未生成轨迹,故得分为 0。
  • 这些任务的游戏代码未修改,由单独的录制代理(qwen3.8-27B)阅读源码并生成可回放的轨迹,每个包带有 RERECORD_PROVENANCE.json,完整列表见 RERECORDED_TASKS.json
  • 注意:重新录制的分数可能低于代理自写的轨迹(对照任务 simulation-kitchen-rush 上重新录制得分低 0.161),应视为游戏质量的下限。
  • 原始运行分数保存在 asrun_rewards.json,平均奖励从 0.2940 提升到 0.3495
任务 as-run 重新录制 轨迹数
openworld-necromancer 0.0000 0.1373 3
openworld-seasons-witch 0.0000 0.1167 3
platformer-vessel-of-hallownest 0.0000 0.1594 3
puzzle-circuit-wizard 0.0000 0.3940 3
puzzle-portal-lab 0.0000 0.2636 3
puzzle-sokoban-dungeon 0.0000 0.4585 3
racing-rocket-trials 0.0000 0.1137 3
roguelike-dungeon-shop 0.0000 0.1474 3
simulation-border-check 0.0000 0.6208 3
simulation-news-editor 0.0000 0.4262 3
simulation-transit-web 0.0000 0.4726 3
strategy-plant-defense 0.0000 0.5317 3
strategy-puzzle-magnet-lab 0.0000 0.6038 3
strategy-towerdefense 0.0000 0.4306 3
tycoon-space-colony 0.0000 0.5288 3
tycoon-tiny-factory-foreman 0.0000 0.3630 3
tycoon-trading-caravan-tycoon 0.0000 0.2420 3
visualnovel-debate-club 0.0000 0.4950 3
visualnovel-grimfable 0.0000 0.6594 3
visualnovel-lastsignal 0.0000 0.6625 3
搜集汇总
数据集介绍
gamecraft-web-qwen3.8-27b-baseline 数据集图片
构建方式
该数据集系GameCraft-Bench基准测试中Web游戏任务的生成产物,由OpenGame代理框架驱动qwen3.8-27B模型(1M上下文)在141项任务上自动构建而成。每个任务包含完整的项目文件(源代码、公共资源、构建产物、回放轨迹及对话记录),同时配套验证器生成的评分文件(维度分解、法官日志、奖励数值)。构建流程严格遵循统一协议:图像生成端点与法官模型均与GPT-5.5对照臂保持一致,仅推理模型有所区别,从而构成配对比较的科学基础。尤为值得注意的是,其中20项任务因原始生成线程中断而缺失回放轨迹,数据集另行采用独立记录代理依据游戏源码撰写符合任务契约的回放数据,并保留原始评分作为对照。
特点
数据集的显著特征在于其严谨的配对实验设计,同一任务集、评分标准与法官模型下,qwen3.8-27B达到GPT-5.5臂67%的平均奖励水平,差距分布于全部维度而非集中于单一要素。构建门控(BUILD)通过率125/141,未通过任务计零分,构成性能差距的主要来源。数据完整性方面,所有归档清理了依赖目录与系统提示,路径及内部端点均匿名化处理;回放轨迹经质量验证,对重录任务提供溯源记录与评分下界提示。精度告诫指出单次评分存在波动,但本数据集以多演示轨迹缓解,确保维度均值与整体结论具有统计可信度。
使用方法
数据集适用于多维度评估语言模型驱动的游戏开发能力,使用者可通过scores/breakdown.json分析各维度得分,借助dimensions.csv进行细粒度比较。验证标准采用BUILD加权公式,强调游戏动力学与美学的综合表现。由于任务与GPT-5.5臂形成对照,研究者可直接对比基线模型的差距分布,或对现有模型进行再生成与再评分。注意区分原始运行评分与重录评分,后者在20项任务中代表质量下界。数据包含完整对话与构建产物,支持复现代理行为或开展行为分析,但鉴于基准测试集属性,严禁用于模型训练。
背景与挑战
背景概述
GameCraft-Bench Web是GameCraft-Bench基准测试的Web任务子集,由Qwen3.8-27B模型驱动OpenGame代理框架自动生成,共包含141个网页游戏开发任务。该数据集创建于2025年,由OpenGame研究团队发布,旨在评估大型语言模型在复杂、多步骤的网页游戏开发任务中的推理与代码生成能力。其核心研究问题在于,通过标准化的任务描述、构建流程与自动评分机制,量化不同推理模型在端到端游戏开发上的性能差异。该数据集严格采用匹配实验设计,与GPT-5.5模型在同一任务集、相同图像生成端点和评判模型上执行对比,提供了同尺度可比较的分数体系,为智能体基准测试领域确立了高质量、高可控性的评估范式,对后续研究在多模态代码生成、交互式环境构建及代理评估方法学上具有重要参考价值。
当前挑战
该数据集所揭示的核心挑战集中在多维度生成质量的均衡性与自动评估的可靠性方面。首先,从领域问题来看,网页游戏开发要求模型同时兼顾机制(Mechanics)、动态(Dynamics)、视觉(Visual)与美学(Aesthetic)四个维度,而Qwen3.8-27B在这些维度上均落后于GPT-5.5,尤以视觉与美学差距显著,反映了模型在跨模态创意表达与精细设计上的局限。其次,构建过程中遇到诸多技术障碍:16个任务因构建失败而全零评分,占比高达11.3%,凸显了长代码生成中逻辑正确性的脆弱性;同时,20个任务因运行超时或进程终止导致演示轨迹缺失,迫使团队引入独立记录代理进行重录,但重录轨迹在覆盖范围和风格一致性上存在偏差,控制实验中已显示出评分降低(0.573→0.412),构成系统性误差。此外,单次评分带来的不确定性(同一构建重评分方差达0.072)进一步加剧了少量任务间的微小差异难以可靠解读的问题,对基准的可复现性和解释力提出了严峻挑战。
常用场景
经典使用场景
GameCraft-Bench Web数据集作为游戏生成领域的基准测试集,专注于评估大语言模型驱动智能体在网页游戏开发任务中的综合能力。其核心使用场景在于,通过141项涵盖多种游戏类型的开发任务,对模型在机制设计、动态平衡、视觉呈现与美学表达四大维度上的表现进行量化评分。研究者可借助该数据集,在统一任务、统一评判模型与统一奖励公式的受控条件下,对比不同推理模型(如qwen3.8-27B与GPT-5.5)的游戏生成效能,从而剖析模型在代码构建、创意实现与工程落地等环节的优劣。
解决学术问题
该数据集有效解决了自动化评估大模型游戏生成能力时面临的评测标准缺失与模型间可比性不足的学术难题。其提供的细粒度维度分解(M/D/V/A)与可复现的评分管线,使得研究者能够精准定位模型在特定能力维度上的短板,如动态反馈机制薄弱或视觉表现力欠缺。通过公开构建工件、评分痕迹与对话记录,数据集促进了游戏生成过程的可解释性研究,并支持对智能体决策链条的深入剖析,为构建更全面的生成式智能体评估框架奠定了数据基础。
衍生相关工作
该数据集的发布催生了一系列与智能体游戏开发能力评测与提升相关的研究。其开创性的对齐评测方法(将不同模型在同等条件下进行配对比较)启发了后续研究设计更严格的控制变量实验。数据集中异常样本(如重录演示轨迹)的分析促进了对生成鲁棒性的探讨,衍生出关于时间预算管理、错误恢复策略等研究议题。更重要的是,该数据集常被用作标准测试平台,检验新提出的知识增强、计划推理或多轮修正机制能否有效提升智能体在复杂、长时程游戏开发任务中的表现,从而推动该领域持续进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务