遇见数据集

WORLDCODER-BENCH

收藏
arXiv2026-06-01 更新2026-06-03 收录
官方服务:

资源简介:

WORLDCODER-BENCH是由中国科学院自动化研究所与华为诺亚方舟实验室联合创建的首个专注于物理基础3D世界合成的基准数据集,旨在评估大型语言模型生成可执行、交互式Three.js程序的能力。该数据集包含2,026个专家精心策划的任务,覆盖模拟、渲染和应用三大宏观类别及15个细粒度领域,数据来源于人工种子创建与LLM辅助扩展,并经过严格过滤与验证。数据集创建过程采用四阶段流水线,包括专家种子策划、扩展过滤、运行时验证及反污染处理,确保了任务的高质量与多样性。其主要应用于评估和提升AI模型在物理正确性、资产集成和状态同步方面的能力,旨在解决生成式3D世界中行为正确性难以从外部观测的挑战,推动交互式3D内容开发的自动化进程。

WORLDCODER-BENCH is the first benchmark dataset dedicated to physically grounded 3D world synthesis, jointly created by the Institute of Automation of the Chinese Academy of Sciences and Huawei Noah's Ark Lab. It aims to evaluate the capability of large language models (LLMs) to generate executable and interactive Three.js programs. This dataset contains 2,026 expert-curated tasks, covering three macro categories: simulation, rendering, and application, as well as 15 fine-grained domains. The data is sourced from manual seed creation and LLM-aided expansion, and has undergone rigorous filtering and validation. The dataset creation process adopts a four-stage pipeline, including expert seed curation, expansion filtering, runtime verification, and anti-contamination processing, to ensure the high quality and diversity of the tasks. Its main applications are to evaluate and enhance the capabilities of AI models in terms of physical correctness, asset integration, and state synchronization. It aims to address the challenge that the behavioral correctness of generative 3D worlds is difficult to observe externally, and promote the automation process of interactive 3D content development.

创建时间:
2026-06-01
搜集汇总
数据集介绍
WORLDCODER-BENCH 数据集图片
构建方式
在三维世界合成领域,大型语言模型正从生成静态界面迈向构建可执行的交互式环境。WORLDCODER-BENCH通过一套系统化的四阶段流水线构建而成:首先由五名三维图形学与交互系统领域的博士研究员耗时两个月手工精心设计种子任务,并经过严格同行评审确保清晰性与可行性;随后借助大语言模型辅助扩展生成超过一万个候选任务,涵盖多种空间布局、物理机制与渲染效果,再由标注员剔除模糊、琐碎或无法转化为确定性运行时检查的任务;接着在无头浏览器中对幸存候选任务进行运行时验证,确保资产可用、加载稳定并与标准化接口兼容,同时由专家编写隐藏的行为评估契约;最后通过对抗污染措施,包括生成随机化参数变体(如物理常数、物体数量、初始状态与资产选择)来打破模板记忆,所有评估逻辑与断言严格对模型隐藏,最终保留2026个专家精修的标准任务,并划分为核心集、扩展集、鲁棒性测试集与开发集。
特点
WORLDCODER-BENCH的核心特征在于其评估范式从外部视觉观察转向内部运行时状态验证。该基准首次将可执行Three.js世界的行为正确性而非视觉合理性作为评价单元,通过STATEPROBE执行协议在沙箱化浏览器中探测生成的程序,比对隐藏的行为契约——这些契约经过变异测试硬化,只有在成功拒绝注入的缺陷(如状态更新删除、物理常数缩放、事件目标交换)后才被采纳,确保通过结果反映真实行为正确性而非宽松阈值。数据集覆盖模拟、渲染与应用三大宏观类别及15个细粒度领域,包含仅用图元场景与依赖.glb资产的复杂世界,任务难度从基础场景初始化到多步逻辑与严格物理约束不等。此外,引入自动化回报率与时间效率乘数两项实用度量,将模型输出与付费三维网页开发者劳动置于同一价值轴上进行衡量。
使用方法
使用WORLDCODER-BENCH时,模型接收一个结构化目录,内含自然语言指令与可选的.glb资产文件,需生成单个自包含的HTML文件,该文件在标准浏览器中利用Three.js渲染并控制一个功能完整的交互式三维世界。STATEPROBE在无头Chromium浏览器中执行生成的程序,通过标准化的运行时状态接口暴露关键变量,施加脚本化的动作序列(如点击、按键、拖动),在每次动作前后捕获状态快照,并检查状态变化是否符合由领域专家编写的隐藏行为契约。评价结果以四种覆盖率指标呈现:可用性覆盖率、状态覆盖率、转换覆盖率与验证覆盖率,其中验证覆盖率是主要排行榜指标。模型无需访问评估契约、动作序列、阈值或测试脚本,保持零样本评估的纯洁性。所有评估逻辑与隐藏分片严格保密,仅开发集公开契约与参考输出用于本地调试。
背景与挑战
背景概述
WORLDCODER-BENCH由中国科学院自动化研究所与华为诺亚方舟实验室的研究人员于2026年联合创建,旨在解决大语言模型生成可执行三维世界时缺乏行为正确性评估的问题。随着大语言模型从生成静态界面转向构建交互式三维世界,传统基于像素或DOM节点的评估方法因Three.js渲染在WebGL画布中而无法触及内部运行时状态。该基准包含2026个专家精心设计的任务,横跨仿真、渲染与应用三大宏观类别及15个细粒度领域,并提出了STATEPROBE协议——一种基于执行的验证方法,通过隐藏的、经变异测试加固的行为合约来探测生成程序的运行时状态。该数据集在九个前沿模型上的评估显示,最佳系统仅达到27.8%的验证覆盖率,揭示了当前模型在行为正确性方面的显著局限。
当前挑战
WORLDCODER-BENCH所解决的领域核心挑战在于:生成式三维世界的行为正确性评估无法通过外部视觉观察实现,因为Three.js程序的关键状态(如物理碰撞、能量守恒、状态同步)均隐藏在JavaScript运行时中,截图或DOM检查对其完全失效。现有基准普遍忽视物理正确性、资产集成与状态同步三个关键维度,导致模型被误导。构建过程中面临的挑战包括:如何设计经变异测试加固(如注入损坏的状态更新、更改物理常数)的行为合约以确保评估不可破解;如何构建包含2026个多样化任务的专家数据集,覆盖从基本场景初始化到多步逻辑、严格物理约束及状态同步;以及如何防止数据泄露,通过随机化物理常数、物体数量、初始状态等生成鲁棒变体,迫使模型理解底层机制而非记忆模板。
常用场景
经典使用场景
在三维世界合成领域,WORLDCODER-BENCH最经典的用途是作为评估大语言模型能否生成可执行、物理合理的浏览器原生3D世界的标准化测试平台。研究者通过向模型提供自然语言描述的任务指令与可选的.glb三维资源,要求其输出一个完整的、基于Three.js的HTML页面。该场景的独特之处在于,它不仅关注生成代码的视觉相似性,更通过STATEPROBE协议探测隐藏的状态契约,检验物理约束、资产集成与状态同步等核心能力,从而实现了从“看起来正确”到“运行起来正确”的范式跃迁。
解决学术问题
该数据集精准回应了现有Web生成基准无法评估交互式3D程序行为正确性的核心学术困境。传统方法依赖截屏、DOM节点或视觉智能体,但Three.js场景的状态、物理与交互逻辑完全封装在<canvas>的WebGL像素流中,外部观察无法触及运行时变量。WORLDCODER-BENCH通过引入突变加固的隐藏行为契约与执行探测协议,首次提供了可量化的验证覆盖率指标(V-Cov),并揭示了状态模式漂移与交互链断裂才是最频繁的失败根源,而非场景元素缺失,从而引导研究关注从外观仿真转向行为可靠。
衍生相关工作
WORLDCODER-BENCH的出现催生了一系列致力于提升三维代码生成行为可靠性的后续工作。这些工作沿两条主线展开:一是深化STATEPROBE式的执行验证思想,将突变测试与运行时状态探测扩展到更复杂的多资产场景或物理连续体仿真中;二是基于该基准揭示的状态模式漂移与交互链断裂两大主导失败模式,设计新的提示策略、结构约束框架或面向Three.js的微调数据集,以提升模型在状态同步与事件驱动逻辑上的生成保真度。此外,该数据集还促使社区反思现有Web生成基准的评估范式,推动了从视觉相似性指标向执行行为指标的系统性转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务