遇见数据集

VIS-APP-Bench

收藏
github2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

VISTA是一个用于评估大型语言模型编码代理从视觉规范生成端到端Web应用的基准数据集。每个任务为代理提供一个产品设计,并要求其构建一个可运行的全栈应用。该数据集通过匹配每个人工标注的UI锚点到实时DOM元素,并检查其是否正确放置和实际工作,来评分结果与规范的匹配程度,不仅关注视觉,还关注行为。数据集包含10个应用任务和多种规范条件(如C4条件提供渲染的Figma图像和修剪的Figma结构JSON)。

VISTA is a benchmark dataset for evaluating large language model (LLM) coding agents to generate end-to-end web applications from visual specifications. Each task delivers a product design to the agent and mandates the construction of a runnable full-stack application. This dataset quantifies the alignment between the generated result and the provided specifications by matching each manually annotated UI anchor to real-time DOM elements, and verifying whether these elements are correctly positioned and functionally operational, covering both visual fidelity and behavioral correctness. The dataset comprises 10 application tasks and multiple specification conditions; for instance, the C4 condition supplies rendered Figma images and pruned Figma structure JSON.

创建时间:
2026-06-19
原始信息汇总

VISTA — Visual-Spec → App Benchmark

VISTA是一个用于评估LLM编程智能体从视觉规格(visual specs)生成端到端Web应用能力的基准测试。

核心目标

  • 每个任务向智能体提供一个产品的设计图,要求其构建一个可运行的全栈应用。
  • 评分标准不仅关注视觉匹配程度,更注重行为匹配度:通过将人工标注的每个关键UI锚点(UI anchor)与真实的DOM元素进行匹配,检查其位置是否正确功能是否真正可用

评分机制

  • 评估流程:视觉规格 → 智能体(模型×框架)→ 可运行应用 → 逐锚点DOM匹配 → 综合得分S。
  • 每个锚点评估两个维度
    • 定位(Localization, L):判断正确的元素是否出现在正确的位置(基于DOM匹配和边界框交并比/距离)。
    • 行为(Behavior, B):判断元素是否执行了正确的操作(如点击导航、输入接受、开关切换、对话框打开等)。
  • 得分计算
    • 单个锚点得分 = L × B
    • 单个应用得分为其所有关键锚点得分的平均值。
    • 综合得分S 是所有10个应用的得分平均值(缺失或损坏的元素得分为0)。由于S = L × B,看起来正确但无法运行的应用得分接近零。

条件C4(排行榜所用条件)

智能体获得最丰富的规格说明最大的自由度

  • 提供页面的渲染Figma图像(截图模型)。
  • 提供精简后的Figma结构(布局树JSON格式)。
  • 不限定目标框架,智能体可自主选择技术栈。

运行基准测试

所有运行脚本位于tasks/目录下。

  • 基础脚本run_eval.sh

    • 启动一个智能体针对一个任务/变体,创建工作目录并运行事后分析。
  • 前提条件:需要运行Docker,并安装和认证相应的智能体CLI。

  • 支持的智能体CLI

    • Claude Code(默认)
    • OpenAI Codex
    • Gemini CLI
    • Cursor
  • 主要命令示例: bash cd tasks

    单次运行,使用默认CLI(Claude)

    ./run_eval.sh --task 1_newsletter --variant c4

    指定CLI和模型

    ./run_eval_codex.sh --task 1_newsletter --variant c4 --model gpt-5.5

  • 批量运行与评分: bash ./run_all.sh --variant c4 --cli cursor --skip-existing # 为一个智能体运行所有任务 FILTER=c4 ./eval_all_runs.sh "$PWD/runs<config>" # 构建、启动并评分所有运行结果

数据获取

引用信息

bibtex @misc{guo2026vistaendtoendbenchmarkvisual, title={VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents}, author={JunJia Guo and Yuhang Yao and Jiawei and Zhou and Jingdi Chen}, year={2026}, eprint={2605.26144}, archivePrefix={arXiv}, primaryClass={cs.SE}, url={https://arxiv.org/abs/2605.26144}, }

搜集汇总
数据集介绍
VIS-APP-Bench 数据集图片
构建方式
VIS-APP-Bench数据集的构建围绕视觉规格驱动的全栈应用生成任务展开。每一任务向智能体提供产品设计稿,要求其构建可运行的全栈应用。数据集精心挑选了10个代表性应用场景,每个场景均包含人工标注的关键UI锚点。评估时,将智能体生成的应用置于Docker容器中运行,针对每个锚点,通过DOM匹配与边界框交并比/距离计算定位准确度,同时测试点击导航、输入响应、开关切换、对话框弹出等行为正确性。锚点得分为定位与行为的乘积,应用得分为所有锚点均值,最终综合得分S为10个应用的均值,缺失或错误元素计零分。
使用方法
使用者需在tasks目录下通过run_eval.sh脚本启动评测,指定任务、条件变体及可选的智能体CLI与模型。支持Claude Code、OpenAI Codex、Gemini CLI及Cursor四种主流编码智能体接口,各CLI需预先安装并认证。为确保可重复性,可通过环境变量固定具体二进制版本。批量评测由run_all.sh驱动,单次运行结果记录于meta.json及事件日志中。最终评分通过eval_all_runs.sh对运行目录执行后分析,生成汇总评估表。整套流程强调容器化隔离与标准化评估,便于横向对比不同智能体的端到端应用生成能力。
背景与挑战
背景概述
随着大语言模型在代码生成领域的飞速发展,将视觉设计稿自动转化为可运行的网络应用已成为人工智能与软件工程交叉领域的前沿课题。VIS-APP-Bench数据集由JunJia Guo、Yuhang Yao、Jiawei Zhou和Jingdi Chen等研究人员于2026年创建,旨在系统评估编码智能体从视觉规格说明端到端生成全栈网络应用的能力。该数据集的核心研究问题在于:如何通过细粒度的UI锚点匹配机制,确保生成的网络应用不仅在视觉上忠实于设计稿,同时在交互行为上也完全符合预期。VIS-APP-Bench通过结合Figma渲染图像与布局树JSON作为输入规格,并采用定位与行为双维度评分体系,为评估编码智能体的实用性建立了严谨基准,对推动智能体驱动的自动化前端开发领域产生了重要影响。
当前挑战
VIS-APP-Bench数据集面临多重挑战。在领域问题层面,从视觉规格自动生成可运行网络应用需要解决视觉理解与代码生成之间的语义鸿沟,智能体不仅要准确识别设计稿中的UI元素位置,还需理解其交互逻辑并生成功能完整的后端逻辑,这对现有模型构成了显著障碍。在构建过程中,如何设计一套可自动执行的细粒度评估方案是核心挑战,具体包括:为每个应用标注数百个关键UI锚点并定义其预期位置与行为;在Docker容器中自动化部署并检验应用,需处理不同框架与技术的兼容性问题;以及建立统一的评分标准,使定位准确性与行为正确性得以联合衡量,避免视觉匹配但功能失效的假阳性结果。
常用场景
经典使用场景
VIS-APP-Bench数据集紧扣视觉规格驱动代码生成的前沿范式,专为评估大语言模型编码智能体在端到端全栈网页应用生成任务中的表现而设计。其核心场景在于向智能体提供产品设计的视觉规格——涵盖渲染的Figma截图及精简的Figma结构布局树,要求智能体自主选择技术栈,构建可运行且视觉与行为高度忠实于原规格的网页应用。该数据集通过精细标注的界面锚点,分别从定位准确性和功能行为正确性两个维度进行评分,从而实现对智能体综合能力的量化衡量。
解决学术问题
该数据集系统性地解决了自然语言处理与软件工程交叉领域中一个长期悬而未决的学术难题:如何客观、可复现地评估编码智能体从视觉设计到可运行应用的转化能力。传统评估多局限于静态代码生成或简单函数编写,而VIS-APP-Bench创新性地引入了基于动态DOM匹配的行为验证机制,迫使智能体不仅要生成视觉上一致的界面,还需确保每一个交互组件均具备真实功能。这为研究视觉理解、代码生成与功能性验证三者间的耦合关系提供了标准化的测试平台。
实际应用
在实际应用层面,VIS-APP-Bench所评估的能力与当下快速发展的低代码开发平台及AI辅助编程工具有着天然的契合。企业产品团队在进行原型设计时,可将设计稿转化为功能完备的Web应用,大幅缩短从设计到上线的周期。该数据集所衡量的核心指标——即视觉忠实度与行为正确性的统一,直接对应着产品开发中最关键的质量控制环节。因此,它可作为产品经理和设计师筛选AI编码助手的技术参考,推动人机协作的无缝对接。
数据集最近研究
最新研究方向
VIS-APP-Bench(VISTA基准测试)聚焦于前沿的视觉规格到全栈应用生成的端到端评估,是应对大语言模型编码智能体在真实世界软件开发中能力验证的关键突破。随着多模态大模型与代码生成技术的迅猛发展,如何系统性地衡量智能体将设计蓝图转化为可运行、功能完备的应用程序的能力,成为该领域亟待解决的核心命题。VISTA基准通过引入细粒度的UI锚点标注与双重评估机制,不仅检查生成页面的视觉对齐精度,更深入验证每个交互元素的实际行为逻辑,开创性地将视觉忠实度与功能正确性统一量化。其发布恰逢AI驱动软件开发与低代码平台加速融合的热潮,为评估模型从静态设计稿到动态全栈应用的跨越式能力提供了标准化尺度,对推动编码智能体从学术研究走向产业落地的可信度评估具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务