遇见数据集

IIGroup/WebRISE

收藏
Hugging Face2026-06-03 更新2026-06-14 收录
官方服务:

资源简介:

WebRISE 是一个用于评估多模态大语言模型(MLLM)生成的网页工件的需求诱导状态评估基准。该发布版本包含任务规范、多模态输入、真实的HTML工件以及用于基于浏览器评估的交互合同图(ICGs)。数据集涵盖442个任务,涉及五种输入模态,具体内容包括完整的任务目录和需求注释、每个任务的独立文件夹、交互合同图(包含状态、转换、DOM断言、视觉后置条件和需求覆盖映射)、可执行的HTML工件,以及文本、Markdown、草图、图像和视频等模态特定的输入规范(当可用时)。

WebRISE is a benchmark for requirement-induced state evaluation of MLLM-generated web artifacts. The release contains task specifications, multimodal inputs, ground-truth HTML artifacts, and Interaction Contract Graphs (ICGs) for browser-based evaluation. It includes 442 tasks across five input modalities, with contents such as a full task catalog and requirement annotations, per-task folders, ICGs with states, transitions, DOM assertions, visual postconditions, and requirement coverage mappings, executable HTML artifacts, and modality-specific input specifications in Text, MD, Sketch, Image, and Video when available.

提供机构:
IIGroup
搜集汇总
数据集介绍
IIGroup/WebRISE 数据集图片
构建方式
WebRISE数据集专为评估多模态大语言模型生成的Web产物而设计,聚焦于需求引发的状态评估。其构建基于442个多样化任务,涵盖文本、Markdown、草图、图像和视频五种输入模态。每个任务均包含完整的交互契约图(ICG),详细刻画了状态、转换、DOM断言、视觉后置条件及需求覆盖映射。数据集的ground-truth部分由可执行的HTML产物构成,确保评估的客观性与可复现性。通过将多模态输入与结构化ICG相结合,WebRISE为Web产物生成领域提供了一个系统化的基准测试框架。
特点
WebRISE的核心特点在于其独创的交互契约图机制,该机制通过形式化的状态与转换描述,实现了对Web产物生成过程中需求满足度的精细评估。数据集覆盖五种多模态输入,能够全面检验MLLM在理解不同表征形式下的需求转换能力。此外,WebRISE包含完整的任务规范与需求标注,支持浏览器环境下的自动化交互式评估,使得对生成产物的功能性与视觉合规性审核成为可能。其结构化设计有效弥补了现有评估基准在需求驱动的状态验证方面的空白。
使用方法
使用WebRISE时,研究者可从`requirements_full.json`文件中获取完整的任务目录与需求注解。每个任务通过唯一的`task_id`索引,其目录下包含ICG图、ground-truth HTML文件及对应模态的输入规范。评估流程中,可将MLLM生成的Web产物与ground-truth进行对比,借助ICG中的DOM断言与视觉后置条件进行结构化验证。该数据集特别适合用于衡量模型在跨模态理解与需求驱动生成方面的性能,支持通过浏览器自动化工具进行端到端的交互式测试与结果收集。
背景与挑战
背景概述
在人工智能与前端工程交叉领域,大语言模型(MLLM)生成网页工件的能力日益受到关注,但如何系统评估这些工件的状态正确性仍是一大难题。为此,清华大学等机构的研究人员于2026年创建了WebRISE基准,旨在通过需求诱导的状态评估框架,为MLLM生成的网页工件提供标准化评测。该数据集包含442个任务,覆盖文本、图像、视频等五种输入模态,并引入了交互合约图(ICG)来形式化描述状态、转换与DOM断言。WebRISE的提出填补了多模态网页工件生成评估的空白,为构建更可靠、更可控的智能网页生成系统奠定了重要基础。
当前挑战
WebRISE所面临的挑战主要集中在两个层面。在领域问题层面,现有评估方法多聚焦于页面外观或语义相似性,难以捕捉网页交互过程中状态正确性与行为符合性的细微差异,尤其缺乏对多模态输入下生成结果的功能完备性验证。在构建过程层面,设计涵盖多种模态的ICG模板与任务规范需要大量人工标注,且需保证不同模态下状态描述的一致性;此外,442个任务中的每个任务均需生成可执行的HTML工件与对应的ICG,对标注质量与效率提出了极高要求。
常用场景
经典使用场景
WebRISE数据集专为多模态大语言模型(MLLM)生成的网页制品提供基于需求的状态评估基准。其核心用途在于衡量模型能否依据给定的多模态输入(如文本描述、草图、图像、视频等)生成符合交互规范的可执行HTML网页。研究者通过该数据集可系统评估MLLM在网页生成任务中的质量、功能完整性和需求对齐程度。
解决学术问题
WebRISE解决了当前MLLM评估中缺乏针对网页生成制品的系统性、细粒度状态验证问题。传统评估多聚焦于生成内容的视觉相似性或文本匹配,而忽略了交互逻辑与需求覆盖。该数据集通过引入交互合约图(ICG),将页面状态、DOM断言、视觉后置条件与需求映射关联,填补了从需求描述到网页实现全链条的量化评估空白,推动了多模态生成与软件开发验证的交叉研究。
衍生相关工作
WebRISE的发布催生了一系列后续研究,包括面向网页制品的自动化测试生成、基于ICG的状态空间剪枝方法,以及多模态需求解释与代码映射的可解释性分析。其提供的结构化评估范式也为构建更复杂的多智能体协作生成与验证系统奠定了基础,推动从单一生成任务向需求驱动的完整开发生命周期建模演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务