遇见数据集

UI2App

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

UI2App是首个专注于‘交互推断’的基准测试数据集,其核心任务是从静态的用户界面(UI)截图出发,无需任何文本提示或行为描述,生成可运行、支持多路径交互的Web应用程序。与以往仅评估视觉保真度的图像到Web基准不同,UI2App旨在评估模型能否仅从视觉证据中推断并恢复出应用程序的交互行为。该数据集包含45个状态一致的可运行Web应用,共计327张UI截图,平均每个应用包含约7.3张截图。应用涵盖内容型(35.6%)、管理型(35.6%)、交易型(13.3%)和专业型(15.6%)等多种类别。每张截图均在1440×900的视口下,通过无头Chrome浏览器在页面水化后采集,并移除了开发工具覆盖层,同时使用感知哈希技术进行了去重处理。每个应用以目录形式组织,包含一系列PNG格式的截图文件和一个关键的`manifest.json`文件,后者记录了项目元数据、视口信息以及每张截图对应的路由、标签和类型。数据集通过一个严谨的三阶段流程构建:首先通过GitHub查询获取候选仓库,然后经过自动化过滤(包括许可证、结构有效性、可构建性和认证墙检测),最后通过专家根据页面级、应用级和语料库级标准进行筛选。该数据集适用于图像到文本、文本生成、代码生成、Web开发、UI到代码转换、视觉语言模型以及交互推断等研究任务。

UI2App is the first benchmark dataset focused on interaction inference, with the core task of generating runnable, multi-path interactive web applications from static user interface (UI) screenshots, without any textual prompts or behavior descriptions. Unlike previous image-to-web benchmarks that only evaluate visual fidelity, UI2App aims to assess whether models can infer and recover the interactive behavior of applications solely from visual evidence. The dataset contains 45 state-consistent runnable web applications, totaling 327 UI screenshots, with an average of about 7.3 screenshots per application. Applications cover various categories, including content-based (35.6%), management-based (35.6%), transaction-based (13.3%), and professional-based (15.6%). Each screenshot is captured at a viewport of 1440×900 using a headless Chrome browser after page hydration, with developer tool overlays removed, and deduplicated using perceptual hashing techniques. Each application is organized as a directory containing a series of PNG screenshot files and a key `manifest.json` file, which records project metadata, viewport information, and the route, label, and type for each screenshot. The dataset is constructed through a rigorous three-stage process: first, candidate repositories are obtained via GitHub search; then, automated filtering is applied (including license checks, structural validity, buildability, and authentication wall detection); finally, experts screen them based on page-level, application-level, and corpus-level criteria. This dataset is suitable for research tasks such as image-to-text, text generation, code generation, web development, UI-to-code conversion, visual language models, and interaction inference.

创建时间:
2026-06-30
原始信息汇总

数据集概述:UI2App

UI2App 是一个用于评估视觉交互推理能力的基准数据集,旨在测试模型能否仅从UI截图生成可运行的多路由Web应用程序。

  • 核心任务:交互推理(Interaction Inference),即从静态截图恢复应用程序的交互行为,无需文本提示或行为描述。
  • 独特价值:区别于仅评估视觉保真度的传统图像到Web基准,UI2App侧重于模型对交互行为的推理能力。

数据集规模与结构

  • 总截图数量:327张
  • 截图集合:45个状态一致的截图集,每个集合对应一个可运行的参考Web应用。
  • 单应用截图数:4至14张,平均每应用7.3张。

数据格式与内容

每个应用包含一个目录,内含:

  • PNG截图文件:如 img_00_home.pngimg_01_shop.png
  • manifest.json:记录项目信息、视口尺寸(1440×900)、每张截图的路径、标签和类型。
  • 截图采集:使用无头Chromium浏览器,在页面加载完成后、无开发覆盖层状态下捕获,并经过感知哈希去重。

应用分类

45个应用分为四类:

  • 内容类:占比35.6%
  • 管理类:占比35.6%
  • 交易类:占比13.3%
  • 专业类:占比15.6%

数据集构建过程

采用三阶段流水线构建:

  1. 候选获取:通过24个架构感知的GitHub查询,获得2,013个候选仓库。
  2. 自动筛选:经过四阶段自动过滤(许可证、结构有效性、可构建性、认证墙检测),得到164个可用仓库。
  3. 专家选择:通过三级专家评审(页面级、应用级、语料级标准),最终确定45个应用。

许可与引用

  • 许可协议CC-BY-4.0(评估代码另行以MIT协议发布)。
  • 引用@article{chen2026ui2app, title={UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation}, author={Chen, Grace Man and Guo, Litao and Wu, Yifan and Chen, Yiyu and Tseng, Yenchi and Liu, Sicheng and Luo, Yuyu and Chen, Ying-Cong}, journal={arXiv preprint}, year={2026}}

数据集状态

  • 完整数据集即将发布,当前为官方基准页面,数据文件和加载脚本正在最终完善中。
搜集汇总
数据集介绍
构建方式
UI2App数据集的构建遵循一套严谨的三阶段流水线。首先,通过24种基于应用原型的GitHub搜索查询,初步筛选出2,013个候选仓库;随后,执行四阶段自动化过滤,涵盖许可证合规性、结构有效性、可构建性及认证墙检测,将可用仓库缩减至164个;最后,经由专家在页面、应用和语料库三个层面进行精细遴选,最终确定了45个高质量的可执行Web应用。每个应用均包含多张截图(共327张,每应用4至14张不等)及一份manifest.json文件,详尽记录了项目信息、视口尺寸(1440×900)和每张截图的路由、标签与类型。
特点
作为首个聚焦于交互推理的基准数据集,UI2App的核心特点在于其评估维度的革新:它要求模型仅凭UI截图便能生成具备多路由功能、可实际运行的Web应用,而不依赖于任何文本提示或行为描述。相较于仅考察视觉保真度的传统图像转代码基准,UI2App更深入地衡量模型从静态视觉证据中恢复应用程序交互行为的能力。数据集覆盖内容展示(35.6%)、后台管理(35.6%)、交易处理(13.3%)及专业应用(15.6%)四类领域,其截图通过无头Chromium在页面水合后捕获,并经感知哈希去重,确保了数据的高纯净度与代表性。
使用方法
该数据集适用于图像到文本与文本生成两大任务类别,尤其服务于代码生成与视觉语言模型的研究。用户可将UI截图作为输入,驱动模型生成对应的Web应用代码,并通过对比生成结果与原始应用在交互行为上的吻合度来评估模型性能。所有数据以应用为单位组织,每个目录包含PNG截图序列与结构化manifest文件,便于加载与解析。数据集采用CC-BY-4.0许可协议,便于学术共享。值得注意的是,当前数据集处于预发布阶段,完整的数据文件与加载脚本即将公开,研究者可关注其更新以获取最终版本。
背景与挑战
背景概述
UI2App数据集由Grace Man Chen、Litao Guo等研究人员于2026年提出,旨在应对从静态用户界面截图直接生成可执行多路径Web应用程序这一前沿挑战。与以往仅关注视觉保真度的图像到代码基准不同,UI2App聚焦于交互推理能力,即模型能否仅凭视觉证据复原应用程序的交互行为。该数据集包含45个状态连贯的截图集合,共计327张截图,覆盖内容展示、后台管理、交易处理及专业应用四大类别,为视觉语言模型在代码生成领域的评估树立了新标杆,推动了人机交互与自动化编程的交叉研究。
当前挑战
UI2App数据集所解决的领域核心挑战在于突破传统图像到代码生成的局限,即模型不仅需识别UI元素,更需理解隐含的交互逻辑(如点击后的状态跳转),从而生成完整的可执行应用。在构建过程中,研究团队面临多重困难:从2013个候选仓库中通过结构有效性、可构建性及无认证墙等多阶段自动筛选,仅获164个可用仓库;随后通过页面级、应用级与语料级三层专家精选,最终压缩至45个高质量应用,确保了数据的代表性与纯净度,但过程极为耗时且依赖专业知识。
常用场景
经典使用场景
UI2App数据集专为评估视觉交互推理能力而设计,其经典使用场景是从静态UI截图直接生成可运行的多路由Web应用程序。与以往仅关注视觉保真度的图像到代码基准不同,该数据集要求模型仅凭截图中蕴含的视觉线索——如按钮、导航栏、表单元素的空间布局与视觉状态——恢复出完整的交互逻辑与多页面跳转行为。研究人员可利用这327张截图构成的45个状态连贯的截图集合,测试模型在无文本提示或行为描述条件下的端到端应用生成能力,从而衡量其在真实Web开发场景中对用户界面隐含交互范式的理解深度。
衍生相关工作
UI2App的出现已在多个研究方向催生衍生工作。基于其提出的交互推理基准,研究者开始探索多模态大语言模型在Web代码生成中的行为理解能力,推动了面向UI状态转移图的神经架构设计。一些工作借鉴其三级筛选流程构建了更大规模的UI代码配对数据集,如将45个参考应用扩展至数百个类别。另一些研究则专注于改进评估指标,在视觉相似度和代码可执行性基础上引入交互复杂度度量。此外,该数据集还启发了对前端框架无关的中间表示学习的研究,旨在从截图直接产生React、Vue等现代框架的组件化代码,从而进一步弥合设计与实现之间的鸿沟。
数据集最近研究
最新研究方向
UI2App作为首个聚焦于视觉交互推理的基准数据集,革新了从静态界面截图直接生成可执行多路由网络应用的研究范式。在当前多模态大模型与代码生成技术蓬勃发展的背景下,该数据集突破了传统UI转代码仅评估视觉保真度的局限,将评价维度拓展至交互行为恢复层面。通过45个真实应用场景与327张状态连贯的截图,UI2App精准检验了模型从视觉证据中推断用户操作逻辑与系统动态响应的能力,为构建真正理解并复现人机交互过程的智能系统提供了关键评测标尺,也推动了低代码与自动化前端开发领域的实质性进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务