IWR-Bench
收藏资源简介:
IWR-Bench是一个新颖的基准数据集,旨在评估大型视觉语言模型从用户交互视频中重建动态交互式网页的能力。该数据集包含来自100个真实网站的113个精心策划的任务,涵盖广泛的领域、视觉样式和交互模式,提供完整的开发资产和基于代理作为评判的自动化评估框架
IWR-Bench is a novel benchmark dataset aimed at evaluating the capability of large vision-language models to reconstruct dynamic interactive webpages from user interaction videos. This dataset includes 113 carefully curated tasks sourced from 100 real-world websites, covering a broad spectrum of domains, visual styles, and interaction modalities, and provides complete development assets along with an automated evaluation framework that employs AI Agents as judges.
IWR-Bench 数据集概述
数据集简介
IWR-Bench 是一个新颖的基准测试,旨在评估大型视觉语言模型从用户交互视频中重建动态交互式网页的能力。该基准测试提出了一项更贴近真实场景的挑战:模型不仅需要理解网页的视觉布局,还需要从视频中推断其交互逻辑,并生成功能完整的代码。
核心特性
- 真实世界任务:包含来自100个真实网站的113个精心策划的任务,涵盖广泛领域、视觉样式和交互模式
- 动态交互视频:输入不是静态截图,而是捕捉完整状态交互工作流程的视频,对模型的时间推理能力提出更大挑战
- 完整开发资源:每个任务提供所有必要的静态资源,模拟真实的网页开发环境
- 功能中心化评估:开发了"Agent-as-a-Judge"自动评估框架,通过程序化执行动作序列来评估生成网页的交互功能分数和视觉保真度分数
数据集构成
数据集包含113个任务,每个任务包括:
- 用户交互视频
- 网页所需的所有静态资源
- 用于评估的真实动作序列
- 每个动作步骤后的真实截图
评估结果
对28个领先LVLM的广泛评估揭示了当前模型在此任务中的关键瓶颈:
专有MLLM表现
- 最高分模型GPT-5总体得分仅为36.35%
- 交互功能分数最高仅为24.39%
- 视觉保真度分数最高为64.25%
开源MLLM表现
- Qwen3-VL (thinking) 总体得分31.15%
- Qwen2.5-VL-72B 总体得分23.61%
关键发现
- 交互式网页重建在很大程度上仍是未解决的问题
- 功能实现是主要瓶颈,模型生成正确事件驱动逻辑的能力严重受限
- 通用多模态能力比专门的视频处理架构更为关键
数据访问
数据集可通过以下地址获取:
- HuggingFace Datasets:https://huggingface.co/datasets/IWR-Bench/IWR-Bench
引用信息
bibtex @article{chen2025iwr, title={IWR-Bench: Can LVLMs reconstruct interactive webpage from a user interaction video?}, author={Chen, Yang and Liu, Minghao and Shen, Yufan and Li, Yunwen and Huang, Tianyuan and Fang, Xinyu and Zheng, Tianyu and Huang, Wenxuan and Yang, Cheng and Fu, Daocheng and others}, journal={arXiv preprint arXiv:2509.24709}, year={2025} }




