遇见数据集

biglab/webui-7k

收藏
Hugging Face2023-05-05 更新2024-03-04 收录
官方服务:

资源简介:

--- license: other --- This data accompanies the WebUI project (https://dl.acm.org/doi/abs/10.1145/3544548.3581158) For more information, check out the project website: https://uimodeling.github.io/ To download this dataset, you need to install the huggingface-hub package ``` pip install huggingface-hub ``` Use snapshot_download ``` from huggingface_hub import snapshot_download snapshot_download(repo_id="biglab/webui-7k", repo_type="dataset") ``` IMPORTANT * Before downloading and using, please review the copyright info here: https://github.com/js0nwu/webui/blob/main/COPYRIGHT.txt * Not all data samples have the same number of files (e.g., same number of device screenshots) due to the fact that the crawler used a timeout during collection * The dataset released on HuggingFace was filtered using a list of explicit words and therefore contains fewer samples than the experiments originally used in the paper. The raw dataset is currently available (https://drive.google.com/drive/folders/1hcO75W2FjsZoibsj2TIbKz67hy9JkOBz?usp=share_link) but may be removed in the future.

许可证:其他 本数据集配套于WebUI项目(项目链接:https://dl.acm.org/doi/abs/10.1145/3544548.3581158)。 如需获取更多详情,请访问项目官网:https://uimodeling.github.io/ 如需下载本数据集,请先安装huggingface-hub工具包: pip install huggingface-hub 请使用snapshot_download接口执行下载操作: from huggingface_hub import snapshot_download snapshot_download(repo_id="biglab/webui-7k", repo_type="dataset") 重要提示 1. 在下载与使用本数据集前,请务必查阅此处的版权声明:https://github.com/js0nwu/webui/blob/main/COPYRIGHT.txt 2. 因采集过程中爬虫设置了超时限制,并非所有数据样本的文件数量均保持一致(例如不同样本的设备截图数量存在差异)。 3. HuggingFace平台上发布的本数据集已通过敏感词列表完成过滤,因此其样本数量少于论文原实验所使用的数据集。原始数据集目前可通过以下链接获取(https://drive.google.com/drive/folders/1hcO75W2FjsZoibsj2TIbKz67hy9JkOBz?usp=share_link),但未来可能会被移除。

提供机构:
biglab
原始信息汇总

数据集概述

数据集名称

  • biglab/webui-7k

许可证

  • 其他

数据集来源

  • 该数据集与WebUI项目相关,项目详情可参考论文:WebUI project

下载方法

  • 使用Python的huggingface-hub包进行下载。
  • 下载命令: python from huggingface_hub import snapshot_download snapshot_download(repo_id="biglab/webui-7k", repo_type="dataset")

注意事项

  • 下载和使用前,请查看版权信息:版权信息
  • 数据集中的样本文件数量可能不一致,原因是数据收集过程中使用了超时机制。
  • 发布在HuggingFace的数据集经过特定词汇过滤,样本数量少于原始实验使用的数据集。原始数据集可在此处获取,但未来可能被移除。
搜集汇总
数据集介绍
构建方式
webui-7k数据集是伴随WebUI项目(发表于ACM CHI 2023)而构建的,旨在为移动用户界面理解与建模提供大规模真实数据资源。该数据集通过自动化爬虫技术从公开移动应用界面中采集设备截图与相关元数据,并经过明确的词汇过滤以剔除不当内容。值得注意的是,由于爬虫在采集过程中设置了超时机制,不同样本所包含的文件数量(如设备截图数量)并不完全一致。相较于论文原始实验所用的原始数据集,HuggingFace上发布的版本经过了更严格的过滤,样本数量有所减少,而原始完整数据集仍可通过Google Drive获取。
特点
webui-7k数据集的核心特点在于其来源于真实世界的移动应用界面,涵盖了多样化的UI布局与交互元素,为界面建模研究提供了丰富的视觉与结构信息。数据集中的每个样本可能包含多张设备截图,反映了同一界面在不同状态下的呈现,但样本间文件数量不一致的特性也体现了真实采集环境中的噪声与挑战。此外,数据集附带了明确的版权说明,要求使用者在下载前仔细审阅相关许可条款,确保合规使用。
使用方法
使用webui-7k数据集前,需先安装huggingface-hub包(通过pip install huggingface-hub命令),然后借助HuggingFace的snapshot_download函数即可便捷地将完整数据集下载至本地,具体代码为:from huggingface_hub import snapshot_download; snapshot_download(repo_id='biglab/webui-7k', repo_type='dataset')。由于数据集样本数量与文件结构存在不均一性,研究者在使用时需注意对数据进行预处理,以适应不同模型的输入要求,并务必遵守版权文件中的使用条款。
背景与挑战
背景概述
在移动用户界面(UI)设计领域,大规模、高质量的数据集是驱动自动化设计与分析模型发展的基石。biglab/webui-7k数据集由研究团队于2023年创建,源自发表于ACM CHI 2023的WebUI项目(DOI: 10.1145/3544548.3581158),旨在解决现实世界移动应用界面多样性与复杂性的建模问题。该数据集通过自动化爬虫从公开网络收集了约7000个移动应用界面样本,涵盖设备截图、布局结构及交互元素等关键信息,为理解用户界面设计模式、提升UI生成与评估算法的鲁棒性提供了宝贵的资源。其开源发布不仅促进了移动UI领域研究范式的演进,也为后续工作如界面相似性度量、设计风格迁移等奠定了数据基础,对推动人机交互与计算机视觉交叉领域的发展具有深远影响。
当前挑战
该数据集所解决的领域核心挑战在于移动界面数据的异质性与标注稀缺性,即如何从海量非结构化界面中提取可泛化的设计知识。构建过程中面临多重困难:首先,爬虫采集时因网络超时导致不同样本的文件数量不一致(如设备截图缺失),引入数据不完整性;其次,为规避版权与敏感内容问题,数据集经过显式词汇过滤,虽提升了合规性却减少了样本规模,与论文原始实验所用数据存在差异;此外,原始完整数据集存放于外部云盘且可能被移除,增加了结果可复现性的不确定性。这些挑战共同凸显了在构建大规模UI数据集时,平衡数据量、质量与伦理约束的复杂性。
常用场景
经典使用场景
在移动用户界面(UI)自动化建模与交互设计研究领域,biglab/webui-7k数据集因其丰富的真实移动应用界面截图与结构化元数据,成为训练和评估UI元素检测、语义理解与布局生成模型的经典基准。该数据集包含约7000个经过筛选的UI样本,每个样本附带多张设备截图及对应标注,广泛应用于UI组件识别、界面相似度计算以及从截图到代码的自动生成任务,为研究者提供了从视觉到语义的端到端学习范式的数据基础。
解决学术问题
该数据集有效解决了移动UI研究中长期存在的数据规模有限与标注不一致两大瓶颈。通过提供大规模、多来源的真实应用界面数据,它支持了UI布局的可预测性分析、界面设计模式的自动提取以及跨设备UI一致性评估等学术问题。其意义在于推动了UI自动化测试、可访问性验证和设计系统合规性检查等方向的发展,显著提升了模型在复杂真实场景下的泛化能力,并为用户界面设计原则的量化验证提供了实证基础。
衍生相关工作
该数据集衍生了多项具有影响力的研究工作,包括基于Transformer的UI布局生成模型(如UI-Transformer)、面向UI元素的对比学习框架,以及结合视觉语言模型的界面语义解析方法。相关研究论文多发表于CHI、UIST等顶级人机交互会议,推动了UI自动评估与生成技术从规则驱动向数据驱动的范式转变。此外,该数据集还催生了多个开源工具包,用于UI组件检测、布局重构和界面可访问性分析,形成了活跃的研究社区与持续迭代的基准测试体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务