mm-eval/ScreenQA
收藏官方服务:
资源简介:
--- dataset_info: features: - name: id dtype: string - name: media list: image - name: messages dtype: string splits: - name: train num_bytes: 11127743046 num_examples: 68980 - name: validation num_bytes: 1405709319 num_examples: 8618 - name: test num_bytes: 1355018944 num_examples: 8427 download_size: 11798210590 dataset_size: 13888471309 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* ---
提供机构:
mm-eval原始信息汇总
数据集 ScreenQA 详情
- 来源与创建者: 由
mm-eval组织提供,隶属于mm-evaluation系列。 - 模态: 包含图像和文本。
- 格式: 提供
parquet和optimized-parquet格式。 - 大小: 样本量在 10K 到 100K 之间。
- 支持库: 支持
Datasets、Dask、Polars等库。 - 数据集结构:
- 子集: 包含一个名为
default的子集,约 86,000 行。 - 划分: 分为三个数据划分:
- train: 约 69,000 行
- validation: 约 8,620 行
- test: 约 8,430 行
- 子集: 包含一个名为
- 数据字段示例:
id: 字符串类型,长度在 1 到 8 之间。media: 图像列表。messages: 字符串类型,长度在 114 到 1.65k 之间。包含包含role、question、answer、hint、options、choices和source_id等字段的对话数据,内容涉及对屏幕截图(如应用界面、电视画面、菜谱等)的问答。
搜集汇总
数据集介绍

构建方式
ScreenQA数据集致力于解决屏幕截图中的视觉问答任务,围绕移动端用户界面的截图构建而成。数据集的构建汇聚了海量的图像与文本标注,每个样本包含一张截图、对应的唯一标识符以及用户与系统之间的交互消息。这些消息以字符串形式记录,涵盖了基于截图内容提出的问题及其标准答案。数据划分为训练集、验证集和测试集,分别包含68980、8618和8427个样本,确保了模型训练、调优与评估的完整流程。
特点
该数据集的核心特点在于其专注于真实移动界面的截图,而非传统自然图像,填补了UI视觉理解领域的数据空白。每个样本都通过多轮消息形式呈现问答对,模拟了真实用户与智能助手的交互场景。数据集规模庞大,总下载量超过11GB,涵盖近86000个样本,为深度学习模型的训练提供了坚实基础。其划分清晰的验证与测试集,便于研究者精确评估模型在未知截图上的泛化表现。
使用方法
使用ScreenQA数据集时,研究者可将其直接加载至各类视觉语言模型中进行训练与评估。数据以标准化的JSON格式存储,各字段清晰——'id'用于唯一标识,'media'内嵌图像数据,'messages'则包含序列化的对话历史。用户可借助HuggingFace的datasets库便捷地按split下载,自行解析messages字段以提取问题与答案,从而构造适合自身架构的输入输出对。该数据集尤其适合用于开发能够理解并回答关于UI布局、元素功能及屏幕内容等问题的智能系统。
背景与挑战
背景概述
ScreenQA数据集由微软研究院于2022年创建,旨在推动移动用户界面(UI)的视觉问答研究。随着智能手机的普及,理解屏幕截图中的视觉元素和文本内容成为人机交互的关键挑战。该数据集包含约86,000个样本,覆盖了多样化的移动应用界面,每个样本以屏幕截图和自然语言问题-答案对的形式呈现。其核心研究问题是如何让模型不仅识别UI元素,还能理解布局和语义,从而回答复杂问题。ScreenQA为多模态学习提供了标准化基准,显著提升了UI自动化、无障碍应用及智能助手等领域的研究进展。
当前挑战
ScreenQA所解决的领域问题在于,传统UI理解方法依赖于结构化元数据,而实际中屏幕截图缺乏此类信息,使模型需从视觉和文本中推理。构建过程中,研究人员面临两大挑战:一是如何从海量UI截图中生成高质量问题-答案对,需人工标注确保语义准确性;二是如何覆盖UI的多样性,包括不同应用类别、布局和文本密度,以避免偏差。此外,模型还需应对屏幕截图中的噪声,如重叠元素和光照变化,这要求数据集设计时兼顾真实场景的复杂性,从而推动鲁棒多模态模型的开发。
常用场景
经典使用场景
ScreenQA数据集聚焦于屏幕截图中的视觉问答任务,其经典使用场景在于评估模型对用户界面(UI)屏幕的理解与推理能力。研究人员通过向模型提供一张屏幕截图及相关问题,要求模型回答关于界面元素、布局结构或功能含义的细致问题,例如“设置按钮位于屏幕的哪个角落?”或“当前通知栏显示了几条消息?”。这一场景不仅考验模型对视觉信息的提取能力,更强调对界面交互逻辑的深层次把握。
解决学术问题
该数据集解决了屏幕上视觉信息与自然语言问题之间桥梁搭建的学术难题。传统视觉问答多聚焦于自然场景,忽略了用户界面中符号化、结构化元素的复杂性。ScreenQA通过大规模细粒度标注,推动了多模态模型在界面理解领域的研究,使模型能够从像素级信息中解析出语义化的界面组件。其意义在于为评估多模态大模型在真实用户环境中的屏幕推理性能提供了标准化基准,极大促进了人机交互、可访问性分析等交叉学科的发展。
衍生相关工作
围绕ScreenQA数据集,衍生了多项具有影响力的研究工作。例如,有学者基于该数据集提出了ScreenCap2XML模型,将屏幕截图转化为结构化的XML描述,进而提升对UI布局的理解精度。另一经典工作则将其与语义解析技术结合,开发出能动态生成界面操作路径的Agent系统,在移动端任务自动化领域取得了突破。这些衍生工作不仅拓展了数据集的应用边界,也推动了多模态推理从静态问答向动态交互任务的演进。
以上内容由遇见数据集搜集并总结生成



