FedGUI-Platform; FedGUI-Device; FedGUI-OS; FedGUI-Web; FedGUI-Mobile; FedGUI-Full
收藏资源简介:
FedGUI是由同义实验室等机构构建的首个跨平台联邦学习GUI智能体基准数据集,涵盖移动端、网页端和桌面端三大平台,包含6个子集共15,500个交互事件。数据源自AndroidControl、Mind2Web等9个真实场景数据集,通过统一动作空间映射和系统性数据清洗,模拟了跨平台、跨设备、跨操作系统及跨数据源四类异构性。该数据集旨在解决分布式环境下GUI智能体的隐私保护协作训练问题,为构建可扩展的跨模态界面交互系统提供关键支持。
FedGUI is the first cross-platform federated learning GUI intelligent agent benchmark dataset constructed by Synonym Lab and other institutions. It covers three major platforms including mobile, web and desktop, and contains 6 subsets with a total of 15,500 interaction events. The data is derived from 9 real-world scenario datasets such as AndroidControl and Mind2Web. Through unified action space mapping and systematic data cleaning, it simulates four types of heterogeneity: cross-platform, cross-device, cross-operating system and cross-data source. This dataset aims to address the privacy-preserving collaborative training problem of GUI intelligent agents in distributed environments, and provides critical support for building scalable cross-modal interface interaction systems.
FedGUI 数据集概述
数据集基本信息
- 数据集名称:FedGUI
- 核心定位:首个为开发和评估跨异构平台的联邦图形用户界面(GUI)智能体而设计的综合性基准。
- 主要特点:专注于利用联邦学习(FL)在去中心化的异构数据上训练通用智能体,以应对传统集中式训练在隐私和可扩展性方面的挑战。
- 学术认可:已被第64届计算语言学协会年会(ACL 2026)的Findings接收。
数据集内容与构成
- 数据来源:数据集整合了来自6个主要来源的9个精选数据集。
- 移动端:AndroidControl (AC), AitW, GUI Odyssey (GO)
- 网页端:Mind2Web (M2W), GUIAct-Web (GA-W), OmniAct-Web
- 桌面端:AgentSynth (AS), OmniAct-Mac/Windows
- 平台覆盖:支持超过900个移动应用、40多个桌面应用程序以及200多个网站。
- 异构性建模:系统性地建模了四种现实世界的异构类型:跨平台、跨设备、跨操作系统(OS)和跨数据源。
- 统一行动空间:将所有平台的交互标准化为17种离散的行动类型,包括基本行动(如CLICK, TYPE)和平台特定的自定义行动。
数据集文件与结构
开源数据集存放于项目根目录的 datasets/ 文件夹下,主要包含:
- FedGUI-Full/
Full_IID.jsonFull_Non-Uniform.json
- FedGUI-OS/
OS_IID.json
prompt.py(用于向数据集样本注入提示以进行一致的训练和评估)
数据集中每个步骤的样本格式示例如下: json { "images": "/path/to/screenshot.png", "query": "Task instruction with history...", "response": "Actions: CLICK <point>[[100, 200]]</point>", "client_id": 0 }
数据处理流程
数据处理脚本位于 data_process/ 目录。
- 单数据集处理:
data_process/single_dataset_level/目录下的脚本(如0_dump_AC.py,1_gen_jsonl.py)用于对各个来源的数据集进行单独处理,包括数据提取、规范化和转换为FedGUI所需的统一格式。 - 多数据集聚合与提示生成:使用
gen_message_VLM.py脚本聚合多个已处理的数据集,并将情节级数据转换为带有视觉语言模型(VLM)兼容提示的步骤级格式。
训练与评估支持
- 联邦学习算法:集成了7种代表性联邦学习算法,例如FedAvg、FedYogi、FedAdam。
- 基础模型支持:支持20多种基础视觉语言模型(VLM),如Qwen3-VL、InternVL2、Gemma-3。
- 高效训练技术:采用LoRA(低秩适应)技术,仅交换轻量级的适配器参数,以降低通信和计算开销。
- 评估指标:使用三种行动级指标评估GUI智能体性能:
- 行动类型准确率(Type):基于生成行动的第一个令牌,判断预测的交互意图是否与真实行动类型匹配。
- 定位准确率(Ground):评估基于坐标的行动(如
CLICK)的空间正确性。当预测坐标与真实坐标之间的欧几里得距离小于屏幕对角线长度的**14%**时,视为正确。 - 成功率(SR):反映端到端执行准确性,要求行动类型和参数均正确。对于基于文本的行动,使用相似度分数(令牌级F1 + 字符级重叠)衡量语义正确性,成功阈值为0.5。

- 1FedGUI: Benchmarking Federated GUI Agents across Heterogeneous Platforms, Devices, and Operating Systems浙江大学; 上海交通大学; 同义实验室; 多智能体治理与智能团队(MAGIC); 武汉大学 · 2026年



