遇见数据集

AndroidFlux_results

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

AndroidFlux是一个用于评估多模态模型在Android GUI任务上性能的数据集,包含多个实验子集。本数据集主要记录模型在模拟Android环境中的操作执行结果,每个实验子集包含多个模型(如Qwen3VL系列、GUI-Owl系列、MA3系列、Gemma系列、Gemini系列等)的评估数据。每个模型(cell)有固定数量的episodes(如312个),每个episode对应一次完整的任务执行。数据以目录结构组织,每个cell目录下包含validation.json(验证结果)、start_state_audit.json(初始状态审计)、model_server_health_*.json(模型服务器健康状态)、aggregate.json(聚合统计)、shards/shard_NN/results.json(每个episode的详细结果)等JSON文件。数据集还提供了每个模型的成功率(success rate)和validity状态(含预定义的validator issues)。该数据集可用于研究模型在图形用户界面交互中的规划、记忆和操作能力,以及不同模型架构和配置(如thinking开关、提示策略)对任务完成率的影响。

AndroidFlux is a dataset for evaluating the performance of multimodal models on Android GUI tasks, containing multiple experimental subsets. This dataset primarily records the operation execution results of models in a simulated Android environment. Each experimental subset includes evaluation data for multiple models (such as Qwen3VL series, GUI-Owl series, MA3 series, Gemma series, Gemini series, etc.). Each model (cell) has a fixed number of episodes (e.g., 312), and each episode corresponds to a complete task execution. The data is organized in a directory structure, and each cell directory contains JSON files such as validation.json (validation results), start_state_audit.json (initial state audit), model_server_health_*.json (model server health status), aggregate.json (aggregate statistics), and shards/shard_NN/results.json (detailed results of each episode). The dataset also provides the success rate and validity status (including predefined validator issues) for each model. This dataset can be used to study the planning, memory, and manipulation capabilities of models in graphical user interface interaction, as well as the impact of different model architectures and configurations (such as thinking switch, prompt strategy) on task completion rate.

创建时间:
2026-08-29
原始信息汇总

数据集概述

本数据集名为 AndroidFlux,是一个用于评估多模态大语言模型在 Android 环境中执行 GUI 任务能力(如 UI 操作、应用导航等)的基准测试结果集。数据涵盖 LLM 验证(llm-verified)和人工验证(human-verified)两种评估模式,并按不同任务变体(error_t 错误类型任务、t-3/t-5 时间偏移变体)组织。

一、数据构成与版本

数据集包含多个版本/部分,每一部分按 cell(模型配置单元)存储结果,每个 cell 目录包含验证文件(validation.json)、状态审计文件、健康检查文件、聚合文件及分片结果文件。各版本的核心内容如下:

1. llm-verified v2 n3 · error_t(312 episodes/cell)

21 个模型/配置单元,每个单元在 312 个 Android 轨迹片断(episode)上完成评估。记录每个模型的成功率、有效性标记、验证问题数及异常数。

2. human-verified 80 · error_t(core 65 + ext 15)

人工验证的 80 条轨迹,分为核心 65 条回放(core_65)和附加 15 条 VM 快照(snapshot_ext_15),目前仅包含一个模型(guiowl15_32b_think)的完整 80/80 结果。

3. v2-65 · t-3 / t-5(pre_error_t_minus_3 / _5, human-verified core 65)

在人工验证的 65 条核心轨迹上做时间偏移变体测试(t-3 与 t-5,即从轨迹开始前若干时间点执行),评估模型在部分可行条件下的表现。包含 3 个模型的完整 65/65 结果。

二、LLM 验证结果(312 trajectories/model)

21 个模型/配置均完成全部 312 条评估,成功率从 13.5%67.0% 不等。由于评估机制设定,所有模型的 valid=false,均带有固定数量的验证问题(每条轨迹存在 5 个来源条目 × 4 类守卫检查,故每单元约 20–30 个 issue)。

模型 成功率 表现亮点
mobilerun_gemini_flash 67.0%(209/312) 最高成功率
ma3_32b 46.1%(144/312) 开源模型最佳之一
gemini_3_0_flash_preview_qwen_prompt_think_off 46.8%(146/312) 关闭思考后优于开启思考
gemma_31b_improved_think_on 47.4%(148/312) 开启思考提升效果
ma3_7b 45.2%(141/312)
guiowl15_8b 44.2%(138/312)
guiowl15_32b_think 44.5%(139/312)
gemma_31b_improved 44.5%(139/312)
gemini_computer_use 40.1%(125/312)
gemini_3_0_flash_preview_qwen_prompt 39.7%(124/312) 未显式关闭思考
guiowl15_32b 36.2%(113/312)
qwen3vl_32b 34.0%(106/312)
qwen3vl_4b 32.4%(101/312)
mai_ui_8b 31.7%(99/312)
qwen3vl_8b 29.5%(92/312)
gui_owl_32b 28.2%(88/312)
gui_owl_7b 27.2%(85/312)
final_run_appinfo 26.6%(83/312)
qwen3vl_2b 24.7%(77/312) 小模型短板明显
qwen3vl_32b_think 21.1%(66/312) 开启思考反而降低成功率
ui_tars_7b_sft 13.5%(42/312) 最低成功率

关键模型命名约定

  • gemini_3_0_flash_preview_qwen_prompt:使用 Gemini 3.0 Flash(API 默认思考);_think_off 版本显式设 GEMINI_THINKING_BUDGET=0
  • gemini_computer_use:Gemini 3.5 Flash 的 Computer Use 智能体。
  • mobilerun_gemini_flash:基于 Gemini Flash 的 MobileRun 框架。
  • gemma_31b_improved_think_on:开启 GEMMA_ENABLE_THINKING=1。
  • guiowl15_32b_think / guiowl15_32b:分别对 GUI-Owl-1.5-32B-Think 和 GUI-Owl-1.5-32B-Instruct。

三、人工验证结果

1. 80 条核心+扩展轨迹(guiowl15_32b_think)

  • 核心 65 条:65/65 全部执行完成,成功率 35.4%(23/65)。
  • 扩展 15 条:15/15 全部完成,成功率 46.7%(7/15)。
  • 合计 80/80,整体成功率 37.5%。

2. t-3 / t-5 时间偏移变体(人工验证 65 条核心轨迹)

在完整 65 条上计算 all-65 成功率(偏移不可行时从干净起点执行),并额外报告在「时间偏移实际可行」条目上的成功率(t-3 可行 39 条,t-5 可行 21 条)。

模型 t-3(all-65 / feasible 39 条) t-5(all-65 / feasible 21 条)
gui_owl_32b 43.1%(28) / 46.2% 40.0%(26) / 28.6%
ma3_32b 49.2%(32) / 51.3% 44.6%(29) / 23.8%
mai_ui_8b 36.9%(24) / 41.0% 40.0%(26) / 14.3%

四、运行状态与事件记录

README 中记录了一次严重运行故障(已于 2026-08-30 解决):由于结果目录误写入宿主机较小的根磁盘(49GB),磁盘占满导致约 2 小时的全链路停滞。已通过移动到 5TB 数据盘并建立符号链接的方式无损修复,另修复了队列脚本中的路径错误。所有 t-3/t-5 模型已重新启动容器运行。

五、数据集主要用途

该数据集适合用于对比不同规模、不同架构的通用或专用 GUI 智能体(如 Qwen3-VL、Gemma、GUI-Owl、Ma3、Mai-UI、UI-TARS、Gemini 系列)在 Android 真实应用操作任务上的成功率差异,并支持研究「时间偏移」对任务可执行性的影响,以及思考机制(thinking on/off)对 GUI 决策的效用。

搜集汇总
数据集介绍
AndroidFlux_results 数据集图片
构建方式
AndroidFlux_results数据集是AndroidFlux基准测试的llm验证结果集合,旨在系统评估多模态语言模型在安卓环境中的自动化操作能力。其构建采用了多维度的实验设计,涵盖了21个不同的模型配置,包括qwen3vl系列、gui_owl系列、gemini系列等,每个模型均针对312个episodes进行测试。数据以cell目录形式组织,每格包含validation.json、start_state_audit.json、model_server_health_*.json、aggregate.json等关键文件,并辅以shards子目录存储分片式逐episode结果,确保了数据的层次化与可追溯性。此外,集成human-verified的80个核心场景(65个回放与15个快照扩展),并引入t-3与t-5时间偏移条件的严格评估,以检验模型在非理想起始状态下的鲁棒性。
使用方法
此数据集适用于离线分析与模型评测研究,研究者可依据每cell下的validation.json与aggregate.json复现各模型在312个episodes上的表现,并利用shards中的results.json进行粒度至单episode的深度剖析。标准化字段设计允许直接进行跨模型比较,例如对比qwen3vl系列不同参数量或思考机制开启与否对成功率与验证失败模式的影响。human_verified_80子集可作为高置信度的金标准单元,用于校准自动评估指标或验证新模型的泛化能力。对于时间敏感性研究,v2_65_t_minus_n条件的数据支持按all-65或feasible子集计算成功率,以探索任务起始偏移对模型技能发挥的限制。结合各模型自带的model_server_health_*文件,还能辅助分析运行时健康状态与性能间的潜在关联,为系统稳健性改进提供数据支撑。
背景与挑战
背景概述
AndroidFlux_results 数据集由韩国科学技术院(KAIST)等机构于2026年发布,旨在系统评估多模态大语言模型(LLM)在Android图形用户界面(GUI)自动化任务中的表现。该数据集创建于2026年8月,涵盖了数十种前沿模型,包括Qwen3-VL系列、GUI-Owl、Gemma、Gemini等,通过在Android模拟器环境中执行312个操作轨迹(episode),评测模型在UI理解、动作生成和任务完成等方面的能力。其核心研究问题在于量化不同模型在真实移动界面操作中的成功率与鲁棒性,揭示了当前模型在类似人类操作的任务中仍面临重大挑战。该数据集为GUI自动化领域提供了标准化的基准,其发布促进了模型性能的可比性分析,并为后续研究指明了优化方向,对移动端智能代理的发展具有重要影响。
当前挑战
该数据集所解决的领域核心挑战在于GUI自动化任务的复杂性和模型泛化能力不足。具体而言,模型需从屏幕截图和文本中理解多层级的UI结构,准确执行点击、滚动、输入等操作,并适应多样化的应用界面,这对于现有模型而言仍极具挑战。数据集的评测结果显示,多数模型成功率低于50%,凸显了UI语义理解与动作规划之间的鸿沟。构建过程中亦面临显著困难:大规模模拟环境需要高效资源调度,实验中曾遭遇磁盘写满导致的系统瘫痪、Docker守护进程宕机等故障,迫使开发团队优化存储配置并重排队列。此外,清洗和去重轨迹、划分训练验证集、确保人类标注一致性等步骤,均需严密的质控流程,方能保障数据集的高质量与可靠性。
常用场景
经典使用场景
AndroidFlux数据集,作为Android图形用户界面自动化智能体评估的综合性基准,其核心应用场景聚焦于多模态大语言模型在移动设备界面理解与操作任务中的表现度量。该数据集精心构建了312个独立测试单元,每个单元涵盖状态审计、模型服务健康检查及细粒度执行结果,旨在系统性地对模型进行端到端的功能性验证。通过统一的错误追踪协议及双轨验证机制(包括人工核验的80个核心案例),研究者能够以严谨的可复现方式,评测不同架构的智能体(如GUI-Owl、Qwen3VL系列等)在真实Android环境中的界面导航、指令遵循及任务完成能力,从而推动自动化UI交互技术的科学进展。
解决学术问题
该数据集直面移动UI自动化领域中,智能体性能评估缺乏标准化与细粒度度量体系的学科痛点。传统评估往往受限于单一成功率的粗粒度指标,难以揭示模型在复杂交互链条中的具体薄弱环节。AndroidFlux通过引入多维验证文件(validation.json, start_state_audit.json等)及重放守卫机制,解决了实验过程可审计性与可重复性不足的问题。其提供的成功比率、有效性问题及异常追踪数据,使研究人员能够深入剖析不同提示策略、推理开关及模型规模对任务绩效的影响,为探索智能体决策的可解释性、鲁棒性及泛化能力,以及推动多模态理解与执行一致性理论的发展,奠定了坚实的数据基础。
实际应用
在实际应用层面,AndroidFlux的评估体系可直接服务于移动应用质量保障、自动化测试工程及智能助手研发等产业领域。开发团队可利用其丰富的测试场景矩阵,客观遴选适用于自动化回归测试或用户界面功能验证的最优模型配置。同时,该数据集所记录的模型服务器健康与异常响应信息,为构建稳定、高效的云边端协同推理系统提供了宝贵的压力测试与故障注入样本。对于致力于提升人机交互效率的智能体产品,诸如基于GUI语义的自动化操作助手或无障碍服务工具,本数据集能够作为可靠的离线benchmark,在部署前对候选模型的指令理解、操作规划及错误恢复能力进行全面的预评估,显著降低实际应用的试错成本。
数据集最近研究
最新研究方向
AndroidFlux数据集的最新研究方向聚焦于多模态GUI智能体在移动界面交互中的泛化能力与鲁棒性评估,涵盖从轻量级模型(如Qwen3VL-2B)到前沿商用系统(如Gemini Computer Use)的跨架构对比。研究重点包括:时间偏移容忍度分析(t-3/t-5条件)以检验智能体对界面状态变化的适应力,以及思维链增强(如Gemma的thinking机制)对任务成功率的影响。同时,大规模自动化验证与人工复核的结合体现了对评估可靠性的追求,而基础设施故障(如存储溢出)的暴露则凸显了实验工程化挑战。该工作为构建更可信的移动UI智能体基准提供了系统性方法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务