遇见数据集

iOSWorld

收藏
arXiv2026-06-09 更新2026-06-10 收录
数据链接:
官方服务:

资源简介:

iOSWorld是由卡内基梅隆大学团队构建的首个围绕个人身份的动态原生iOS模拟器基准测试数据集。该数据集包含26个专门构建的iOS应用程序,涵盖金融、通讯、旅行等10个生活领域,所有应用共享同一用户身份(Jordan Avery)并包含跨应用的互联数据,如交易记录、消息历史和出行偏好。数据集通过SwiftUI开发并采用人工验证的种子数据,共包含133个任务,分为单应用、多应用以及记忆与个性化三类,任务复杂度逐级递增。该数据集旨在评估手机智能代理在真实个人数据环境中的跨应用推理与个性化服务能力,为解决移动端人工智能代理缺乏个人情境理解的关键问题提供标准化测试平台。

iOSWorld is the first dynamic native iOS simulator benchmark dataset centered on individual identity, constructed by a research team from Carnegie Mellon University. This dataset includes 26 specially developed iOS applications spanning 10 daily life domains such as finance, communication, travel, and more. All applications share the same user identity (Jordan Avery) and contain cross-app interconnected data, including transaction records, message histories, and travel preferences. Developed using SwiftUI and adopting manually validated seed data, the dataset comprises 133 tasks divided into three categories: single-app, multi-app, and memory and personalization, with task complexity increasing progressively. This dataset aims to evaluate the cross-app reasoning and personalized service capabilities of mobile AI Agents in real personal data environments, providing a standardized testing platform to address the critical issue that mobile AI Agents lack personal context understanding.

提供机构:
卡内基梅隆大学
创建时间:
2026-06-09
原始信息汇总

iOSWorld 数据集概述

基本信息

  • 名称: iOSWorld
  • 类型: 首个基于原生 iOS 模拟器的交互式基准测试,用于评估个人智能手机代理(Personally Intelligent Phone Agents)
  • 发布机构: 卡内基梅隆大学(Carnegie Mellon University)
  • 许可协议: Apache 2.0

核心特点

  • 持久化用户身份: 所有应用共享一个名为 Jordan Avery 的用户身份(旧金山专业人士),包含联系人、交易记录、消息、邮件等相互关联的种子数据。
  • 26 个全新构建的 iOS 应用(使用 SwiftUI 开发): 覆盖金融、消息、旅行、餐饮、购物、生产力、娱乐、健身、体育、实用工具、专业社交等 10 个领域。
  • 跨应用数据互联: 如 QuickBite 的订单会产生 MyBank 的扣款和 Mail 的收据,SkyTrip 的航班与 StayFinder 的酒店预订、Notes 的日历提醒对应。

任务详情

任务类别 数量 描述
单应用任务(Single-app) 27 单个应用内的基本导航与操作
多应用任务(Multi-app) 60 需在 2-8 个应用间传递信息(平均 4.4 个应用/任务)
记忆任务(Memory) 46 需推断用户从未明确陈述的行为模式

总计: 133 个任务,每个任务附带可独立验证的评分标准(rubric)。

评估设置

  • 6 个模型:

    • Claude Opus 4.6
    • Claude Sonnet 4.6
    • GPT-5.4
    • GPT-5.4 Mini
    • Gemini 3 Flash
    • Qwen3.5 35B-A3B(开源 MoE 模型)
  • 2 种观察模态:

    • 纯视觉(Vision-only): 仅接收截图,6 种动作
    • 视觉+XML(Vision+XML): 额外提供 XCUITest 无障碍树及 4 种特权动作
  • 评分方式: GPT-5.4 Mini 作为 LLM 评判员,人类验证显示 κ = 0.77 一致性(89% 准确率,F1 = 0.86)

  • 最大交互步数: 50 步/任务

主要结果

排名 配置 单应用 多应用 记忆 总体
#1 Opus 4.6 视觉+XML 81.5% 36.7% 54.3% 51.9%
#2 Sonnet 4.6 视觉+XML 92.6% 35.0% 34.8% 46.6%
#3 GPT-5.4 视觉+XML 81.5% 26.7% 32.6% 39.8%
  • 纯视觉模式下,前沿模型总体通过率仅 20%-29%
  • 多应用任务是最难的类别(最佳 36.7%)
  • MCP 工具使用消融实验(基于 Qwen 3.5 35B): 结构化工具使通过率从 12.8% 提升至 24.8%,平均评分从 0.33 提升至 0.683

发布内容

  • 26 个应用的源码和种子数据
  • 133 个任务及评分标准
  • 评估代码
  • MCP 服务器(提供如 mybank.send_zellefreshcart.checkout 等语义化工具接口)
  • AWS 运行器(允许非 Mac 研究者运行基准测试)
  • 示例轨迹(16 条精选运行记录)

失败分析

视觉+XML 模式下,422 个前沿模型失败案例的分类:

  • 预算耗尽(50 步限制): 51%
  • 主动放弃: 26%
  • 过早停止: 23%

Qwen3.5 35B-A3B 在 XML 模式下约 50% 失败为动作循环卡死。

搜集汇总
数据集介绍
iOSWorld 数据集图片
构建方式
iOSWorld是首个围绕持久化用户身份构建的交互式原生iOS模拟器基准,涵盖26个全新开发的iOS应用程序。这些应用通过SwiftUI构建,并植入了统一的用户身份——Jordan Avery,其联系人、交易记录、旅行信息、社交关系和财务活动在邮件、支付、餐饮等不同应用间相互关联。基准包含133项任务,分为单应用任务(27项)、多应用任务(60项)以及记忆与个性化任务(46项),任务难度逐步递增。
特点
iOSWorld的核心特点在于其跨应用的持久化用户身份设计,使得所有应用共享同一用户的数据,如联系人、交易记录和偏好设置。这为评估代理人推理用户身份、历史和偏好的能力提供了独特场景。任务设计涵盖从基础导航到多应用信息关联,再到从个性化数据中挖掘隐含模式的复杂需求。此外,基准提供了视觉与视觉+XML两种评估模式,其中XML模式通过XCUITest提供结构化UI层次,显著提升了强模型的表现。
使用方法
研究者可通过开源的iOSWorld基准框架,使用Appium与XCUITest驱动控制iPhone模拟器,在macOS上运行代理人循环。每个任务从确定性初始状态的26个预装应用开始,代理人截取屏幕或获取XML树后执行动作,直至完成任务或达到步数限制(通常为50步)。评估采用基于GPT-5.4-Mini的LLM裁判体系,通过分析完整轨迹(包括截图、动作和最终答案)输出二级通过/失败判断,并已通过人工验证(κ=0.77)。所有代码、种子数据、任务和评估脚本均公开提供,并支持AWS非Mac环境运行。
背景与挑战
背景概述
iOSWorld是由卡内基梅隆大学的研究团队于2026年提出的首个基于原生iOS模拟器的智能体基准测试,旨在填补移动设备代理基准测试中缺乏用户个性化和跨应用数据连续性的空白。研究团队构建了26个预装且数据互联的iOS应用,围绕一个虚构用户Jordan Avery的完整数字生活进行数据注入,涵盖交易记录、消息往来、出行信息、社交关系与金融活动等。该数据集的核心研究问题在于评估手机代理是否具备“个性化智能”能力——即能否基于设备上真实的用户身份、历史记录与偏好进行推理与决策,而非仅执行孤立的沙盒化指令。iOSWorld的出现为移动智能体的个性化评估提供了开创性框架,对推动人格化智能体研究与部署具有深远影响。
当前挑战
iOSWorld面临的挑战既包括所解决的领域问题,也涵盖数据构建过程中的技术难点。在领域层面,现有移动代理基准测试(如AndroidWorld、MobileWorld)均缺乏用户身份持久性与跨应用数据关联,无法评估智能体在真实设备上的个性化推理能力,而iOSWorld通过设定三个难度逐级递增的任务类别(单一应用、多应用整合、记忆与个性化),考验智能体在视觉理解、多步推理与隐式模式发现上的综合表现。在构建过程中,研究团队需要为26个应用设计并注入相互关联且现实可信的种子数据,确保如订餐记录与银行转账、航班行程与酒店预订之间的数据一致性;同时,由于iOS系统闭源,获取结构化UI数据需依赖XCUITest框架,带来了额外的技术壁垒和计算开销。此外,任务的可执行性验证要求人工逐条测试175个初始候选任务,最终筛选出133个可行任务,流程繁琐且依赖大量人工介入。
常用场景
经典使用场景
在移动智能体研究领域,iOSWorld数据集最经典的用途是评估和训练具备个性化智能的手机助手。该基准测试通过构建横跨26个原生iOS应用的单一用户身份,为智能体提供了涉及金融交易、社交关系、旅行记录等互联数据的复杂环境。研究者可利用该数据集测试智能体在单应用、多应用以及记忆与个性化三类任务上的表现,其中记忆任务要求智能体从未直接陈述的应用数据中推断隐含的用户模式,如发现最常用的通勤路线或最常订购的餐厅。
衍生相关工作
iOSWorld的发布推动了移动智能体研究向更全面的方向演进。该基准中包含的1123条评分标准和详细轨迹数据,为后续工作提供了可复现的评估框架。相关工作已开始探索利用结构化MCP工具提升小尺寸模型性能(从12.8%提升至24.8%),并系统分析不同观测模态(纯视觉与视觉+无障碍树)对智能体能力的差异化影响。此外,该数据集还启发了对智能体失败模式的分类研究,区分了预算耗尽、提前放弃和过早停止三种典型故障类型,为设计更鲁棒的循环恢复机制和规划算法指明了方向。
数据集最近研究
最新研究方向
在当前移动智能体研究领域,多数基准测试集中于Android或Web环境且缺乏用户个性化数据,iOSWorld的提出填补了这一空白。该数据集围绕一个持续的用户身份构建了26个原生iOS应用,涵盖交易、消息、旅行记录等互联数据,设计了133个逐步递增的跨应用与个性化记忆任务。最新研究方向聚焦于评估前沿视觉语言模型在真实iOS模拟器上的表现,研究表明仅有视觉信息时最高准确率仅为26%,而引入结构化的无障碍树访问后,性能跃升至52%,尤其对多应用协调和基于用户历史记忆的推理任务提升显著。这一成果凸显了精准元素定位与历史感知规划在个人化手机代理中的关键作用,推动了对更具智能、能理解用户真实数字生活的手机代理系统的深入探索。
相关研究论文
  • 1
    iOSWorld: A Benchmark for Personally Intelligent Phone Agents卡内基梅隆大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务