xiaomi-research/ProactiveMobile
收藏官方服务:
资源简介:
这是一个针对移动智能体中主动智能的综合、可执行基准测试——智能体能够预测用户需求并自主行动,而不是被动执行明确指令。
This is a comprehensive and executable benchmark focused on proactive intelligence in mobile AI agents, enabling the agents to predict user needs and act autonomously rather than passively executing explicit instructions.
提供机构:
xiaomi-research搜集汇总
数据集介绍

构建方式
ProactiveMobile是由小米研究团队精心构建的移动端主动智能基准评测数据集。该数据集基于对移动设备上用户主动服务需求的前沿探索,从用户画像、设备状态、外部环境与行为轨迹四个维度精心设计了上下文信息,以模拟真实场景中智能体需主动推断用户潜在意图的情境。每个样本包含1至3条标注者精心编写的目标动作序列,这些动作均来自一个统一的功能池(共61个可执行API),覆盖娱乐、出行、消费等15个功能类别,确保任务空间的全面性与实践性。
特点
ProactiveMobile数据集的核心特色在于其强调的“主动性”评估维度,即要求模型不仅理解显式指令,更需从多源上下文信息中自主推断用户意图并执行相应操作。数据集包含3658个中文样本,按难度划分为三级(1-3级),并采用多答案标注机制,允许一个情境对应多个合理推荐动作,更贴近真实世界的模糊性与多样性。此外,行为轨迹中融合了文本描述与外部公开数据集(如AITZ、GUI-Odyssey)的截图引用,为评估跨模态理解能力提供了扩展支持。
使用方法
该数据集作为评测基准(测试集)使用,可直接通过JSON加载调用:用户下载benchmark_zh.json文件后,使用json.load()读取即可获得完整样本数组,每个样本包含id、难度、四维上下文信息及推荐动作详情。同时,也可借助HuggingFace的datasets库以load_dataset函数快速加载。在评估时,模型需基于上下文输出可执行的函数序列,并与标准答案进行比对,以评测其主动推理与动作生成能力。需注意,截图需从原始公开数据集获取并保持相对路径一致。
背景与挑战
背景概述
ProactiveMobile数据集由小米研究团队于2026年创建,旨在推动移动设备上智能体的主动智能发展。传统的移动智能体研究大多聚焦于被动执行用户显式指令,忽视了从设备上下文推断用户潜在意图的能力。该数据集通过整合用户画像、设备状态、世界信息及行为轨迹等多维度上下文信息,构建了3,658个中文实例,每个实例均要求模型从统一的功能池中生成可执行的函数序列。ProactiveMobile首次系统性地定义了主动智能的评估基准,为移动智能体的前瞻性行为研究提供了标准化测试平台,其多答案标注(1-3个目标动作)机制更是提升了评估的全面性与鲁棒性。该基准的发布显著推动了人机交互领域中智能体从反应式向主动式的范式转变。
当前挑战
ProactiveMobile数据集所解决的核心领域挑战在于,现有移动智能体研究普遍缺乏从隐式上下文推断用户意图的能力,无法在无明确指令下主动执行有益操作。构建过程中面临多重挑战:首先,真实用户意图的多样性使得单答案标注无法覆盖合理行为,因此设计了多答案标注机制以容纳1-3个潜在正确操作;其次,需从海量设备日志中提取高信息密度的四维上下文(用户画像、设备状态、世界信息、行为轨迹),并确保其与真实用户场景的映射准确性;此外,61个可执行API的统一功能池需经过语义去重与精简,以平衡模型复杂度与功能覆盖率;最后,可视化轨迹依赖外部公开数据集(AITZ、GUI-Odyssey等),需解决跨数据源路径兼容性及截图一致性问题。
常用场景
经典使用场景
在移动智能体研究领域,ProactiveMobile被广泛用于评估和训练模型从多维设备上下文信息中推断用户潜在意图的能力。该数据集包含3658个精心设计的中文实例,每个实例融合了用户画像、设备状态、世界信息与行为轨迹四类上下文,并配备1至3个多答案标注作为真值。研究者通过让模型基于这些上下文生成可执行的函数调用序列,来系统性地考察其主动服务能力,难度层次从简单到困难递进,为移动端主动智能的量化评估提供了标准化的测试平台。
解决学术问题
ProactiveMobile的核心学术贡献在于解决了移动智能体领域长期缺乏可量化、可复现的主动智能基准测试问题。传统研究多聚焦于被动执行用户指令的代理行为,而该数据集首次将评估维度拓展至设备上下文理解、用户意图推理与自主决策执行三者交织的复杂场景。通过提供61个统一的执行API与多答案标注机制,它使得研究者能够严格区分模型的偶然正确与真正理解,推动了从被动响应到主动服务的范式转变,对探索移动端情境感知计算与智能体自主性具有里程碑式的理论价值。
衍生相关工作
受ProactiveMobile的启发,学术界涌现了一系列与之相关的经典工作。一方面,研究者利用该数据集提出的多维度上下文建模框架,衍生出诸如情境感知注意力机制与意图驱动函数规划网络等方法,专门用于提升复杂轨迹中的推理鲁棒性。另一方面,其公开的多答案标注范式被后续工作借鉴,发展出不确定性感知的训练策略以处理主动决策中的歧义场景。此外,基于61个API的统一函数池设计,还催生了跨平台移动智能体迁移学习的研究方向,推动了移动端主动智能从单一基准向通用评估体系的演进。
以上内容由遇见数据集搜集并总结生成



