遇见数据集

AndroidFlux_RL_Train

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

AndroidFlux RL — policy prompts 是一个用于强化学习策略提示的数据集,包含五个配置切片,总计 20,000 个提示。前四个切片(t_minus_n、successful、t_minus_1、t)源自 AndroidFlux 源轨迹,每个切片分别包含 2,459、2,623、2,459、2,459 个提示,共计 10,000 个提示。其中 successful 切片包含 53 个最终动作决策、53 个倒数第二动作决策和 2,517 个早期决策,并且所有 20 个规范未见测试任务类型均被排除。第五个切片 ui_genie 包含 10,000 个提示,源自 UI-Genie 奖励模型提示数据集(Gyubeum/UI_Genie_128k),并包含历史截图。每个切片均提供 samples.parquet、context.parquet、images 等文件,格式遵循 data_from_rm_eval 但调整为仅提示的系统/用户对话,候选/偏好字段可为空。t 切片额外包含 17,213 个未标记的恢复候选槽。该数据集适用于策略提示生成、奖励模型训练等任务。

AndroidFlux RL — policy prompts is a dataset for reinforcement learning policy prompts, consisting of five configuration slices with a total of 20,000 prompts. The first four slices (t_minus_n, successful, t_minus_1, t) are derived from AndroidFlux source trajectories, containing 2,459, 2,623, 2,459, and 2,459 prompts respectively, totaling 10,000 prompts. The successful slice includes 53 final action decisions, 53 second-to-last action decisions, and 2,517 early decisions, and all 20 canonical unseen test task types are excluded. The fifth slice, ui_genie, contains 10,000 prompts sourced from the UI-Genie reward model prompt dataset (Gyubeum/UI_Genie_128k) and includes historical screenshots. Each slice provides files such as samples.parquet, context.parquet, and images, following the format from data_from_rm_eval but adjusted to system/user conversations with only prompts, where candidate/preference fields can be empty. The t slice additionally contains 17,213 unlabeled recovery candidate slots. This dataset is suitable for tasks such as policy prompt generation and reward model training.

创建时间:
2026-09-06
原始信息汇总

AndroidFlux RL — 策略提示数据集

该数据集是面向强化学习(RL)策略训练的策略提示(Policy Prompts)数据集,包含多个子配置(config)切片,总计10,000条提示用于AndroidFlux RL训练。

数据集切片概览

切片名称 提示数量 来源
t_minus_n 2,459 AndroidFlux 原始轨迹
successful 2,623 AndroidFlux 原始轨迹
t_minus_1 2,459 AndroidFlux 原始轨迹
t 2,459 AndroidFlux 原始轨迹
ui_genie 10,000 UI-Genie 奖励模型提示

总计:四个AndroidFlux切片合计10,000条,ui_genie切片额外包含10,000条(其中5,000条通过in_reduced标记为核心提示)。

数据切片详细信息

AndroidFlux 四个切片(t_minus_n、successful、t_minus_1、t)

  • 均来自重放的源轨迹(source trajectories),每个切片包含2,459至2,623条提示。
  • 成功切片(successful) 的决策位置分布:
    • 53个最终动作决策(占2.02%)
    • 53个倒数第二个动作决策(占2.02%)
    • 2,517个更早期的决策
    • 这些位置指策略生成的动作;最后一条历史动作比当前决策提前一步。
    • 环境成功性和规范训练成员资格均已验证。
  • 任务类型排除规则:所有20种规范的未见测试(unseen-test)任务类型均被排除。
    • 已见测试(seen-test)实例仍保留在错误派生切片中,并通过provenance.jsonl进行显式标记。
    • 两个新增的t_minus_n检查点已确认为训练集。
    • 此分割规则基于AndroidWorld任务类型,不适用于ui_genie切片(其上下文来自不同语料库)。

ui_genie 切片

  • 独立的10,000条提示发布,来源为Gyubeum/UI_Genie_128k数据集,而非AndroidFlux轨迹。
  • 基于历史长度、参考动作类型和域进行分层,再经基础策略展开(rollout)过滤,确保奖励模型能够对候选进行排序。
  • 包含奖励模型读取的历史截图(错误派生切片刻意省略了截图)。
  • 附带ui_genie/SAMPLING.md说明采样过程,以及ui_genie/CONTRIBUTING_FORMAT.md说明新恢复上下文的提交格式。

文件结构与格式

每个切片均包含以下文件:

  • samples.parquet — 样本数据
  • context.parquet — 上下文数据
  • 图像文件(单个images.parquet,或截图集较大时的分片images-NNNNN-of-NNNNN.parquet
  • samples.json — 样本的JSON格式
  • provenance — 来源追踪文件
  • validation/manifests — 验证清单
  • build_manifest.json — 各切片相对参考布局的偏差列表

Parquet模式遵循data_from_rm_eval(参见此目录下相关数据集),并适配为仅包含提示的系统和用户对话格式,候选/偏好字段可为空。t切片还包含17,213个未标记的恢复候选槽位(每个上下文7个),并保留捐赠者来源信息。

搜集汇总
数据集介绍
AndroidFlux_RL_Train 数据集图片
构建方式
AndroidFlux_RL_Train数据集的构建源于AndroidFlux源轨迹的重放与筛选,其四个核心数据切片(t_minus_n、successful、t_minus_1、t)分别对应不同决策阶段的提示样本,总计10,000条。其中,successful切片包含53个最终动作决策、53个次终动作决策及2,517个早期决策,所有切片均排除20种规范未见测试任务类型,但保留已见测试实例并标记于provenance.jsonl中。另设ui_genie切片,独立从UI_Genie_128k数据集抽取,依据历史长度、参考动作类型与领域进行分层,经基础策略回滚筛选,确保奖励模型可排序。每个切片均配备样例、上下文、图像及验证清单等完备文件,采用与data_from_rm_eval一致的Parquet架构。
特点
该数据集兼具精细分层与双语来源的特征。AndroidFlux派生切片严格区分决策位置与环境成功性,且纳入训练成员资格的验证,确保了强化学习提示的可靠性与多样性。ui_genie切片则植根于不同语料,按历史长度与动作类型分层,并通过可排序性过滤保证提示的质量。此外,数据集中每个上下文附带七个恢复候选槽,共17,213个未标记槽位,保留了供体来源信息。文件布局一致,但各切片均含构建清单以标注偏差,便于追溯。
使用方法
使用此数据集进行强化学习策略训练时,研究者可按切片需求加载对应配置。AndroidFlux切片适用于模拟真实环境轨迹中的决策提示,其中successful切片可侧重成功决策的示范学习,t_minus_n与t切片则有利于探索时序行为。ui_genie切片专为奖励模型评估或恢复上下文设计,其附带的图像与结构化格式支持用户贡献新的恢复场景。所有切片均以prompt-only对话形式提供,可联合训练或单独验证,且详细文档如SAMPLING.md与CONTRIBUTING_FORMAT.md为自定义应用提供指南。
背景与挑战
背景概述
AndroidFlux_RL_Train数据集诞生于2025年,由Gyubeum等研究人员联合构建,旨在推动Android界面自动化决策领域的发展。该数据集依托AndroidFlux源轨迹,精心设计了包含t_minus_n、successful、t_minus_1和t四个子集的强化学习提示集合,共计10,000个样本,此外还整合了源自UI-Genie语料库的ui_genie切片,进一步丰富了数据多样性。其核心研究问题聚焦于利用真实Android交互轨迹训练与评估强化学习模型在界面操作中的决策能力,特别是对最终动作与前期动作的区分,以及价值对齐的优化。该数据集可作为AndroidWorld任务类型的训练基准,其创新性的数据切分与严格的排除策略(如剔除20种未公开的测试任务类型)为领域内模型泛化性研究提供了标准化测试平台,对AI代理的鲁棒性提升具有显著推动作用。
当前挑战
该数据集所应对的挑战,源自Android界面操作决策的复杂性,与构建过程中的精细工程考量。领域层面,其核心是解决策略模型在真实环境中的时序决策难题,即如何区分关键动作(如最终操作决定成败)与常规步骤,并应对任务类型的域内泛化问题,尤其是seen-test与unseen-test实例的划分。构建中,团队需从重放的源轨迹中提取并验证动作位置,确保环境成功与规范路径的吻合;同时,对多模态数据进行繁琐的清洗与格式化,包括Parquet架构的适配、截图分片存储以及大量未标注恢复候选槽位(如t slice含17,213个)的管理,而ui_genie切片更是需基于基础策略进行层次过滤,以保障奖励模型的可排序性,这些均要求严密的溯源记录与质量验证机制。
常用场景
经典使用场景
AndroidFlux_RL_Train数据集在移动智能体强化学习领域具有举足轻重的地位,其核心用途在于为训练基于人类反馈的强化学习(RLHF)策略模型提供高质量的监督信号。该数据集精心构造了UI操作序列的提示(prompts),涵盖从早期决策(t_minus_n)到最终成功步骤的多样化轨迹片段,特别适用于训练模型在复杂Android环境中进行动作选择与决策优化。研究者通常利用该数据集进行离线策略学习,通过模拟真实用户交互来增强模型对界面状态变化的理解,从而提升智能体的任务完成能力。其丰富的元数据标注(如成功与否、动作位置、环境验证结果)使得模型能够精准区分有效与无效操作,是开发稳健的移动端自主代理的关键训练资源。
衍生相关工作
这一数据集的发布催生了多项前沿研究方向的深化与扩展。一方面,它作为统一基准,被用于评测各种强化学习算法在真实移动环境中的表现,推动了如基于Transformer的策略网络架构在UI控制中的演进。另一方面,研究者基于其提供的历史轨迹和偏好标签,开发了新型奖励模型,用以更精确地反映多步骤任务的终极目标;该数据集中包含的ui_genie子集,源自UI_Genie_128k语料库,已被用作训练奖励模型排序能力的基础,衍生出一系列旨在提升偏好对齐效率的工作。此外,数据集的构建方法论也激发了后续研究,指引其他平台(如iOS环境)类似数据资源的创建,从而推动了多平台UI自动化智能体的统一化进程,对通用型数字助手的发展具有深远影响。
数据集最近研究
最新研究方向
AndroidFlux_RL_Train数据集聚焦于移动智能体强化学习中的策略提示学习,融合了AndroidFlux轨迹回放与UI-Genie奖励模型提示的多元数据切片。该数据集通过精细划分决策时序位置(如终局、次终局及先前决策)并排除规范未见任务类型,为探究策略在复杂动态界面中的泛化能力提供了严格的实验场域。其引入的恢复候选槽位与分域分层采样策略,契合了当前关于利用反馈信号优化移动代理决策过程的研究热点,对推动具身智能体在真实环境中的鲁棒学习和可迁移策略生成具有重要的基准价值与范式意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务