遇见数据集

DailyBench300-trajectories

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

DailyBench300 是一个用于 Android 智能体基准测试的轨迹回放数据集,隶属于 DrainBench300 项目。该数据集提供了智能体在每天任务中执行操作的完整记录,包括思考过程、工具调用和屏幕截图。数据以 JSON 格式存储轨迹流,并附带回放 GIF 动画和逐帧截图。通过 index.json 清单文件可以快速查询每个任务的可获取性、模型来源、成功状态、步数以及对应的资源 URL。该数据集可用于研究智能体行为分析、轨迹可视化、任务成功率评估等场景。

DailyBench300 is a trajectory replay dataset for Android agent benchmarking, belonging to the DrainBench300 project. This dataset provides complete records of agent actions in daily tasks, including thought processes, tool calls, and screenshots. The data is stored in JSON format as trajectory streams, accompanied by replay GIF animations and frame-by-frame screenshots. Through the index.json manifest file, users can quickly query the availability, model source, success status, step count, and corresponding resource URLs for each task. This dataset can be used for research on agent behavior analysis, trajectory visualization, task success rate evaluation, and other scenarios.

创建时间:
2026-08-20
原始信息汇总

DailyBench300 轨迹回放数据集

数据集概览

该数据集为 DrainBench300 Android 代理基准测试提供公开的轨迹资产,可通过 resolve/main 链接在已发布的网站上获取。

数据内容

主要文件

  • index.json:任务可用性清单,包含模型信息、任务成功状态、执行步骤数、GIF 文件及数据文件的 URL 地址。

轨迹数据目录

  • data/trajectories/<set>/<day>/<task>.json:包含精简的操作步骤流,具体涵盖思考过程、工具调用记录以及屏幕截图信息。

回放资源

  • trajectories/<set>/<day>/<task>/trajectory.gif:屏幕回放动画。
  • trajectories/<set>/<day>/<task>/screenshots/:按步骤拆分的屏幕帧图像。

数据处理

可通过运行 uv run python scripts/tools/publish_trajectories.py 脚本对轨迹数据进行重新生成和重新发布。

搜集汇总
数据集介绍
DailyBench300-trajectories 数据集图片
构建方式
该数据集源自DrainBench300 Android智能体基准测试,通过系统的轨迹复现机制构建而成。数据集中包含了按任务划分的索引清单,记录每项任务的模型、成功状态、步数及相关的GIF和数据链接。完整的轨迹数据以JSON格式存储,涵盖智能体的思考过程、工具调用及屏幕截图。同时,为每个任务提供可直观回放的GIF动画及逐帧截屏,确保轨迹的可视化呈现。数据集的构建流程由脚本自动化支持,便于定期重新生成和发布,从而保持数据的时效性与一致性。
特点
DailyBench300-trajectories数据集的核心特色在于其丰富的多模态轨迹数据,整合了结构化JSON与视觉GIF资源,为研究智能体的决策过程提供第一手资料。每条轨迹详尽记录了从思考到工具执行的全链路信息,并同步保存屏幕状态,实现了行为与UI状态的精准对齐。此外,数据集的索引机制允许按任务和日期快速检索,配合标准化的发布脚本,为研究者提供了一致且易于复现的数据接口,助力Android智能体任务的深度剖析与比较。
使用方法
该数据集旨在支持Android智能体任务的离线分析与基准评估。研究者可借助index.json中的元数据,筛选特定模型或成功案例,进而深入考察对应的JSON轨迹与GIF回放,以解析智能体的行为模式。同时,数据集通过固定的URL结构提供了稳定的访问路径,便于集成至自动化评估工作流。对于需要扩展或更新数据的需求,项目提供了可执行的发布脚本,允许用户在本地重新生成并部署最新数据,确保研究环境的灵活性与数据版本的可追溯性。
背景与挑战
背景概述
DailyBench300-trajectories数据集是DrainBench300 Android智能体基准测试的公开轨迹资源,由Yuvraj Singh等人创建,旨在为移动端人工智能代理提供标准化的评估数据。该数据集于近期发布,核心研究问题在于捕捉真实世界Android操作任务中的多步决策过程,通过索引清单、压缩步骤流及屏幕重放等结构化形式,支持对智能体性能的细粒度剖析。其发布填补了日常动态场景下智能体轨迹数据稀缺的空白,促进了人工智能代理在移动交互领域的可复现研究,对后续的模型训练与基准测试具有重要参考价值。
当前挑战
该数据集面临的挑战兼具领域性与构建性。领域内,Android环境的高动态性要求智能体具备实时感知与规划能力,而现有模型常难以处理多步任务中的状态依赖与异常恢复,数据集的轨迹数据虽详尽,仍难以覆盖真实操作的无限变体。构建过程中,需同步维护多模态数据(文本、图像、视频)的完整性与一致性,同时确保跨设备、跨版本的屏幕录制兼容性,以及压缩后的步骤流不失真,这要求严格的标注流程与质量控制,后续更新亦面临持续复现与版本管理的复杂性。
常用场景
经典使用场景
DailyBench300-trajectories作为Android智能体基准测试DrainBench300的公开轨迹资产,为研究者提供了丰富的真实操作序列数据。该数据集广泛应用于大语言模型驱动的移动端任务规划与执行研究,支持对智能体在复杂多步交互中的决策能力进行系统评估。其经典用法包括:基于轨迹数据进行行为克隆以训练基础策略,利用人类操作序列作为监督信号进行模型微调,以及作为离策略评估的基准,衡量智能体在未见任务上的泛化性能。研究者亦常借助轨迹中的逐步截图与思维链,进行智能体可解释性分析,探究模型在每一步决策时的内部推理过程。
实际应用
在实际应用层面,DailyBench300-trajectories可直接用于企业级自动化测试与质量保障,例如对安卓应用进行智能回归测试,通过回放真实用户轨迹快速定位功能缺陷。基于该数据集训练的智能体可被嵌入移动办公助手,执行诸如日程管理、邮件回复、信息检索等复杂跨应用操作,大幅提升用户办公效率。此外,该数据集的轨迹形式也适用于无障碍辅助工具的研发,帮助视障用户通过语音指令完成屏幕操作,或为老年用户提供个性化的操作引导。其开源的轨迹文件与可视化资源,降低了开发者的使用门槛,促进了移动端AI应用从原型验证到产品落地的转化。
衍生相关工作
DailyBench300-trajectories的发布催生了多项衍生学术工作。研究者基于其轨迹数据开发了新的动作生成模型,将异步截图序列与语言指令进行对齐,实现了更精准的界面元素定位。同时,该数据集促进了逆推断奖励函数的研究,通过对比成功与失败的轨迹来学习任务隐含的偏好,进而改进强化学习的奖励设计。在评估方法论上,衍生工作提出了针对长尾任务的分层评估框架,并利用轨迹数据构建了人类偏好对齐的自动化评分器。此外,该数据集亦成为多模态大模型评测的补充资源,被用于检验视觉-语言模型在真实Android环境中的组合推理能力,推动了跨学科合作与基准测试的持续迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务