遇见数据集

neulab/adp-v2

收藏
Hugging Face2026-07-14 更新2026-07-22 收录
官方服务:

资源简介:

ADP v2 是一个增量发布的代理数据协议数据集,由 neulab/agent-data-protocol 流水线生成。它包含多个配置,每个配置对应一个源数据集,专注于代理轨迹数据,用于训练和评估人工智能代理。数据集提供三种分割:std(标准化ADP/ATIF JSONL轨迹)、sft_openhands_24k(以24,000令牌目标压缩的OpenHands SDK监督微调记录)和sft_openhands_110k(以110,000令牌目标压缩的OpenHands SDK监督微调记录)。初始版本包含52个配置,总计约17,676,550行std数据、9,640,563行24k数据和6,353,538行110k数据,覆盖多个领域如软件开发、Android控制、代码反馈、网络浏览等。

ADP v2 is an incremental Agent Data Protocol dataset release generated from the neulab/agent-data-protocol pipeline. It includes multiple configs, each corresponding to a source dataset, focusing on agent trajectories for training and evaluating AI agents. The dataset offers three splits: std (standardized ADP/ATIF JSONL trajectories), sft_openhands_24k (OpenHands SDK SFT records condensed with a 24,000 token target), and sft_openhands_110k (OpenHands SDK SFT records condensed with a 110,000 token target). The initial release contains 52 configs, with approximately 17,676,550 rows in std, 9,640,563 rows in 24k, and 6,353,538 rows in 110k, spanning domains such as software engineering, Android control, code feedback, web browsing, and more.

提供机构:
neulab
搜集汇总
数据集介绍
neulab/adp-v2 数据集图片
构建方式
ADP v2数据集是基于`neulab/agent-data-protocol`流水线构建的增量版本,旨在整合多元化的智能体轨迹数据。该数据集通过标准化协议,将来自52个不同来源的原始轨迹数据统一转化为ADP/ATIF格式的JSONL文件。每个配置项对应一个独立的数据源,涵盖了从软件工程任务(如SWE-ZERO-12M)到交互式环境(如Android控制、网页浏览)等广泛领域。构建过程中,数据经历了从原始轨迹(std)到面向监督微调(SFT)的两种压缩版本(24k和110k token目标),以适配不同计算资源下的模型训练需求。
特点
ADP v2数据集的核心特点在于其规模宏大且多样性丰富,总std行数超过1767万,SFT版本分别达964万和635万行。它囊括了来自智能体在编程、对话、操作系统控制、网络购物、数据库查询等场景中的行为轨迹,为智能体行为建模提供了罕见的广度。数据格式遵循Agent Data Protocol标准,确保了跨源数据的一致性。每个源数据的split设计(std、sft_openhands_24k、sft_openhands_110k)使得研究者可以灵活选择原始粒度的轨迹或经过token压缩的SFT格式。
使用方法
使用ADP v2数据集极为便捷,通过Hugging Face `datasets`库即可加载。用户需指定数据集名称和配置项(如`androidcontrol`),并选择所需的分割(`std`、`sft_openhands_24k`或`sft_openhands_110k`)进行调用。例如,使用`load_dataset('neulab/adp-v2', 'androidcontrol', split='std')`可直接获取标准化轨迹。该数据集特别适用于训练和评估智能体的任务规划、工具调用与环境交互能力,尤其适合需要大规模、多源行为数据进行监督微调或强化学习的研究场景。
背景与挑战
背景概述
ADP v2(Agent Data Protocol version 2)数据集由美国东北大学(Northeastern University)的Neulab研究团队于近期发布,旨在解决人工智能代理(AI Agent)轨迹数据的标准化与规模化问题。随着大语言模型驱动的自主代理在软件开发、网页导航、操作系统控制等领域的广泛应用,缺乏统一格式的高质量训练数据成为制约代理性能提升的关键瓶颈。该数据集基于Agent Data Protocol(ADP)和Agent Trajectory Interchange Format(ATIF)标准,整合了来自52个不同来源的超过1767万条原始代理轨迹数据,覆盖SWE-bench、AgentTuning、Android in the Wild、WebArena等多个代表性场景。ADP v2的发布为代理微调(SFT)和强化学习研究提供了迄今规模最大、多样性最丰富的标准化数据资源,对推动通用代理智能体的发展具有重要意义。
当前挑战
ADP v2数据集着力应对两大核心挑战。其一,领域层面,自主代理面临从简单指令遵循到复杂软件工程任务的多重难题,现有模型在长序列推理、工具调用、环境交互等方面存在严重不足,尤其缺乏涵盖代码仓库操作、终端命令、图形界面交互等异构场景的高质量轨迹数据。其二,构建过程中,不同来源的代理轨迹在格式、粒度、上下文长度上存在巨大差异,ADP v2需设计统一的标准化协议(ADP/ATIF)以兼容原始数据,同时开发高效的轨迹压缩策略,通过24k和110k两种token目标生成适用于不同计算资源的SFT记录。此外,数据质量筛选、隐私合规处理以及跨场景的标注一致性维护构成了额外的技术挑战。
常用场景
经典使用场景
在人工智能与智能体(Agent)研究蓬勃发展的浪潮中,ADP v2数据集为训练和评估具有任务执行能力的智能体提供了至关重要的标准化轨迹资源。该数据集最经典的使用场景是作为监督式微调(SFT)的训练语料,其中包含了海量来自不同来源的智能体与环境交互的完整轨迹。通过采用OpenHands SDK处理后的24K和110K两种代币长度的压缩记录,研究者能够高效地训练模型以理解并复现复杂的代理人行为,涵盖从软件工程任务到网页导航、操作系统控制等多元场景。这使得ADP v2成为构建能够自主完成多步推理与工具调用的通用型智能体的基石性数据源。
解决学术问题
ADP v2数据集针对学术研究中长期存在的智能体行为数据稀缺与格式不统一问题提供了系统性解决方案。其核心贡献在于通过Agent Data Protocol (ADP)标准将来自52个不同来源、超过1767万条原始轨迹进行了标准化处理。此举大幅降低了研究者在数据清洗和对齐格式上的重复劳动,使得跨任务的智能体行为建模成为可能。该数据集解决了智能体领域如何有效利用大规模多样化轨迹数据进行模型预训练与对齐的关键挑战,推动了从单一任务智能体向通用任务执行智能体的范式迁移,对理解智能体策略泛化能力和探索长尾行为分布具有深远学术意义。
衍生相关工作
ADP v2数据集的发布催生了一系列衍生性经典工作,尤其在智能体训练范式和评估基准方面影响深远。基于其标准化的轨迹格式,研究者开发了诸如SWE-Zero、OpenManus-RL和SWE-bench等代表性智能体系统与评估框架。其中,SWE-Zero通过对ADP v2中SWE轨迹的学习,展示了大规模轨迹数据对提升代码修复能力的显著效果。此外,OpenHands项目将ADP v2的SFT压缩记录作为核心训练数据,实现了对开放域智能体行为的高效建模。这些衍生工作相互印证,共同构建了从数据收集、模型训练到性能评测的完整生态闭环,不断推动智能体领域的技术迭代与创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务