遇见数据集

adp-v2

收藏
Hugging Face2026-07-09 更新2026-07-10 收录
官方服务:

资源简介:

ADP v2(Agent Data Protocol v2)是一个由 `neulab/agent-data-protocol` 流水线生成的增量发布数据集,专注于智能体轨迹数据的标准化与处理。该数据集整合了来自多个源数据集的配置,每个配置代表一个独立的原始数据集,并经过统一的处理流程。数据集提供了三种数据切分:`std`(标准化的 ADP/ATIF JSONL 轨迹)、`sft_openhands_24k`(使用 OpenHands SDK 进行监督微调记录,并以 24k token 为目标进行压缩)和 `sft_openhands_110k`(使用 OpenHands SDK 进行监督微调记录,并以 110k token 为目标进行压缩)。初始版本包含 50 个配置,总计约 373 万条 `std` 轨迹、687 万条 `sft_openhands_24k` 记录和 371 万条 `sft_openhands_110k` 记录。数据覆盖了广泛的智能体应用场景,包括但不限于软件工程任务(如 SWE-agent)、网络浏览、终端操作、工具使用、代码生成与反馈、多模态交互(如 LLaVA)、Android 控制、研究助理等。数据集以 JSONL 格式存储,适用于智能体行为建模、轨迹分析、监督微调(SFT)以及基于 OpenHands SDK 的智能体开发与评估。

ADP v2 (Agent Data Protocol v2) is an incrementally released dataset generated by the `neulab/agent-data-protocol` pipeline, focusing on the standardization and processing of agent trajectory data. The dataset integrates configurations from multiple source datasets, each representing an independent original dataset and undergoing a unified processing workflow. It provides three data splits: `std` (standardized ADP/ATIF JSONL trajectories), `sft_openhands_24k` (supervised fine-tuning records using the OpenHands SDK, compressed with a target of 24k tokens), and `sft_openhands_110k` (supervised fine-tuning records using the OpenHands SDK, compressed with a target of 110k tokens). The initial version includes 50 configurations, totaling approximately 3.73 million `std` trajectories, 6.87 million `sft_openhands_24k` records, and 3.71 million `sft_openhands_110k` records. The data covers a wide range of agent application scenarios, including but not limited to software engineering tasks (e.g., SWE-agent), web browsing, terminal operations, tool usage, code generation and feedback, multimodal interactions (e.g., LLaVA), Android control, research assistance, etc. The dataset is stored in JSONL format and is suitable for agent behavior modeling, trajectory analysis, supervised fine-tuning (SFT), and agent development and evaluation based on the OpenHands SDK.

提供机构:
NeuLab @ LTI/CMU
创建时间:
2026-07-09
原始信息汇总

数据集:ADP v2

  • 数据集名称: ADP v2
  • 数据集提供方: neulab
  • 许可协议: 其他 (license: other)
  • 语言: 英语 (en)
  • 标签: agent-data-protocol, agent-trajectories, openhands
  • 数据集描述: 该数据集是 neulab/agent-data-protocol 流水线生成的增量式 ADP v2 版本。每个配置(config)对应一个源数据集。初始版本包含已完成的 raw24k110k 阶段的配置。

数据集结构与内容

该数据集包含50个配置(configs),每个配置对应一个源数据集,例如 androidcontrolcode_feedbackswe-smith 等。每个配置下包含三个数据集分割(splits):

  • std: 标准化的 ADP/ATIF JSONL 轨迹数据。
  • sft_openhands_24k: 以24k token目标压缩的 OpenHands SDK SFT 记录。
  • sft_openhands_110k: 以110k token目标压缩的 OpenHands SDK SFT 记录。

数据统计 (初始版本)

  • 总配置数: 50
  • std 总行数: 3,737,675
  • sft_openhands_24k 总行数: 6,872,062
  • sft_openhands_110k 总行数: 3,705,494

部分配置数据行数统计

配置名称 std 行数 sft_openhands_24k 行数 sft_openhands_110k 行数
CharlieDreemur_OpenManus-RL 48,927 44,647 44,647
androidcontrol 3 3 3
code_feedback 66,383 66,383 66,383
codescout 58,871 62,107 58,871
mind2web 1,009 16,125 9,505
swe-smith 数据集配置存在,但统计表中未列出具体行数。 - -

使用示例 (Python)

可以使用 Hugging Face Datasets 库加载数据,示例如下:

python from datasets import load_dataset

加载 androidcontrol 配置的 std 分割

std = load_dataset("neulab/adp-v2", "androidcontrol", split="std")

加载 androidcontrol 配置的 sft_openhands_24k 分割

sft24 = load_dataset("neulab/adp-v2", "androidcontrol", split="sft_openhands_24k")

加载 androidcontrol 配置的 sft_openhands_110k 分割

sft110 = load_dataset("neulab/adp-v2", "androidcontrol", split="sft_openhands_110k")

搜集汇总
数据集介绍
adp-v2 数据集图片
构建方式
随着智能体技术的迅猛发展,高质量、标准化的智能体轨迹数据成为推动该领域进步的关键资源。ADP-v2数据集正是基于这一需求构建而成,它源自`neulab/agent-data-protocol`流水线,旨在提供增量式的智能体数据协议(ADP)数据集。该数据集通过整合来自多个来源的原始智能体轨迹,并经过标准化处理,形成了遵循ADP/ATIF格式的JSONL轨迹文件。具体而言,构建过程涵盖了超过50个配置(config),每个配置对应一个独立的源数据集,这些数据集涵盖了从软件工程到实体交互等广泛的任务场景。为了适配不同的训练需求,每个配置下的数据被进一步处理为三种分片(split):原始标准化的'std'分片、以及经过OpenHands SDK压缩并分别以24k和110k为token目标的SFT分片,从而为监督微调提供了规模灵活的数据支持。
特点
ADP-v2数据集的核心特点在于其卓越的规模与多样性。它囊括了超过370万条标准化轨迹以及数百万条SFT格式记录,覆盖了50个不同的配置,每个配置都代表了一个独特的智能体任务领域,例如代码调试(code_feedback)、网页浏览(webarena_successful)、Android设备控制(androidcontrol)以及软件工程(swe-smith)等。这种跨领域的深度覆盖使得数据集能够极大丰富智能体模型在多样化场景下的学习素材。此外,数据集的增量发布策略允许后续不断添加新的配置,保证了其时效性和扩展性。尤为重要的是,其标准化的数据格式和分片设计,为研究人员提供了极大的便利,使得跨数据集比较和模型泛化能力的评估成为可能。
使用方法
利用ADP-v2数据集进行模型训练与研究的过程被设计得极为简捷高效。通过HuggingFace的`datasets`库,用户只需几行Python代码即可完成数据加载。例如,通过`load_dataset('neulab/adp-v2', 'androidcontrol', split='std')`即可获取特定配置下的标准化轨迹数据。类似地,通过指定`split='sft_openhands_24k'`或`split='sft_openhands_110k'`,用户可以便捷地加载不同压缩程度和规模的SFT数据,以适配不同的计算资源与训练目标。这种统一的加载接口消除了数据预处理的门槛,使得研究者能够专注于模型架构设计与训练策略的优化。同时,数据集配置的丰富性允许用户根据具体研究任务(如强化学习、监督微调)灵活选择相应的数据子集,极大地提升了使用的灵活性和研究的可复现性。
背景与挑战
背景概述
ADP v2(Agent Data Protocol version 2)是由Neulab研究团队于近期发布的大规模智能体轨迹数据集,遵循Agent Data Protocol(ADP)与Agent Trajectory Interchange Format(ATIF)标准格式。该数据集的核心研究问题在于弥合语言模型与复杂环境交互之间的鸿沟,为强化学习与监督微调提供统一、标准化的智能体行为数据。ADP v2汇集了来自50个不同来源的超过370万条原始轨迹记录,涵盖软件工程(SWE-bench)、网页浏览(WebArena)、移动设备交互(Android in the Wild)、代码反馈(Code Feedback)等多元领域。作为开放智能体研究的基础设施,该数据集为训练具备多步规划与工具调用能力的语言智能体提供了前所未有的数据规模与多样性,显著推动了自主智能体系统的研究进展。
当前挑战
ADP v2所面对的领域挑战在于如何使语言模型从静态文本理解跃迁至动态环境中的多步决策与工具调用。传统语言模型在缺乏真实交互轨迹的情况下难以掌握环境反馈驱动的自适应行为。在数据集构建过程中,核心挑战包括:其一,跨来源轨迹的格式统一与语义对齐,需将来自OpenManus、OpenHands等异构系统的原始轨迹标准化为ADP/ATIF格式;其二,轨迹长度控制与信息压缩,通过24k和110k两种token目标对监督微调数据进行智能浓缩,在保留关键决策点的同时满足不同计算资源需求;其三,大规模数据清洗与质量控制,确保从50个数据源聚合的数百万条轨迹具有一致的标注质量与任务有效性,避免噪声信号干扰模型训练。
常用场景
经典使用场景
在智能体研究蓬勃发展的当下,ADP v2数据集作为遵循Agent-Data-Protocol(ADP)标准规范的多源轨迹数据集,其最为经典的使用场景在于为大规模语言模型驱动的智能体系统提供统一的监督微调(SFT)训练数据。通过整合来自OpenManus-RL、SWE-bench、WebArena、AndroidControl等五十余个异构数据源的轨迹,该数据集为训练泛化能力卓越的通用型智能体模型奠定了坚实基础。研究人员可利用其提供的标准化‘std’格式轨迹以及经过精细长度控制的‘sft_openhands_24k’和‘sft_openhands_110k’两种SFT版本,针对不同计算资源和任务复杂度需求,灵活地训练智能体高效完成复杂的软件工程任务、网页交互操作以及移动设备控制等多元化目标。
衍生相关工作
ADP v2数据集的发布催生了一系列具有深远影响的衍生研究工作。基于其标准化轨迹格式,研究者构建了OpenHands等开源智能体框架,实现了从数据加载到模型训练与评估的端到端流水线。该数据集还促进了‘Agent-Data-Protocol’(ADP)协议的广泛应用,形成了统一的智能体数据生态,并衍生出面向特定场景的特化版本,如专注于软件工程领域的SWE-agent和针对移动设备交互的AndroidControl。此外,围绕该数据集的训练策略研究也十分活跃,包括探索不同长度约束下的SFT效果差异以及将轨迹数据与强化学习相结合的混合训练方法,这些工作共同推动了通用智能体系统性能的持续突破与评估体系的日臻完善。
数据集最近研究
最新研究方向
在当前智能体(Agent)与基础模型深度融合的前沿浪潮中,ADP v2数据集以其庞大的体量与跨域覆盖性,成为推动通用数字代理行为建模与强化学习研究的核心基石。该数据集整合了来自50个不同子数据源的超过370万条标准化轨迹,覆盖了软件工程(如SWE-bench、swe-smith)、GUI交互(如androidcontrol、omniparser)、Web浏览(如webarena_successful)、代码生成与调试(如code_feedback、codeactstruct)以及多模态工具调用(如llava_plus)等多元领域。其研究前沿聚焦于利用大规模、高质量的行为轨迹进行智能体的监督微调(SFT)与强化学习(RL)训练,特别是通过OpenHands SDK进行24K或110K Token级别的轨迹浓缩,以实现高效且可扩展的模型对齐。这一数据集的出现,直接回应了当前业界对于构建能够执行复杂、多步骤任务的自主智能体的迫切需求,其发布与持续扩展预示着智能体从特定任务专家向通用数字助理演进的重大突破,为下一代具备深度推理与实时环境交互能力的大模型奠定了坚实的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务