遇见数据集

cx-cmu/AgentWebBench-corpus

收藏
Hugging Face2026-06-17 更新2026-06-14 收录
官方服务:

资源简介:

AgentWebBench Corpus是一个为AgentWebBench基准测试预构建的密集检索语料库,用于评估多智能体在Agentic Web中的协调性能。该语料库基于ClueWeb22数据集的100个网站切片(约1840万份文档),包含文档嵌入向量(维度为1024)和FAISS索引(包括每个网站的独立索引和全局索引)。数据集不包含原始文本,仅提供向量和文档ID,需配合ClueWeb22原始数据使用。它适用于信息检索、密集检索等NLP任务,使用MIT许可证,语言为英文。

AgentWebBench Corpus is a pre-built dense-retrieval corpus for the AgentWebBench benchmark, designed for evaluating multi-agent coordination in Agentic Web over a realistic 100-website slice of ClueWeb22 (approximately 18.4 million documents). It includes embeddings (dimension 1024) and FAISS indices (per-website and global indices) but does not contain the original ClueWeb22 text. The corpus is used for tasks such as information retrieval and dense retrieval, under the MIT license, with English as the primary language.

提供机构:
cx-cmu
搜集汇总
数据集介绍
cx-cmu/AgentWebBench-corpus 数据集图片
构建方式
AgentWebBench-corpus的构建遵循经典的稠密检索流程,采用开源框架Tevatron进行嵌入向量与索引的生成。选用的编码器为OpenBMB团队发布的MiniCPM-Embedding-Light模型,该模型输出维度为1024的标准化向量。基于这些向量,针对ClueWeb22数据集中约1840万篇文档,构建了FAISS索引IndexFlatIP,包含每个网站独立的索引与一个覆盖全量文档的全局索引,同时存储了各网站级别的嵌入向量用于网站排序与选择。索引与文档ID映射文件严格对齐,确保检索结果可追溯至原始文档。
特点
该数据集专为AgentWebBench基准测试设计,底层依托ClueWeb22的真实网站切片,覆盖100个不同站点,文档规模约1840万篇,嵌入向量维度统一为1024。其核心特色在于多层次索引结构,既提供每个网站的独立FAISS索引,又构建全局索引,并辅以网站级嵌入向量,支持从网站筛选到文档定位的完整检索流程。所有索引均采用内积度量(IndexFlatIP),保证检索效率与精度。此外,数据集仅存储向量与文档ID,体积紧凑,便于高效加载与部署。
使用方法
推荐通过AgentWebBench代码库自动下载并配置数据集,亦可使用HuggingFace Hub的snapshot_download函数直接下载至本地。使用时,首先通过FAISS读取目标网站的索引文件,并加载对应的文档ID映射数组。将用户查询利用MiniCPM-Embedding-Light编码为1024维归一化向量后,调用索引的search方法获取最高相似度的文档行号,再通过映射数组转换为ClueWeb22的原始文档ID。如需获取文档文本内容,需额外获取ClueWeb22 B类数据并配置相应的根路径。
背景与挑战
背景概述
AgentWebBench-corpus数据集由卡内基梅隆大学的Zhong、Shen和Xiong研究团队于2026年创建,旨在为多智能体协作在代理网络中的研究提供标准化评测基准。该数据集基于ClueWeb22的100个真实网站子集构建,包含约1840万篇文档,通过MiniCPM-Embedding-Light模型提取1024维稠密向量,并构建FAISS索引以支持高效的检索任务。作为AgentWebBench基准的核心语料库,它填补了大规模、真实场景下的多智能体协调评估空白,推动了智能体系统在复杂网络环境中的协同能力研究,对信息检索和智能体领域具有重要影响力。
当前挑战
AgentWebBench-corpus所解决的领域核心挑战在于评估多智能体在动态、异构的代理网络环境中的协调能力,传统检索基准多聚焦于单智能体或静态数据,而该数据集需支持多智能体在多个网站间的协同信息获取与决策。构建过程中面临的主要挑战包括:一是对ClueWeb22海量文档进行筛选,确保所选100个网站能真实反映网络多样性;二是生成并统一管理超1800万个文档的稠密嵌入向量,同时为每个网站构建独立的检索索引和全局索引,以保证检索效率与一致性;三是协调嵌入模型、索引结构与下游基准代码的兼容性,确保数据集的易用性与可复现性。
常用场景
经典使用场景
AgentWebBench-corpus 作为面向多智能体协作研究的稠密检索语料库,其最经典的用途在于为基于代理的网络任务提供高效的知识检索基础设施。该数据集构建于 ClueWeb22 的真实网络切片之上,覆盖 100 个完整网站、约 1840 万文档,并采用 MiniCPM-Embedding-Light 编码为 1024 维向量,辅以 FAISS 索引结构。研究者可借助该语料库实现跨站点的实时信息检索,以支撑智能体在复杂网页环境中执行信息收集、任务分解与协作决策等操作。其设计特别强调索引与文档标识符的严格对齐,确保了检索结果的准确性与可复现性,因而成为多智能体网络基准测试中不可或缺的数据支撑。
实际应用
在实际应用层面,AgentWebBench-corpus 为构建自主网络代理系统提供了直接的数据基础设施。基于该语料库,开发者能够训练和测试具有跨网站信息检索能力的智能助手,使其在电商比价、旅行规划、学术文献搜索等需要聚合多个网络资源的场景中高效运作。数据集提供的全局与按网站划分的 FAISS 索引,使得智能体可以根据任务需求灵活选择在特定网站内进行细粒度搜索或在全站范围内进行广域扫描,从而平衡检索精度与计算开销。此外,该语料库可嵌入工业级对话系统、知识管理平台以及自动化工作流工具,助益于提升信息密集型应用的响应速度与准确性。
衍生相关工作
AgentWebBench-corpus 的发布催生了一系列围绕多智能体协作与稠密检索交叉领域的衍生研究。在索引构建方面,其遵循 tevatron 框架的设计思路启发了后续对分层索引和动态索引更新的探索,推动了针对大规模异构文档集的高效检索方法。在模型评估方面,该语料库常被用作基准测试平台,用于比较不同稠密检索编码器(如 MiniCPM-Embedding 系列)在多网站环境下的泛化能力。此外,若干工作基于该数据集研究了智能体间通信协议与检索结果融合策略,例如利用网站级向量进行任务导向的网站选择与排序,进一步丰富了多智能体系统在信息检索领域的理论框架与实践范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务