遇见数据集

gaia_static_kb

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

GAIA静态知识库是为GAIA基准测试构建的确定性、静态知识库,旨在消除依赖动态网络服务进行评估时引入的方差问题。它包含解决GAIA任务所需的所有信息,确保评估结果更可靠地反映模型内在能力,不受外部动态变化(如网页内容更新、网络不稳定)的干扰。知识库构建过程包括:首先,从HAL GAIA排行榜上32个配置的执行轨迹中提取唯一URL,获取对应网页内容,形成GAIA静态语料库,并以纯文本形式存储在关系数据库的web_pages表中;其次,为支持检索增强生成,语料库被进一步处理并索引到密集向量数据库中,使用BAAI/bge-m3分词器进行分词和编码,嵌入使用FAISS索引,并通过SQLite数据库映射向量ID到块文本、标题和URL。该数据集适用于需要稳定、可复现环境的人工智能代理评估,特别是在GAIA基准测试中涉及信息检索和问答的场景。

The GAIA static knowledge base is a deterministic, static knowledge base constructed for the GAIA benchmark, designed to eliminate variance introduced by relying on dynamic web services during evaluation. It contains all necessary information to solve GAIA tasks, ensuring that evaluation results more reliably reflect the intrinsic capabilities of models, without interference from external dynamic changes such as webpage updates or network instability. The construction involves two parts: first, aggregating unique URLs extracted from execution traces of 32 (scaffold, model) configurations on the HAL GAIA leaderboard, capturing corresponding webpage content to form the GAIA static corpus, stored as plain text in a relational database table web_pages with columns url and page_content; second, to support retrieval-augmented generation, the corpus is further processed and indexed into a dense vector database using the BAAI/bge-m3 tokenizer for tokenization and encoding, with embeddings indexed via FAISS and a SQLite database mapping vector IDs to chunk text, titles, and URLs. This dataset is suitable for evaluating AI agents in stable, reproducible environments, particularly in GAIA benchmark scenarios involving information retrieval and question answering.

创建时间:
2026-07-20
原始信息汇总

GAIA 静态知识库数据集概述

该数据集旨在解决动态环境对自主智能体评估指标可靠性的影响,通过构建确定性、静态的知识库来解耦 GAIA 基准测试与动态网络搜索。

数据集结构与内容

数据集包含以下两个主要组成部分:

1. GAIA 静态语料库

  • 存储位置gaia_static_kb/gaia_webpages_compr_ind_shards
  • 存储格式:关系型数据库,单表 web_pages
  • 表结构
    • url:唯一索引,存储网页URL
    • page_content:网页纯文本内容(使用 zstd 压缩以节省磁盘空间)
  • 构建方式:从 32 个 (scaffold, model) 配置在 GAIA 上的执行轨迹中提取唯一URL,并尽最大努力检索对应网页

2. 向量索引数据库

  • 存储位置gaia_static_kb/gaia_vec_db
  • 索引方法:基于密集向量的检索增强生成(RAG)支持
  • 处理流程
    • 使用 BAAI/bge-m3 分词器对文档进行分词
    • 将文档分割为最多 250 个token的连续块(防止检索稀释)
    • 每个块附带元数据(文档URL和标题)
    • 使用 BAAI/bge-m3 编码为密集向量
    • 通过 FAISS 进行向量索引
    • 使用 SQLite 数据库将 FAISS 向量ID 映射到对应的块文本、标题和URL

许可证

本数据集采用 MIT 许可证。

搜集汇总
数据集介绍
gaia_static_kb 数据集图片
构建方式
GAIA Static Knowledge Base的构建旨在消除动态网络搜索对基准测试评估可靠性带来的干扰。研究团队首先从32组不同脚手架与模型配置在GAIA基准上的执行轨迹中,提取所有被引用的唯一URL集合,并尽力获取对应网页内容,形成GAIA静态语料库。这些文档以关系型数据库存储,包含URL与页面文本两列,并采用zstd压缩以节省磁盘空间。为实现检索增强生成,该语料库进一步通过BAAI/bge-m3分词器切分为最多250个token的连续块,辅以文档URL与标题等元数据,编码为密集向量后使用FAISS索引,同时以SQLite数据库维护向量ID与文本内容的映射关系。
使用方法
用户可通过加载GAIA静态知识库进行离线评估与模型测试。使用时,首先从`gaia_static_kb/gaia_webpages_compr_ind_shards`中读取压缩存储的网页文档,利用zstd解压后获取原始文本。对于需要检索增强的场景,可加载`gaia_static_kb/gaia_vec_db`中的FAISS索引与SQLite映射数据库,通过BAAI/bge-m3编码器对查询进行向量化,在索引中检索最相关的文本块,并依据映射关系获取对应的内容、标题及来源URL。该数据集兼容HuggingFace Datasets库的加载方式,便于集成至现有工作流中。
背景与挑战
背景概述
在自主智能体评估领域,依赖动态外部服务的基准测试常因非平稳环境导致指标不可靠。为解耦评估与动态网络搜索的关联,GAIA静态知识库(GAIA Static Knowledge Base)于近期由Princeton HAL实验室主导构建,旨在为GAIA基准测试提供确定性的评估基础。该数据集核心研究问题在于消除网络检索结果随时间波动及瞬态故障带来的评估偏差,通过聚合32种配置的GAIA执行轨迹,提取独特URL并构建静态语料库,辅以BAAI/bge-m3模型的稠密向量索引。其影响力体现为为可复现的智能体评估范式奠定基础,推动领域从动态依赖向静态可控的度量转型。
当前挑战
该数据集面临的核心挑战包括:1)所解决的领域问题在于传统动态评估中,网络搜索结果的时变性导致同一智能体在不同时间点的成功率波动,混淆真实性能度量,而静态知识库需完整覆盖原始任务所需的全部信息,避免因语料缺失造成评估失真;2)构建过程中需处理异构网页的聚合与标准化,包括最佳努力(best-effort)抓取策略下部分页面不可访问的风险,以及长文本的分块与向量索引中,250词块大小需平衡检索精度与信息完整性,同时应对不同来源文档的格式差异与压缩存储效率问题。
常用场景
经典使用场景
在智能体评估领域,GAIA静态知识库(gaia_static_kb)作为GAIA基准测试的确定性配套资源,彻底消除了动态网络搜索带来的指标波动。研究者通过将智能体在复杂网页信息检索任务中的表现与这一静态知识库耦合,能够精准测量模型本身在信息聚合、推理与问答中的真实能力。该数据集尤其适用于那些需要高度可重复性实验的场景,例如对比不同语言模型或检索增强生成架构的性能。借助结构化的网页文本库与预构建的密集向量索引,GAIA静态知识库使得高效、稳定且无环境噪声的智能体测评成为可能,为自动化代理研究提供了公允的测试基石。
解决学术问题
该数据集直面动态环境对基准测试可靠性的严峻挑战——由于互联网内容的瞬变性,同一查询在不同时刻可能得到迥异的搜索结果,导致模型评估指标充满偶然性。GAIA静态知识库通过构建固定且完整的网页文本副本,彻底锁定了信息空间,让评估过程摆脱网络不稳定、页面更新和索引延迟等外部扰动。这一机制从根本上解决了困扰自主智能体领域的“评估方差”问题,使得学术研究能够基于真正内在能力而非运气对模型进行排序与诊断。它所提供的确定性评估范式,显著提升了模型比较与消融实验的科学严谨性,推动了大语言模型在复杂信息检索场景中能力的可信量化。
实际应用
在实际工业与工程应用中,GAIA静态知识库为构建稳定可靠的智能客服、知识问答系统以及自动化研究助手提供了强有力的评估工具。团队可以利用该资源模拟需要跨来源信息聚合的复杂查询,检验检索增强生成系统在信息噪声和长尾知识上的综合表现。尤为重要的是,静态知识库支持离线和批量测试,避免了实时网络调用带来的延迟与费用开销,极大提升了大规模实验的效率与可复现性。此外,知识库中嵌入的密集向量索引可用于快速原型验证新检索算法,加速将前沿研究转化为稳定产品中的检索组件。
数据集最近研究
最新研究方向
该数据集专注于解决大语言模型自主智能体评估中的动态环境不可复现性问题,通过构建静态知识库与向量化检索索引,为基于GAIA基准的智能体性能测评提供了确定性环境。前沿研究方向聚焦于将动态网络搜索的随机性因素剥离出评估流程,确保不同时间点、不同运行轨迹下的测评结果具有一致性与可比性。该思路直接回应了当前大模型智能体领域因依赖在线服务而普遍面临的评测鲁棒性挑战,可与近期关于标准化智能体评估框架及检索增强生成可信性验证的热点议题形成联动,为构建更为严谨、可复现的智能体能力评估体系奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务