遇见数据集

yonsei-dli/SAGEO-Arena

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

SAGEO Arena 是一个用于评估搜索增强生成引擎优化(SAGEO)的基准测试,旨在优化网络文档以提高其在AI生成响应中的可见性。该数据集发布了用于构建SAGEO Arena语料库的查询和Google自定义搜索API结果,包括2,700个查询(每个领域300个,共9个领域)和261,874个Google自定义搜索结果(每个查询约80-100个,平均97个,包含URL、标题、摘要和元数据)。查询源自多个已建立的IR数据集,如MS MARCO、Natural Questions等,搜索结果通过Google自定义搜索API收集。

语言:英语 许可证:MIT许可证 规模类别:10万<样本量<100万 任务类别: - 文本检索 - 问答 友好名称:SAGEO Arena 标签: - 搜索增强生成引擎(search-augmented-generative-engine) - 生成引擎优化(generative-engine-optimization) - sageo - 基准测试(benchmark) 配置项: - 配置名称:debate 数据文件: - 拆分:queries 路径:queries/debate_queries_300.jsonl - 配置名称:ecommerce 数据文件: - 拆分:queries 路径:queries/ecommerce_queries_300.jsonl - 配置名称:fiqa 数据文件: - 拆分:queries 路径:queries/fiqa_queries_300.jsonl - 配置名称:hotpotqa 数据文件: - 拆分:queries 路径:queries/hotpotqa_queries_300.jsonl - 配置名称:msmarco 数据文件: - 拆分:queries 路径:queries/msmarco_queries_300.jsonl - 配置名称:nfcorpus 数据文件: - 拆分:queries 路径:queries/nfcorpus_queries_300.jsonl - 配置名称:nq 数据文件: - 拆分:queries 路径:queries/nq_queries_300.jsonl - 配置名称:quora 数据文件: - 拆分:queries 路径:queries/quora_queries_300.jsonl - 配置名称:researchy 数据文件: - 拆分:queries 路径:queries/researchy_queries_300.jsonl - 配置名称:google_search_results 数据文件: - 拆分:all 路径:google_search_results/google_search_responses.jsonl # SAGEO Arena:一款用于评估搜索增强生成引擎优化(Search-Augmented Generative Engine Optimization,SAGEO)的真实评测环境 <a href="https://arxiv.org/abs/2602.12187"><img src="https://img.shields.io/badge/📄_Paper-arXiv-red" alt="论文"></a> <a href="https://github.com/happysnail06/SAGEO_Arena"><img src="https://img.shields.io/badge/💻_Code-GitHub-black" alt="代码"></a> SAGEO Arena是一款用于评估**搜索增强生成引擎优化(Search-Augmented Generative Engine Optimization,SAGEO)**的基准数据集,该技术指通过优化网页文档,提升其在AI生成回复中可见性的实践。 ## 数据集内容 本数据集发布了用于构建SAGEO Arena语料库的**查询集**与**谷歌自定义搜索API(Google Custom Search API)结果**。请遵循GitHub仓库中的[爬虫指南](https://github.com/happysnail06/SAGEO_Arena)重建完整语料库。(注:为规避潜在的网页内容再分发争议,本数据集仅提供文档URL,而非原始爬取的文档内容。) - 共2700条查询(每个领域300条,覆盖9个领域) - 共261,874条谷歌自定义搜索API结果(每条查询对应80~100条结果,平均97条;包含URL、标题、摘要及元数据) ## 覆盖领域 | 源数据集 | 领域分类 | 查询数量 | |---|---|---| | MS MARCO | 通用网络 | 300 | | Natural Questions | 事实型问答 | 300 | | HotpotQA | 多跳问答 | 300 | | NFCorpus | 生物医学 | 300 | | Quora | 社区问答 | 300 | | FiQA | 金融 | 300 | | DebateQA | 辩论 | 300 | | 电子商务 | 购物 | 300 | | Researchy | 科研 | 300 | ## 字段规范 ### `queries/{dataset}_queries_300.jsonl` | 字段名 | 数据类型 | 描述 | |---|---|---| | `id` | 整数 | 查询的唯一标识符 | | `text` | 字符串 | 查询文本内容 | | `dataset` | 字符串 | 源数据集名称 | | `domain` | 字符串 | 领域分类标签 | ### `google_search_results/google_search_responses.jsonl` | 字段名 | 数据类型 | 描述 | |---|---|---| | `query_id` | 整数 | 关联查询`id`的外键 | | `query` | 字符串 | 查询文本内容 | | `dataset` | 字符串 | 源数据集名称 | | `domain` | 字符串 | 领域分类标签 | | `google_rank` | 整数 | 谷歌搜索的原始排名位置 | | `link` | 字符串 | 文档的完整URL | | `displayLink` | 字符串 | 展示用URL(仅显示域名部分) | | `formattedUrl` | 字符串 | 用于可视化展示的格式化URL | | `title` | 字符串 | 谷歌搜索返回的页面标题 | | `snippet` | 字符串 | 谷歌搜索返回的搜索摘要 | | `htmlTitle`, `htmlSnippet`, `htmlFormattedUrl` | 字符串 | 包含高亮标记的HTML格式化版本 | | `pagemap` | 对象 | 页面元数据(包含开放图谱标签、缩略图、结构化数据等) | | `kind` | 字符串 | API结果类型的唯一标识 | ## 引用格式 bibtex @article{kim2026sageo, title={SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization}, author={Kim, Sunghwan and Jeong, Wooseok and Kim, Serin and Lee, Sangam and Lee, Dongha}, journal={arXiv预印本 arXiv:2602.12187}, year={2026} } ## 致谢 本数据集的查询样本采自一系列成熟的信息检索基准数据集:MS MARCO、Natural Questions、HotpotQA、NFCorpus、Quora、FiQA-2018、DebateQA以及AutoGEO。谷歌搜索结果通过谷歌自定义搜索API收集获取。

提供机构:
yonsei-dli
搜集汇总
数据集介绍
yonsei-dli/SAGEO-Arena 数据集图片
构建方式
SAGEO Arena数据集的构建源于对搜索增强型生成引擎优化(SAGEO)评估需求的深刻洞察。该数据集精心挑选了2,700条查询,均匀分布于9个领域,包括通用网页、事实问答、多跳推理、生物医学、社区问答、金融、辩论、购物及科研场景,每条领域贡献300条查询。为确保数据真实性与多样性,查询样本源自MS MARCO、Natural Questions、HotpotQA等经典信息检索基准。通过Google Custom Search API,为每条查询采集了80至100条搜索结果,最终累积261,874条记录,涵盖URL、标题、摘要及元数据。为规避内容再分发风险,数据集仅提供链接与API响应,原始文档需通过配套爬虫工具重建。
特点
该数据集的核心特色在于其现实适用性与多维度覆盖能力。其查询设计横跨9个截然不同的知识领域,从日常购物到前沿科研,全面模拟了生成引擎可能面对的用户意图多样性。每条查询附带的Google实际搜索结果不仅保留了原始排名,还详细记录了结构化元数据(如Open Graph标签),使得研究人员能够精确还原信息检索的初始生态。此外,数据集采用文档-查询映射关系,支持细粒度的检索评估,并兼容即插即用的评测流程,为搜索增强生成引擎优化提供了兼具深度与广度的标准测试平台。
使用方法
使用SAGEO Arena进行评测时,研究者需先通过GitHub仓库提供的爬虫指令,根据数据集中的URL列表重建文档语料库。评估过程基于2,700条查询,每条查询对应一组真实搜索引擎排名结果,用户可借此对比自身优化策略与基线系统的表现。具体而言,可将查询文本作为输入,让待评估的生成引擎生成响应,并将检索到的文档与原始Google结果进行命中率、排名一致性及内容准确性的对比。数据集预配置了9个子集(如debate、ecommerce),通过HuggingFace的`load_dataset`函数可分别加载查询文件,而全局的`google_search_results`配置则提供完整的API响应集,便于构建端到端优化流水线。
背景与挑战
背景概述
随着大型语言模型在信息检索与生成任务中的广泛应用,搜索增强生成引擎(Search-Augmented Generative Engine, SAGE)逐渐成为整合网络信息以生成智能回答的核心技术。然而,针对此类引擎的文档优化策略——即搜索增强生成引擎优化(SAGEO)——却缺乏系统性的评估基准。为填补这一空白,由韩国多所高校研究人员于2026年提出的SAGEO Arena基准数据集应运而生。该数据集整合了来自MS MARCO、Natural Questions、HotpotQA等八个经典信息检索与问答数据集中的2,700条查询,覆盖通用网页、事实问答、多跳推理、生物医学、社区问答、金融、辩论、电商及学术研究九个领域,并结合Google Custom Search API获取了约261,874条搜索结果。SAGEO Arena旨在为评估SAGEO策略的有效性提供标准化、多领域的真实环境,对推动生成式搜索引擎优化研究具有重要影响力。
当前挑战
SAGEO Arena所解决的领域核心挑战在于,现有检索与问答基准主要聚焦于传统信息检索或单一问答任务,缺乏对生成式搜索引擎中文档可见性优化的综合评估框架,导致研究者难以量化不同优化策略对AI生成响应的影响。在构建过程中,数据集面临多重挑战:一是跨领域查询的多样性与代表性平衡,需从多个异构来源均匀采样以确保覆盖的广度;二是通过网络爬虫重建语料库时需规避版权与内容分发风险,因此仅提供URL而非原始文档;三是Google搜索结果的动态性与API调用限制,需在有限配额内获取稳定且结构化的元数据。这些挑战使得SAGEO Arena成为兼顾真实性与可复现性的稀缺资源。
常用场景
经典使用场景
在信息检索与生成式人工智能交汇的前沿领域,SAGEO-Arena作为搜索增强生成式引擎优化(SAGEO)的标杆性基准,为评估网络文档在AI生成回答中的可见性提供了标准化环境。该数据集囊括了涵盖通用网络、事实问答、多跳推理、生物医学、社区问答、金融、辩论、电子商务及学术研究等9个领域的2700条查询,并配以通过Google Custom Search API获取的超过26万条真实搜索结果。研究者可借助这一丰富资源,系统性地测试不同内容优化策略在提升文档于生成式引擎中引用的效果,从而推动生成式搜索优化技术的严谨评估与迭代进步。
解决学术问题
SAGEO-Arena直面生成式搜索引擎兴起后内容可见性评估缺失的核心挑战。传统搜索引擎优化(SEO)以排名为圭臬,但生成式引擎的答案整合机制颠覆了这一范式,使得网页内容在AI摘要或直接回答中的引用频率与品质成为新的关键指标。该数据集填补了该领域的空白,为量化分析文档结构、语义相关性及权威信号等因素对生成式引擎引用行为的影响提供了科学的实验基础。通过建立多领域、大规模的查询-搜索结果对应关系,它使研究者能够验证不同优化假设,进而推动SAGEO从经验直觉走向可复现、可度量的学术研究范式转型。
衍生相关工作
基于SAGEO-Arena的框架与数据,研究者已拓展出多项关联工作。其中,AutoGEO率先提出了自动化生成式引擎优化的概念,探讨了利用语言模型迭代修正文档元数据以提升引用率的可能性。此外,多领域查询的覆盖也催生了对特定领域(如生物医学NF-Corpus或金融FiQA)生成式引擎行为模式的专项研究。该数据集还可与现有检索增强生成(RAG)系统对比分析,促进生成式引擎中检索与生成环节的协同优化。这些衍生工作共同构建了一个围绕内容在生成式信息环境中可见性的新兴研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务