遇见数据集

cx-cmu/GEO-Bench

收藏
Hugging Face2025-12-17 更新2025-12-20 收录
官方服务:

资源简介:

这是一个名为GEO-Bench Dataset (AutoGEO)的研究领域数据集,主要用于生成引擎优化(GEO)研究。数据集包含多个配置:main(用于GEO训练和评估的主要训练/测试数据,约8k训练/1k测试样本)、rule_candidate(用于内容偏好规则提取的数据,约8k样本)、cold_start(用于AutoGEO Mini的监督微调数据,约3.5k样本)、inference(仅用于推理的数据,约1k样本)、grpo_input(用于GRPO训练的输入数据,约8k样本)和grpo_eval(用于GRPO训练模型的评估数据,约8k样本)。数据集与论文《What Generative Search Engines Like and How to Optimize Web Content Cooperatively》相关联,并提供了GitHub代码链接和引用信息。

This is a research-domain dataset named GEO-Bench Dataset (AutoGEO) released for Generative Engine Optimization (GEO) research. The dataset includes multiple configurations: main (primary train/test data for GEO training and evaluation, ~8k train / ~1k test samples), rule_candidate (data for content preference rule extraction, ~8k samples), cold_start (supervised fine-tuning data for AutoGEO Mini, ~3.5k samples), inference (inference-only data, ~1k samples), grpo_input (input data for GRPO training, ~8k samples), and grpo_eval (evaluation data for GRPO-trained models, ~8k samples). The dataset is associated with the paper What Generative Search Engines Like and How to Optimize Web Content Cooperatively and provides GitHub code links and citation information.

提供机构:
cx-cmu
搜集汇总
数据集介绍
构建方式
GEO-Bench数据集由卡内基梅隆大学研究团队在AutoGEO框架下构建,专为生成式搜索引擎优化(Generative Engine Optimization, GEO)研究而设计。该数据集基于电子商务领域的网页内容,通过系统化的数据采集与标注流程,形成了多个配置子集。其中,主数据集(main)包含约8000条训练样本与1000条测试样本,用于GEO模型的训练与评估;规则候选集(rule_candidate)涵盖约8000条样本,服务于内容偏好规则提取;冷启动集(cold_start)包含约3500条样本,用于AutoGEO Mini的监督微调;推理集(inference)提供约1000条样本,专供推理测试;GRPO输入集(grpo_input)与GRPO评估集(grpo_eval)各含约8000条样本,分别用于强化学习训练与评估。所有数据以Parquet格式存储,并通过HuggingFace Datasets库进行版本化管理。
特点
该数据集的核心特色在于其多维度、多场景的配置设计,能够全面支持生成式搜索引擎优化研究的全流程需求。从监督微调、规则提取到强化学习训练与评估,每一子集均针对特定研究阶段进行了优化,体现了高度的模块化与灵活性。数据来源于真实的电子商务环境,确保了内容生态的实用性与代表性。此外,数据集与AutoGEO框架紧密结合,提供了从数据到模型的完整研究链路,使得研究者能够直接复现论文实验结果,并在此基础上进行拓展创新。GEO-Bench还遵循MIT开源协议,降低了学术与工业界的应用门槛。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集,利用配置选择器指定所需子集,例如使用`load_dataset('cx-cmu/GEO-Bench', 'main')`加载主数据集。对于监督微调任务,可选用cold_start子集;若需进行规则提取,则可使用rule_candidate子集。GRPO相关的强化学习研究,则分别调用grpo_input与grpo_eval子集。数据集以Parquet格式存储,支持高效的数据读取与批处理操作。建议研究者结合AutoGEO开源代码库中的示例脚本,快速搭建从数据加载到模型训练与评估的完整流水线。同时,论文中详细描述了数据集的构建细节与实验设置,可作为使用时的权威参考。
背景与挑战
背景概述
随着大型语言模型与检索增强生成技术的深度融合,生成式搜索引擎(如Bing Chat、Google SGE)正逐步重塑信息获取的范式。然而,传统搜索引擎优化(SEO)策略在应对生成式引擎的摘要式、对话式响应时往往失效,催生了生成式引擎优化(GEO)这一新兴研究方向。在此背景下,卡内基梅隆大学的Yujiang Wu、Shanshan Zhong研究团队于2025年发布了GEO-Bench数据集,旨在系统性地探究生成式搜索引擎的内容偏好规律。该数据集由AutoGEO项目配套推出,包含超过一万条精心标注的样本,覆盖训练、测试、规则提取及强化学习等多种配置,为理解生成式引擎如何评价与整合网页内容提供了标准化基准。其核心研究问题聚焦于如何通过协作式内容调整来提升网站在生成式搜索结果中的可见性与影响力,对信息检索、自然语言处理及网络内容生态领域均具有重要的推动意义。
当前挑战
GEO-Bench数据集所解决的领域核心挑战在于,传统SEO方法无法适应生成式搜索引擎的复杂决策逻辑——后者不仅依赖关键词匹配,更涉及语义理解、事实性与权威性评估以及多源信息摘要的生成。具体而言,构建过程中面临三大技术难关:其一,如何设计有效的内容偏好规则,以捕捉生成式引擎对结构化、可验证信息的需求;其二,冷启动阶段缺乏现成的标注范式,需要从零构建监督信号以训练基础优化模型;其三,强化学习训练数据的生成与评估,需在奖励模型与策略模型之间建立可靠的反馈回路,确保优化后的内容既符合引擎偏好又不失自然流畅。这些挑战共同构成了从规则提取到模型微调的全链路技术屏障。
常用场景
经典使用场景
GEO-Bench数据集专为生成式引擎优化(Generative Engine Optimization, GEO)研究而设计,其核心场景是评估和提升网页内容在生成式搜索引擎中的表现。通过提供涵盖训练、测试、规则提取、冷启动微调及强化学习训练的多重配置子集,该数据集支持从监督学习到偏好对齐的完整研究流程,成为探究生成式搜索如何理解、偏好与整合网页信息的标准化基准。
衍生相关工作
基于GEO-Bench,研究者已衍生出多项经典工作,包括基于规则的内容偏好提取方法、利用GRPO算法进行生成式引擎偏好对齐的强化学习框架,以及冷启动场景下的轻量级优化模型AutoGEO Mini。这些工作共同构建了从偏好建模到自动优化的技术栈,并催生了关于生成式搜索排名机制、内容协作博弈及多智能体优化等前沿议题的深入探讨,进一步拓展了GEO领域的研究边界。
数据集最近研究
最新研究方向
GEO-Bench数据集聚焦于生成式搜索引擎优化(GEO)这一前沿领域,旨在系统性地探索大型语言模型驱动的搜索系统对网页内容的偏好规律,并构建可协作优化的方法论。该研究紧密关联生成式AI与信息检索的交叉热点,尤其是随着ChatGPT、Bing Chat等生成式搜索引擎的普及,如何调整网页内容以适应其生成逻辑而非传统关键词匹配,已成为学界与工业界共同关注的课题。GEO-Bench通过提供多配置子集(如规则提取、冷启动微调、GRPO强化学习训练等),为量化内容偏好、设计自动化优化策略提供了标准化基准。其核心意义在于推动从被动SEO到主动GEO的范式转变,为构建更透明、更高效的网络内容与生成式搜索系统的协同进化生态奠定数据与评估基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务