GEO-Bench
收藏资源简介:
这是一个研究领域的数据集,随**AutoGEO**发布,用于**生成引擎优化(GEO)**研究。数据集包含多个配置:main(用于GEO训练和评估的主要训练/测试数据)、rule_candidate(用于内容偏好规则提取的数据)、cold_start(用于AutoGEO Mini的监督微调数据)、inference(仅用于推理的数据)、grpo_input(用于GRPO训练的输入数据)和grpo_eval(用于GRPO训练模型的评估数据)。
This is a research-domain dataset released alongside **AutoGEO**, tailored for research on **Generative Engine Optimization (GEO)**. The dataset includes multiple configurations: main (primary training and test data for GEO training and evaluation), rule_candidate (data for content preference rule extraction), cold_start (supervised fine-tuning data for AutoGEO Mini), inference (data solely for inference), grpo_input (input data for GRPO training), and grpo_eval (evaluation data for models trained via GRPO).
GEO-Bench 数据集概述
基本信息
- 数据集名称: GEO-Bench Dataset (AutoGEO)
- 发布机构: 与 AutoGEO 一同发布
- 主要用途: 用于生成式搜索引擎优化研究
- 许可证: MIT
- 任务类别: 文本生成
- 相关标签: 生成式搜索、地理信息、AutoGEO、电子商务、大语言模型、强化学习
数据集配置
数据集包含多个配置,每个配置对应不同的数据子集和用途:
- main: 用于 GEO 训练和评估的主要训练/测试数据(约 8k 训练样本 / 约 1k 测试样本)
- rule_candidate: 用于内容偏好规则提取的数据(约 8k 样本)
- cold_start: 用于 AutoGEO Mini 监督微调的数据(约 3.5k 样本)
- inference: 仅用于推理的数据(约 1k 样本)
- grpo_input: 用于 GRPO 训练的输入数据(约 8k 样本)
- grpo_eval: 用于评估 GRPO 训练模型的数据(约 8k 样本)
相关资源
- 论文: "What Generative Search Engines Like and How to Optimize Web Content Cooperatively"
- 作者: Yujiang Wu*, Shanshan Zhong*, Yubin Kim, Chenyan Xiong (*Equal contribution)
- 代码库: AutoGEO on GitHub
引用格式
bibtex @article{wu2025generative, title={What Generative Search Engines Like and How to Optimize Web Content Cooperatively}, author={Wu, Yujiang and Zhong, Shanshan and Kim, Yubin and Xiong, Chenyan}, journal={arXiv preprint arXiv:2510.11438}, year={2025} }




