Researchy-GEO
收藏资源简介:
这是一个与AutoGEO一起发布的研究领域数据集,用于生成引擎优化(GEO)研究。数据集包含多个配置:main(用于GEO训练和评估的主要训练/测试数据,约10k训练/1k测试样本)、rule_candidate(用于内容偏好规则提取的数据,约10k样本)、cold_start(用于AutoGEO Mini监督微调的数据,约5k样本)、inference(仅用于推理的数据,约1k样本)、grpo_input(GRPO训练的输入数据,约10k样本)和grpo_eval(GRPO训练模型的评估数据,约10k样本)。
This is a research domain dataset released alongside AutoGEO for generative engine optimization (GEO) research. The dataset comprises multiple configurable subsets: main, which serves as the primary training and test data for GEO training and evaluation, containing approximately 10k training samples and 1k test samples; rule_candidate, used for content preference rule extraction with around 10k samples; cold_start, the data for supervised fine-tuning of AutoGEO Mini with roughly 5k samples; inference, the data exclusively for inference with approximately 1k samples; grpo_input, the input data for GRPO training with approximately 10k samples; and grpo_eval, the evaluation data for GRPO-trained models with approximately 10k samples.
Researchy-GEO 数据集概述
基本信息
- 数据集名称: Researchy-GEO Dataset (AutoGEO)
- 发布目的: 用于生成引擎优化(Generative Engine Optimization, GEO)研究。
- 关联研究: 随 AutoGEO 项目发布。
- 许可证: MIT
研究背景
- 论文标题: "What Generative Search Engines Like and How to Optimize Web Content Cooperatively"
- 论文地址: https://arxiv.org/abs/2510.11438
- 作者: Yujiang Wu*, Shanshan Zhong*, Yubin Kim, Chenyan Xiong (*Equal contribution)
- 代码仓库: https://github.com/cxcscmu/AutoGEO
数据集配置
数据集包含多个配置,每个配置对应不同的数据子集和用途:
- main: 用于GEO训练和评估的主要训练/测试数据(约10k训练样本 / 约1k测试样本)。
- rule_candidate: 用于内容偏好规则提取的数据(约10k样本)。
- cold_start: 用于AutoGEO Mini监督微调的数据(约5k样本)。
- inference: 仅用于推理的数据(约1k样本)。
- grpo_input: 用于GRPO训练的输入数据(约10k样本)。
- grpo_eval: 用于评估GRPO训练模型的数据(约10k样本)。
数据格式与访问
- 主要格式: Parquet 文件。
- 访问方式: 通过配置选择器选择不同的子集。
任务类别与标签
- 主要任务类别: 文本生成(text-generation)
- 标签: generative-search, geo, autogeo, e-commerce, llm, reinforcement-learning
引用格式
bibtex @article{wu2025generative, title={What Generative Search Engines Like and How to Optimize Web Content Cooperatively}, author={Wu, Yujiang and Zhong, Shanshan and Kim, Yubin and Xiong, Chenyan}, journal={arXiv preprint arXiv:2510.11438}, year={2025} }




