SafeGEO
收藏资源简介:
SafeGEO是一个用于评估生成引擎优化(GEO)攻击对大型语言模型推荐代理影响的基准数据集,包含22种攻击包和2种真实控制,覆盖600多个案例和3个目标槽位(共40,800个实例),提供结构化攻击库和Hugging Face数据集配置,用于研究推荐代理在卖家重写网页内容时的风险及缓解措施。
SafeGEO is a benchmark dataset developed to assess the impact of Generated Engine Optimization (GEO) attacks on large language model (LLM)-powered recommendation agents. It encompasses 22 attack packages and 2 real-world control groups, covering over 600 cases across 3 target slots, with a total of 40,800 instances. The dataset provides a structured attack library and Hugging Face dataset configurations, enabling research on the risks and corresponding mitigation measures for recommendation agents when sellers rewrite web content.
数据集概述
SafeGEO 是一个用于评估和缓解推荐型智能体中生成式引擎优化风险的基准测试套件。
核心目标
研究内容提供者通过生成式引擎优化重写网页源内容,是否会导致推荐型智能体将质量低下的产品错误地推送给用户。该套件旨在量化这一风险并探索开发者端的缓解策略。
数据集规模与构成
- 基础推荐案例:共 600 个,涵盖 6 个产品垂直领域(AI 会议转录、婴儿监视器、登机背包、家用空气净化器、降噪耳机、办公椅),每个领域 100 个案例。
- 总实例数:40,800 个。每个基础案例扩展为 68 个实例(22 个攻击包 × 3 个目标槽位 + 2 个对照控制组)。
- 攻击包:包含 22 个攻击变体,基于 7 个原始操纵原语和 3 个操纵位点构建。
- 对照控制组:2 个真实的源内容重写控制组。
主要发现
- 攻击有效性:生成式引擎优化攻击能显著提升低质量产品进入推荐列表的概率。在实验中,目标低质量产品进入 Top 3 推荐的比例最高提升了 83.2%。
- 缓解措施效果:简单的开发者端防御措施(如防御性提示词、结构化证据检查)能减少攻击效果,最高可降低 39.2% 的有害推广率,但无法完全恢复到无攻击时的性能水平。
数据集内容与格式
数据集以 Hugging Face Parquet 格式提供,包含 10 个配置项,所有文件离线存储于仓库的 data/ 目录。以下是主要配置项:
| 配置项 | 行数 | 内容 |
|---|---|---|
visible |
40,800 | 模型可见的输入(查询,候选名单,源文档)。 |
labels |
40,800 | 隐藏的真实标签(攻击包、向量、目标映射、评估键)。 |
candidate_quality |
11,974 | 每个候选项目的质量评估,用于效用和排名指标。 |
source_annotations |
21,513 | 用于引用有效性评分的源注释。 |
geo_line_annotations |
414,000 | 控制源中的行级误导性和反驳性标注。 |
targets |
600 | 每个基础案例的固定 A/B/C 目标分配。 |
instances_manifest |
40,800 | 将每个实例映射到基础案例、攻击包和槽位。 |
quality_distributions |
600 | 每个查询的候选质量分布。 |
requirement_annotations |
600 | 每个查询的需求注释。 |
controlled_documents |
41,400 | 完整控制源语料库,包含隐藏的攻击元数据。 |
攻击分类法
SafeGEO 的攻击模型包含 3 个操纵位点和 7 个原始原语:
- 操纵位点:
- 认知位点
- 内容位点
- 模型面对位点
- 原始原语:
A权威洗白 (认知)U无依据适配声明 (内容)C省略警示 (内容)R相关性泛洪 (内容)E证据填充 (认知)S显著性操纵 (模型面对)M模型导向指令 (模型面对)
攻击包分为四个系列:7 个原子攻击(单一原语)、3 个块攻击(单一完整位点)、4 个跨块攻击(多个位点)和 8 个现实攻击(可部署的生成式引擎优化页面,是缓解研究的主要焦点)。
缓解研究
该研究在相同的攻击实例上测试了 6 个设计层的防御效果:
- L0:无缓解。作为基准参考。
- L1:防御性提示词。增加防御性最终指令。
- L2:理由引出。要求推荐必须附带理由和引用。
- L3:证据分解。添加一个轻量级的上游证据验证构件。
- L4:上下文平衡。重新排序源上下文以降低单一源的显著性。
- L5:指令过滤。移除源中的内部指令。
在各个模型中,L3 证据分解被证明是最有效的缓解措施。
关键评估指标
- Target@3: 攻击目标进入 Top 3 推荐的比例,是主要的攻击成功率指标。
- HCV@1: 排名第一的推荐违反了硬约束的比例。
- GT@3: Top 3 推荐中包含可接受的真实候选项目的比例。
- uNDCG@5: 排名在 Top 5 的归一化折损累计效用。
数据获取与许可
- 项目页面:
https://qianfengwen.github.io/SafeGEO/ - Hugging Face 数据集:
https://huggingface.co/datasets/wieeii/SafeGEO - 代码许可:Apache 2.0
- 数据许可:Creative Commons Attribution 4.0 International





