遇见数据集

SafeGEO

收藏
github2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

SafeGEO是一个用于评估生成引擎优化(GEO)攻击对大型语言模型推荐代理影响的基准数据集,包含22种攻击包和2种真实控制,覆盖600多个案例和3个目标槽位(共40,800个实例),提供结构化攻击库和Hugging Face数据集配置,用于研究推荐代理在卖家重写网页内容时的风险及缓解措施。

SafeGEO is a benchmark dataset developed to assess the impact of Generated Engine Optimization (GEO) attacks on large language model (LLM)-powered recommendation agents. It encompasses 22 attack packages and 2 real-world control groups, covering over 600 cases across 3 target slots, with a total of 40,800 instances. The dataset provides a structured attack library and Hugging Face dataset configurations, enabling research on the risks and corresponding mitigation measures for recommendation agents when sellers rewrite web content.

创建时间:
2026-06-09
原始信息汇总

数据集概述

SafeGEO 是一个用于评估和缓解推荐型智能体中生成式引擎优化风险的基准测试套件。

核心目标

研究内容提供者通过生成式引擎优化重写网页源内容,是否会导致推荐型智能体将质量低下的产品错误地推送给用户。该套件旨在量化这一风险并探索开发者端的缓解策略。

数据集规模与构成

  • 基础推荐案例:共 600 个,涵盖 6 个产品垂直领域(AI 会议转录、婴儿监视器、登机背包、家用空气净化器、降噪耳机、办公椅),每个领域 100 个案例。
  • 总实例数:40,800 个。每个基础案例扩展为 68 个实例(22 个攻击包 × 3 个目标槽位 + 2 个对照控制组)。
  • 攻击包:包含 22 个攻击变体,基于 7 个原始操纵原语和 3 个操纵位点构建。
  • 对照控制组:2 个真实的源内容重写控制组。

主要发现

  • 攻击有效性:生成式引擎优化攻击能显著提升低质量产品进入推荐列表的概率。在实验中,目标低质量产品进入 Top 3 推荐的比例最高提升了 83.2%
  • 缓解措施效果:简单的开发者端防御措施(如防御性提示词、结构化证据检查)能减少攻击效果,最高可降低 39.2% 的有害推广率,但无法完全恢复到无攻击时的性能水平。

数据集内容与格式

数据集以 Hugging Face Parquet 格式提供,包含 10 个配置项,所有文件离线存储于仓库的 data/ 目录。以下是主要配置项:

配置项 行数 内容
visible 40,800 模型可见的输入(查询,候选名单,源文档)。
labels 40,800 隐藏的真实标签(攻击包、向量、目标映射、评估键)。
candidate_quality 11,974 每个候选项目的质量评估,用于效用和排名指标。
source_annotations 21,513 用于引用有效性评分的源注释。
geo_line_annotations 414,000 控制源中的行级误导性和反驳性标注。
targets 600 每个基础案例的固定 A/B/C 目标分配。
instances_manifest 40,800 将每个实例映射到基础案例、攻击包和槽位。
quality_distributions 600 每个查询的候选质量分布。
requirement_annotations 600 每个查询的需求注释。
controlled_documents 41,400 完整控制源语料库,包含隐藏的攻击元数据。

攻击分类法

SafeGEO 的攻击模型包含 3 个操纵位点和 7 个原始原语:

  • 操纵位点
    • 认知位点
    • 内容位点
    • 模型面对位点
  • 原始原语
    • A 权威洗白 (认知)
    • U 无依据适配声明 (内容)
    • C 省略警示 (内容)
    • R 相关性泛洪 (内容)
    • E 证据填充 (认知)
    • S 显著性操纵 (模型面对)
    • M 模型导向指令 (模型面对)

攻击包分为四个系列:7 个原子攻击(单一原语)、3 个块攻击(单一完整位点)、4 个跨块攻击(多个位点)和 8 个现实攻击(可部署的生成式引擎优化页面,是缓解研究的主要焦点)。

缓解研究

该研究在相同的攻击实例上测试了 6 个设计层的防御效果:

  • L0:无缓解。作为基准参考。
  • L1:防御性提示词。增加防御性最终指令。
  • L2:理由引出。要求推荐必须附带理由和引用。
  • L3:证据分解。添加一个轻量级的上游证据验证构件。
  • L4:上下文平衡。重新排序源上下文以降低单一源的显著性。
  • L5:指令过滤。移除源中的内部指令。

在各个模型中,L3 证据分解被证明是最有效的缓解措施。

关键评估指标

  • Target@3: 攻击目标进入 Top 3 推荐的比例,是主要的攻击成功率指标。
  • HCV@1: 排名第一的推荐违反了硬约束的比例。
  • GT@3: Top 3 推荐中包含可接受的真实候选项目的比例。
  • uNDCG@5: 排名在 Top 5 的归一化折损累计效用。

数据获取与许可

  • 项目页面https://qianfengwen.github.io/SafeGEO/
  • Hugging Face 数据集https://huggingface.co/datasets/wieeii/SafeGEO
  • 代码许可:Apache 2.0
  • 数据许可:Creative Commons Attribution 4.0 International
搜集汇总
数据集介绍
SafeGEO 数据集图片
构建方式
生成式引擎优化(Generative Engine Optimization, GEO)使得内容所有者能够改写网络内容以提升在生成式系统中的可见性,这为推荐代理带来了风险:卖家控制的来源可能通过改写使存在缺陷的产品显得比实际情况更受支持。为量化这一风险,SafeGEO数据集应运而生。其构建基于600个推荐基础案例,横跨AI会议转录、婴儿监视器、双肩背包等六个产品垂直领域,每类100个案例。每个基础案例扩展为68个实例,涵盖22种GEO攻击变体、3个目标槽位及2个真实对照,总计生成40,800个实例。攻击变体由7种操纵原语沿三个操纵位点组合而成,包括7种原子攻击、3种完整位点攻击、4种跨位点攻击及8种逼真攻击变体。数据集以10个Parquet配置文件形式在Hugging Face平台发布,其中visible配置存储模型输入,labels配置隐藏地面真值标签。
使用方法
使用SafeGEO数据集时,可通过Hugging Face datasets库便捷加载visible和labels两个核心配置,获取模型输入与隐藏真值。研究者首先需基于数据集提供的查询、候选名单和源文档调用推荐代理生成预测结果,然后使用benchmark目录下的score_safegeo.py脚本进行评分,该脚本会计算Target@3、HCV@1、uNDCG@5和GT@3等关键指标,并利用隐藏的地面真值标签评估攻击成功率。如需开展防御方案研究,可借助mitigation目录下的build_runfiles.py等脚本,依次执行请求渲染、模型预测和评分流程,系统比较L0至L5共六种开发者侧防御策略的缓解效果。实验结果以L3审计证据检查方法最有效,能将有害目标推荐率降低最多39.2%。所有流程支持离线烟测试以验证环境配置无误。
背景与挑战
背景概述
SafeGEO数据集由多伦多大学计算机科学系的Qianfeng Wen等研究团队于2026年创建,聚焦于生成式引擎优化(GEO)对推荐智能体安全性的威胁。随着大型语言模型驱动的推荐系统在电商等领域的广泛应用,商家可通过GEO技术操纵网页内容以提升产品的推荐概率,这一行为可能破坏推荐系统的效用导向决策。该数据集系统性地研究了GEO攻击的风险,涵盖22种攻击变体、600个推荐案例及40800个测试实例,揭示了GEO攻击能使劣质产品进入推荐列表的概率最高提升83.2%,为该领域的安全性评估提供了首个标准化基准,对推动推荐系统鲁棒性研究具有重要里程碑意义。
当前挑战
核心挑战在于解决推荐智能体面对GEO攻击时的脆弱性问题——当商家利用GEO技术对网页内容进行重写后,智能体难以区分真实效用信息与误导性操纵,导致劣质产品被不当推广。构建过程中面临三大挑战:首先需要设计覆盖多种操纵原语的攻击分类体系,包括权威洗白、无依据契合主张等7种原语组合成22个攻击包;其次要构建包含6个产品垂直领域的600个真实推荐场景,每个场景需反复交叉验证攻击效果;最后还需开发可复现的评估框架,在保持模型效用指标(如uNDCG@5)的同时,准确量化攻击成功率(Target@3)与约束违背率(HCV@1)等关键安全指标。
常用场景
经典使用场景
在检索增强生成与推荐代理系统安全评估的前沿探索中,SafeGEO数据集为衡量生成式引擎优化(GEO)对推荐系统鲁棒性的侵蚀提供了系统化测试平台。其经典使用场景聚焦于评估当卖家操纵商业来源的内容以迎合生成式引擎时,推荐代理是否能维持其效用导向的决策。研究者可借助该数据集内含的22种GEO攻击策略包、跨越600个推荐案例以及40,800个实例的庞大语料库,精准量化恶意GEO内容对推荐排序的扭曲程度。通过对不同攻击变体与目标槽位的交叉验证,该数据集构建了从原子操作到完整页面仿真的层次化威胁模型,为理解GEO攻击在推荐流程中的具体渗透路径提供了规范化的评估基准。
解决学术问题
SafeGEO数据集着力破解了推荐系统安全领域长期悬而未决的关键难题:即如何系统性地量化第三方内容改写对推荐代理效用导向结果的污染风险。学术研究一直受困于缺乏覆盖多维攻击手段的标准化评估框架,而该数据集通过引入涵盖认知误导、内容操纵与模型层诱导的七种基础攻击原语及三层挖掘策源地,精确揭示了GEO攻击可使劣质目标产品进入推荐列表前三位概率提升达83.2%这一严峻现实。更重要的是,它开创性地建立了从攻击建立、鲁棒性验证到防御效果评估的完整实验范式,其核心指标Target@3、HCV@1与uNDCG@5等构成了衡量推荐系统面对对抗性内容时性能折衷的黄金标准,为后续理论建模与防御机制研究奠定了数据基础。
实际应用
在电子商务平台、旅游推荐系统及智能内容分发等实际应用场景中,SafeGEO数据集提供的安全评估工具具有直接而深远的指导价值。电商平台可利用该数据集的攻击范例预检其推荐代理在面对蓄意优化的商品描述时的脆弱性,从而在设计阶段嵌入防御性提示与结构化证据核查机制,使有害目标产品的推荐率降低可达39.2%。内容聚合平台和AI驱动的购物助手可借鉴该数据集中的六层防御策略谱系——从L0基准线递升至L5指令过滤——构建与自身架构匹配的渐进式安全加固方案。此外,该数据集的跨品类覆盖(涵盖办公椅、降噪耳机等六类垂直领域)确保了评估结果对真实商业环境的代表性,为推荐系统开发商满足日益严格的AI合规性要求提供了可操作的基准测试套件。
数据集最近研究
最新研究方向
随着生成式引擎优化(GEO)技术的兴起,推荐代理系统面临前所未有的安全挑战。SafeGEO数据集聚焦于探究卖家如何通过操控网络内容来源,利用GEO技术使低质产品在推荐系统中获得不当优先级。该研究构建了包含22种攻击变体、超过600个推荐案例的评估基准,揭示了GEO攻击可使劣质产品进入推荐列表的比例飙升最高83.2%。在此基础上,研究团队进一步探索了开发者层面的防御策略,发现防御性提示与结构化证据核查等简单措施能将有害推荐降低39.2%,但尚无法完全恢复无攻击时的系统性能。这一工作不仅系统性地揭示了GEO对推荐系统可靠性的实质性威胁,还为构建更安全的AI推荐代理提供了关键评估工具与缓解思路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务