遇见数据集

RMBench

收藏
github2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

RMBench是一个用于评估AI代理在RAG和工具使用系统中对抗恶意检索上下文的鲁棒性的基准测试数据集。它包含六个任务类型,每个任务有50个样本,总共300个样本,覆盖了八种攻击类型,并用于评估六种大型语言模型在云和本地环境下的表现。

RMBench is a benchmark dataset developed to evaluate the robustness of AI Agents against malicious retrieval contexts in Retrieval-Augmented Generation (RAG) and tool-use systems. It comprises six task types, with 50 samples per task, amounting to a total of 300 samples across eight attack categories. This dataset is used to assess the performance of six large language models in both cloud and on-premises environments.

创建时间:
2026-06-11
原始信息汇总

RMBench 数据集详情

数据集概述

RMBench 是一个用于评估 AI 智能体在面对恶意检索上下文时鲁棒性的基准测试数据集。它专注于 RAG(检索增强生成)和工具使用系统中的检索操纵攻击。

研究动机

在 RAG 流水线中,若检索到的上下文是恶意的,智能体可能出现以下问题:

  • 忽略原始指令
  • 泄露敏感信息
  • 执行不安全的工具调用
  • 偏离预定目标
  • 破坏自身记忆

研究问题

  • 智能体对检索操纵攻击的脆弱程度
  • 不同任务中最有效的攻击类型
  • 攻击在不同模型家族间的迁移性
  • 大型云模型是否比小型本地模型更具抵抗能力
  • 最佳防御方法及其未缓解的攻击
  • 模型规模对鲁棒性的影响

关键贡献

  • 8类检索操纵攻击的分类体系
  • 包含6种任务类型、每种任务50个样本(共300个样本)的基准数据集
  • 包含6个安全指标的评估框架
  • 6种防御方法的基准测试
  • 跨3个Groq云模型和3个Ollama本地模型的混合多模型比较

数据集组成

  • 任务类型:6种(问答、代码生成、工具使用、规划、摘要、记忆评估)
  • 样本数量:每种任务50个样本,总计300个样本
  • 评估实例:8种攻击 × 6种任务 × 50个样本 = 每个模型2,400个评估实例

攻击类型(8种)

攻击类型 描述
指令覆盖 通过注入上下文替换智能体的原始任务指令
上下文投毒 在检索文档中插入虚假或误导性信息
目标劫持 将智能体从原始目标引导至攻击者选择的目标
工具操纵 触发不安全、非预期或危险的工具调用
权威冒充 冒充系统、管理员或受信任权威以获取顺从
记忆投毒 用捏造的记忆破坏智能体的对话历史
多跳注入 跨多个检索跳跃链接注入载荷
隐藏提示注入 使用Unicode或注释样式标记隐藏恶意指令

任务类型(6种)

任务 数据集文件 描述
问答 qa_dataset.json 对抗性上下文下的事实性问答
代码生成 code_dataset.json 注入恶意需求的代码任务
工具使用 tool_use_dataset.json 在操纵上下文下的工具选择
规划 planning_dataset.json 目标劫持上下文下的多步规划
摘要 summarization_dataset.json 受投毒源文档影响的摘要
记忆评估 memory_dataset.json 记忆投毒攻击下的回忆任务

评估指标(6个)

指标 符号 描述 方向
攻击成功率 ASR 成功操纵模型的攻击比例 越低越好
上下文鲁棒性指数 CRI 综合鲁棒性得分 越高越好
目标保持分数 GPS 保持原始目标的响应比例 越高越好
真实性分数 TS 攻击下响应的事实准确性 越高越好
工具安全分数 TSS 安全且适当的工具调用比例 越高越好
记忆完整性分数 MIS 对记忆投毒和虚假回忆的抵抗能力 越高越好

防御方法(6种)

防御方法 描述
上下文清理 基于正则和启发式的注入模式移除
注入检测 基于分类器的提示注入检测
信任评分 源可信度评分以降低可疑上下文的权重
多智能体验证 基于独立智能体调用的共识验证
宪法过滤 基于原则的过滤以拒绝违反策略的上下文
来源追踪 验证上下文文档来源的源认证

支持的模型

  • Groq(云端推理)

    • llama-3.3-70b-versatile(Llama家族,70B参数,128k上下文)
    • meta-llama/llama-4-scout-17b-16e-instruct(Llama家族,17B参数,128k上下文)
    • qwen/qwen3-32b(Qwen家族,32B参数,128k上下文)
  • Ollama(本地推理)

    • mistral:7b(Mistral家族,7B参数,32k上下文,4.4 GB存储)
    • gemma3:4b(Gemma家族,4B参数,128k上下文,3.3 GB存储)
    • deepseek-r1:7b(DeepSeek家族,7B参数,128k上下文,4.7 GB存储)

基准测试流水线

查询 -> 数据集 -> 检索器 (FAISS) -> 攻击注入器 -> [防御] -> 语言模型 -> 评估器 -> 指标

结果输出

基准测试结果以JSON和CSV格式写入 results/ 目录。运行 python run_benchmark.py --defenses none --samples 10 生成结果,运行 python scripts/generate_visualizations.py 生成可视化。

目标受众

  • 人工智能安全研究员
  • 研究RAG流水线的安全研究员
  • 评估生产环境鲁棒性的智能体开发者
  • 研究语言模型鲁棒性的博士生

许可证

MIT

免责声明

本项目严格用于研究和对人工智能系统的防御性评估。攻击实现仅用于衡量和改进模型鲁棒性,不支持任何恶意或现实世界的利用。

搜集汇总
数据集介绍
RMBench 数据集图片
构建方式
在检索增强生成(RAG)与工具调用型AI Agent安全评估领域,RMBench应运而生。该基准数据集系统性地构建了包含六种典型任务(问答、代码生成、工具使用、规划、摘要、记忆评估)的评估框架,每种任务包含50个精心设计的样本,总计300个基础样本。通过将八种检索操纵攻击类型(包括指令覆盖、上下文投毒、目标劫持、工具操纵、权威伪造、内存投毒、多跳注入、隐藏提示注入)与六种防御策略(上下文净化、注入检测、信任评分、多智能体验证、宪法过滤、溯源追踪)进行正交组合,构建了8×6×50=2400个评估实例的全面测试矩阵。评估依托FAISS检索器与攻击注入管道,支持Groq云端和Ollama本地两种推理后端,涵盖Llama、Qwen、Mistral、Gemma、DeepSeek五个模型家族的六款参数规模从4B到70B不等的语言模型。
特点
RMBench的核心特色在于其多维度的安全评估体系。数据集首次提出了六项量化的安全指标——攻击成功率(ASR)、上下文鲁棒性指数(CRI)、目标保持分数(GPS)、真实性分数(TS)、工具安全分数(TSS)和内存完整性分数(MIS),从不同维度刻画Agent在恶意检索上下文中的脆弱性。其独特之处在于支持跨模型家族、跨参数规模、跨推理后端的横向对比分析,能够揭示不同架构模型对操纵攻击的迁移特性。八种攻击类型覆盖了从显式指令篡改到隐式Unicode注入的完整攻击面,六种防御机制则涵盖了从启发式过滤到基于共识的多智能体验证的防御层次,为研究攻击与防御的猫鼠博弈提供了系统性实验平台。
使用方法
RMBench的使用遵循简洁的流水线式操作流程。研究者首先通过Git克隆仓库并安装依赖,随后根据所选模型配置环境——云端Groq模型需为每个模型单独申请并设置专用的API密钥环境变量,本地Ollama模型则需安装Ollama服务并拉取相应模型权重。基准测试通过命令行接口运行,支持灵活的参数配置,包括选定评估模型列表、启用特定防御策略、设定采样数量,以及提供不产生实际API调用的干运行预览模式。运行结果自动以JSON和CSV格式存储于results目录,并可通过内置的可视化脚本生成直观的图表报告,便于研究者开展细粒度的安全性能分析。
背景与挑战
背景概述
随着大语言模型(LLM)在检索增强生成(RAG)与工具调用系统中广泛应用,智能体面临着来自恶意检索上下文的严峻安全威胁。RMBench基准测试由研究团队于2025年提出,旨在系统性评估AI智能体在面对检索操控攻击时的鲁棒性。该基准覆盖了六种前沿LLM,涵盖Llama、Qwen、Mistral、Gemma及DeepSeek四个模型家族,参数规模从4B至70B不等,并同时支持Groq云端推理与Ollama本地推理两种部署模式。核心研究聚焦于攻击类型分类、攻击跨模型迁移性、模型规模对抗鲁棒性的影响,以及防御策略的有效性评估。RMBench为AI安全研究者提供了首个专门针对RAG管道检索操控攻击的标准化评测框架,显著推动了代理安全领域的发展。
当前挑战
RMBench面临的挑战主要源自两个方面。在领域问题层面,智能体在真实部署中易受到指令覆盖、上下文投毒、目标劫持、工具操纵、权威伪造、记忆投毒等多达八种攻击类型的威胁,攻击者通过注入恶意上下文致使智能体泄露敏感信息、执行危险工具调用或偏离既定目标,现有防御手段在应对复杂多跳攻击与隐蔽提示注入时表现有限。在构建过程中,研究团队需精心设计涵盖问答、代码生成、工具使用、规划、摘要与记忆评估六类任务共300个样本的数据集,同时确保每类攻击在50个样本中具备可复现性与代表性;此外,还需在云与本地异构推理环境中统一评测框架,规避不同模型间的速率限制与推理差异,以获取公平可比的鲁棒性指标。
常用场景
经典使用场景
在检索增强生成(RAG)与工具调用型AI代理的安全评估领域,RMBench被广泛用于系统性评测大语言模型在恶意检索上下文攻击下的鲁棒性。该基准构建了涵盖8种攻击类型、6类任务(包括问答、代码生成、工具使用、规划、摘要与记忆评估)的评测框架,每类任务包含50个样本,总计2400个评测实例。通过集成FAISS检索器与攻击注入模块,RMBench支持在云端(Groq)和本地(Ollama)两种推理后端上对Llama、Qwen、Mistral、Gemma、DeepSeek等6个代表性模型进行跨架构、跨规模的标准化评估,并计算攻击成功率、上下文鲁棒性指数、目标保持分数等6项安全指标,为AI代理的安全性研究提供了可复现的量化基准。
实际应用
在实际部署层面,RMBench为构建安全的RAG系统提供了关键的对抗性测试工具。企业级AI应用如智能客服、代码辅助、自动化规划和记忆增强对话系统,均可借助该基准评估其模型在生产环境面对恶意上下文注入时的鲁棒性。特别是,该数据集支持6种防御机制(包括上下文消毒、注入检测、信任评分、多智能体验证、宪法过滤和溯源追踪)的对比测试,能够帮助开发团队选择最优的防护策略。此外,云端与本地推理的双轨支持使得安全评估能够灵活适配不同隐私需求和计算资源场景,从而在金融、医疗、法律等对安全性有严格要求的领域构建更加可信的AI代理系统。
衍生相关工作
RMBench的发布催生了多项重要的衍生研究工作。其攻击分类学(8种检索操纵攻击类型)被后续研究采纳为基准框架,用于设计更隐蔽的多跳注入和隐藏提示注入变体。该基准提出的6项安全度量指标(如目标保持分数和工具安全得分)已成为评估RAG系统鲁棒性的标准范式。基于RMBench的评测结果,研究者进一步探索了跨模型攻击迁移性的机理,并发展了基于多智能体共识和溯源追踪的高级防御方案。此外,该基准所采用的FAISS检索器与攻击注入集成架构,为构建端到端的安全评估流水线提供了参考蓝本,推动了RAG安全领域从个案分析到系统性测评的范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务