Atarogic/ASSEBench
收藏官方服务:
资源简介:
ASSEBench是与AgentAuditor框架一起发布的基准数据集,用于对LLM代理进行人类级别的安全和安全评估。
ASSEBench is the benchmark dataset released with AgentAuditor, a framework for human-level safety and security evaluation of LLM agents.
提供机构:
Atarogic搜集汇总
数据集介绍

构建方式
ASSEBench是伴随AgentAuditor框架发布的基准数据集,旨在对LLM智能体进行类人级别的安全与防护评估。该数据集由多个配置组成,包括safety、security、strict和loose,分别聚焦于安全交互评估、防护交互评估以及严格与宽松两种评价标准。每个配置对应一个JSON文件,其中safety与loose、strict各包含1,476个样本,security配置则有817个样本。数据集的构建基于对智能体多轮交互轨迹的细致标注,涵盖应用场景、风险类型、失败模式及自然语言风险描述等字段,从而形成全面且结构化的评估资源。
特点
ASSEBench的核心特点在于其多维度的安全与防护评估框架,能够针对LLM智能体在交互过程中可能出现的风险进行精细化分类与标注。数据集不仅提供了明确的风险类型和失败模式注解,还引入了“模糊性”标记以应对复杂场景。此外,通过四种配置(安全、防护、严格、宽松),研究者可根据需求选择不同的评价粒度,从而更灵活地测试智能体在多样情境下的表现。这种层次化设计使得ASSEBench成为评估智能体安全性的宝贵工具,尤其适合需要高可靠性的应用场景。
使用方法
使用ASSEBench时,研究者可借助HuggingFace的datasets库轻松加载所需配置,例如通过load_dataset("Atarogic/ASSEBench", "safety")获取安全评估数据。每个样本包含id、profile、contents(多轮交互轨迹)、label、application_scenario、risk_type、failure_mode、ambiguous和risk_description等字段,便于进行多角度的分析与评测。推荐结合AgentAuditor框架进行完整的安全与防护体系评估,并引用相关论文以支持学术研究或实际应用中的智能体安全性验证。
背景与挑战
背景概述
ASSEBench由Hanjun Luo、Shenyu Dai等研究人员在2025年提出,旨在应对大语言模型代理(LLM Agents)在部署于真实世界任务时面临的日益严峻的安全与保障挑战。该基准测试从安全性与安全性两个核心维度出发,构建了包含上千条多轮交互轨迹的高质量评估数据集,覆盖风险类型、失败模式及应用场景等精细标注。ASSEBench的发布为LLM代理的安全评估提供了系统化的标准化测试平台,推动了该领域从定性讨论向定量评估的演进,显著增强了相关研究在学术界和工业界的影响力。
当前挑战
ASSEBench所解决的核心领域问题在于LLM代理在执行复杂任务时可能产生有害输出或被恶意利用,现有评估方法多依赖人工判定,效率与可重复性不足。构建过程中面临的挑战包括:定义并细化安全与保障风险类别,确保覆盖常见的攻击模式与意外行为;采集并标注包含多轮交互的逼真轨迹,平衡样本多样性与代表性;设计严格与宽松两套评估标准以适应不同应用场景,并确保标注的一致性与客观性。这些挑战使得ASSEBench在数据质量与评估鲁棒性上达到了高标准。
常用场景
经典使用场景
在大型语言模型(LLM)智能体安全评估领域,ASSEBench被设计为一个全面的基准测试平台。研究人员可借助其提供的多种交互轨迹数据,对智能体在安全与隐私等方面的表现进行系统评测,尤其适用于衡量智能体在面对潜在恶意指令或敏感信息泄露场景时的反应与决策能力。通过配置不同的评估子集,能够灵活覆盖从严格到宽松的多种评估标准,从而实现对智能体鲁棒性、可靠性的深度测试。
实际应用
实际应用中,ASSEBench可用于评估和提升商业级LLM智能体产品(如智能客服、个人助手、自动化工具)的安全性。模型开发者和部署方能够借助该数据集对智能体在真实情景中的行为进行预发布测试,发现可能诱导其生成危险内容、泄露用户隐私或执行恶意操作的风险点。通过精准识别风险类型与失败模式,企业可以针对性地优化模型行为,从而降低部署后的实际安全事件发生率,增强用户信任。
衍生相关工作
衍生于ASSEBench的经典工作包括配套的《AgentAuditor》框架,该框架首次提出在类人层面上对LLM智能体进行安全与统一评估的方法论。此外,数据集推动了多篇关于智能体风险建模、交互安全审计以及多轮对话安全性增强的前沿研究。这些工作利用ASSEBench的高质量标注数据,探索了风险传播路径、检测算法优化以及防御机制设计等关键问题,进一步扩展了智能体安全研究的边界,为领域内后续标准化评估体系的构建奠定了扎实基础。
以上内容由遇见数据集搜集并总结生成



