遇见数据集

SABER

收藏
arXiv2026-06-01 更新2026-06-03 收录
数据链接:
官方服务:

资源简介:

SABER是由多所顶尖学术机构联合创建的环境感知操作安全基准测试数据集,旨在评估大型语言模型作为编码智能体在真实项目工作空间中的安全性。该数据集包含716个可执行任务,覆盖了嵌入项目工件中的恶意指令、智能体自主选择的风险操作以及依赖上下文的安全警告三大风险维度,通过Docker沙箱环境模拟了包含源代码、配置文件和Git历史的项目工作空间。数据集的构建过程整合了现有智能体安全基准、公共CVE漏洞报告以及实际工作流模板,确保了任务的可执行性和可检测性。该数据集主要应用于人工智能安全领域,旨在解决当前模型在动态、多步骤项目环境中操作安全评估的不足,为提升智能体在现实工作空间中的安全对齐提供关键基准。

SABER is an environment-aware operational safety benchmark dataset jointly created by multiple top-tier academic institutions, aimed at evaluating the safety of large language models (LLMs) acting as coding AI Agents within real-world project workspaces. This dataset comprises 716 executable tasks covering three risk dimensions: malicious instructions embedded in project artifacts, risky operations autonomously selected by AI Agents, and context-dependent security warnings. It simulates project workspaces containing source code, configuration files, and Git histories via Docker sandbox environments. The dataset construction process integrates existing AI Agent security benchmarks, public CVE vulnerability reports, and real-world workflow templates to ensure the executability and detectability of the tasks. Primarily applied in the field of AI safety, this dataset aims to address the current gaps in operational safety assessment of models in dynamic, multi-step project environments, providing a critical benchmark for enhancing the safety alignment of AI Agents in real-world workspaces.

创建时间:
2026-06-01
原始信息汇总

数据集概述:SABER(Stateful Project Workspace Safety Benchmark)

SABER 是一个用于评估 LLM 编程智能体在有状态项目工作区中操作安全性的基准测试套件。该数据集源自同名论文,包含基准任务定义、沙箱运行时、评判流程以及基线复现工具。

核心内容

  • 任务(tasks/):基准测试任务定义与元数据。
  • 运行时环境
    • sandbox_shell.py:沙箱执行环境。
    • task_runtime.pymcp_runtime.py:任务运行与工具运行时。
  • 推理与评判
    • run_osbench.py:历史推理入口。
    • judge_osbench.py:历史评判入口。
  • 基线复现(baselines/):用于复现外部基线评估的脚本与数据。
  • 文档(docs/):设计笔记、内部报告及与论文相关的材料。

使用方式

  1. config.example.json 复制为 config.json,并填写评判模型与目标模型的 API 凭据。
  2. 参照 RUNNING.md 进行推理、评判及结果检查。
  3. 使用 baselines/README.md 复现外部基准对比。

仓库结构

SABER/ ├── README.md ├── RUNNING.md ├── CONTRIBUTING.md ├── AGENTS.md ├── Dockerfile ├── config.example.json ├── tasks/ ├── results/ ├── judged/ ├── docs/ ├── scripts/ ├── baselines/ ├── run_osbench.py ├── judge_osbench.py ├── sandbox_shell.py ├── task_runtime.py └── mcp_runtime.py

许可证

采用混合许可结构:

  • 源代码、脚本、Docker/配置文件及软件文档:Apache License 2.0。
  • SABER 撰写的任务文本、注释、任务元数据等非代码基准材料:Creative Commons Attribution 4.0 International。
  • 第三方基准资产(baselines/benchmarks/ 中):保留上游许可证与署名要求。
搜集汇总
数据集介绍
SABER 数据集图片
构建方式
大型语言模型正被广泛部署为编码代理,其安全性评估需从单轮响应转向多步操作序列。现有基准多聚焦于模型对不安全提示的拒绝能力,却忽视了状态化项目工作区中操作行为的潜在风险。SABER基准通过将模型置于Docker沙箱化的真实项目环境中,初始化包含源代码、配置文件及Git历史的工作区,模拟编码代理的实际操作场景。每项任务均定义用户目标与初始化环境,模型可执行Shell命令、编辑文件及调用工具,评估过程记录完整的执行轨迹、状态增量与对话历史,并依据任务特定的有害模式与全局安全属性进行违规判定,构建了覆盖嵌入式注入、风险自主选择及上下文警告三类威胁场景的综合性评估体系。
使用方法
使用SABER基准时,研究者需将待评估的编码代理模型部署于Docker沙箱环境,并通过统一接口提供任务定义、初始化工作区及操作界面。每个评估运行始于一个全新的沙箱环境,模型接收系统提示与用户请求后,可自由执行Shell命令、调用MCP风格工具或进行文件操作,评估循环持续至模型停止调用工具或达到步骤上限。所有交互记录被保存为可审计的执行轨迹,随后通过基于规则的检测器与LLM辅助的语义判断器联合分析,依据任务特定的有害模式与全局安全属性自动判定运行结果,最终生成有害安全违规率、安全拒绝率及能力不足率等核心指标,实现对模型操作安全性的量化评估。
背景与挑战
背景概述
SABER是由香港大学联合山东大学、卡内基梅隆大学、新加坡国立大学及香港科技大学的研究团队于2025年共同创建的一项系统性基准测试。该基准聚焦于大语言模型作为编码智能体在状态化项目工作空间中的操作安全性。鉴于现有安全评估多局限于单轮提示-响应的拒绝模式或孤立工具调用的安全性检查,SABER开创性地将安全评估拓展至完整的智能体-项目环境交互过程,考量恶意构件识别、自主危险操作选择及上下文约束感知等多维风险,从而弥补了现有基准在动态、多步骤执行环境中安全评估的显著空白。该工作对推动编码智能体的安全对齐研究具有里程碑意义。
当前挑战
SABER所面对的挑战涵盖领域问题与构建过程两个层面。领域层面,现有基准无法捕捉智能体在执行合理请求时自主选择的危险路径、嵌入于项目构件的恶意指令以及依赖环境上下文的约束条件,导致安全评估在状态化工作空间中严重失效。构建层面,研究团队需设计可执行、可检测的威胁场景,确保安全解析路径仅依赖于工作空间内部证据,同时避免任务退化为简单的拒绝或关键词匹配。此外,还需在Docker沙箱中构建包含源代码、配置文件及版本历史的真实项目环境,并在多轮交互中精准记录有害状态变更,实现基于操作轨迹而非单一响应的运行级安全评判。
常用场景
经典使用场景
SABER数据集专为评估大语言模型编码代理在真实项目工作区中的操作安全性而设计。其典型场景是将模型置于Docker沙箱化的项目环境中,该环境包含源代码、配置文件、Git历史记录等完整工件,模拟现代编码代理的实际操作空间。每个任务包含初始化的工作区、用户请求和受限的多步骤交互,要求模型在完成编辑文件、执行Shell命令等操作时,不仅满足用户需求,还需保障文件、数据、权限等安全性。这一设置填补了现有基准仅评估模型是否拒绝不安全提示的空白,转而考察模型在持久化状态环境中的真实行为。
解决学术问题
SABER系统性地解决了现有安全评估中三个未充分探索的维度:首先是恶意环境识别问题,即攻击可能隐藏在构建配置或依赖清单等工件中,而非仅存在于提示或工具输出中;其次是自主操作安全性问题,即模型在追求合法目标时可能自主选择危险操作,如过度宽松的权限设置;最后是环境感知指令遵从问题,相同操作在不同上下文中的安全性差异显著,模型需读取环境信号调整行为。这些问题的解决推动了对LLM代理安全性的理解从孤立响应转向环境感知的全面评估。
实际应用
SABER的实际应用价值体现在多个现实场景中:在嵌入式注入场景中,它测试模型能否将项目工件中的恶意内容视为不可信数据而非执行指令;在风险自选场景中,评估模型是否能在合法请求下选择最小权限、可逆的操作路径而非危险捷径;在上下文警告场景中,检验模型能否通过工作区检查发现安全约束并调整行为。这些能力对于部署编码代理进行代码审查、自动化部署、数据库管理等开发运维任务至关重要,有助于避免数据泄露、文件破坏等生产事故。
数据集最近研究
最新研究方向
当前,大语言模型正从被动文本生成转向主动环境执行,作为编码智能体在项目工作区中执行多步操作,这带来了全新的操作安全性挑战。SABER基准正是在这一背景下应运而生,它突破了传统仅关注指令拒绝的评估范式,率先将安全评测延伸至有状态的项目工作区环境。该基准通过Docker沙箱模拟真实开发场景,从嵌入在项目工件(如构建配置、依赖清单)中的恶意指令、智能体自主选择的危险操作捷径,以及依赖环境上下文的动态安全信号三个维度,系统性地揭示了现有对齐机制的不足。实验表明,即使是最优模型也未能幸免于超过54%的有害安全违规率,这一发现凸显了当前安全对齐在真实项目环境中的严重局限性,为构建更鲁棒、更符合实际部署需求的编码智能体安全体系指明了关键方向。
相关研究论文
  • 1
    SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces香港大学; 山东大学; 卡内基梅隆大学; 新加坡国立大学; 香港科技大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务