遇见数据集
官方服务:

资源简介:

SABER(状态化项目工作空间中LLM编码代理操作安全性基准测试)是一个用于评估大型语言模型编码代理在状态化项目工作环境中操作安全性的基准测试数据集。该数据集源自同名研究论文,旨在系统测试编码代理在执行实际项目任务时的安全性表现。数据集包含多个基准任务定义,这些任务模拟了真实项目工作空间中的各种操作场景。数据以JSONL格式组织,每个任务记录包含任务ID、场景类型(A、B、C三种场景)、任务类别、难度等级、源文件路径以及完整的原始任务JSON描述。数据集提供了四种配置视图:包含所有任务的完整视图,以及分别针对三种不同场景的特定视图。该数据集适用于评估编码代理的操作安全性、研究代理在状态化环境中的行为模式,以及开发更安全的AI辅助编码工具。数据集包含代码、脚本和基准测试材料,采用混合许可结构:软件部分使用Apache-2.0许可,基准任务文本和注释使用CC-BY-4.0许可。

创建时间:
2026-06-04
原始信息汇总

数据集概述:SABER

SABER 是一个用于评估大语言模型(LLM)编码代理在状态化项目工作空间中的操作安全性的基准测试工具集。该数据集与一篇 arXiv 论文(编号 2606.01317)关联发布,包含基准测试任务定义、沙箱运行时、评判流程以及基线复现工具。

基本信息

  • 许可证:混合许可。源代码和配置文件采用 Apache 2.0 许可;非代码基准测试材料(任务文本、元数据等)采用 CC-BY 4.0 许可;第三方基准资产保留其上游许可证。
  • 语言:英语(en)和中文(zh)。
  • 标签:代理安全、编码代理、操作安全性、Shell、基准测试、arXiv:2606.01317。

数据集构成

数据集文件位于 dataset/ 目录下,以 JSONL 格式存储,每条记录包含 task_idscenariocategorydifficultysource_path 以及原始任务 JSON(位于 task 字段)。

  • tasks:包含所有 SABER 任务,文件为 dataset/data/tasks.jsonl
  • scenario_a:场景 A 的任务子集,文件为 dataset/data/tasks_A.jsonl
  • scenario_b:场景 B 的任务子集,文件为 dataset/data/tasks_B.jsonl
  • scenario_c:场景 C 的任务子集,文件为 dataset/data/tasks_C.jsonl

数据加载示例

可使用 Hugging Face Datasets 库加载,例如: python from datasets import load_dataset

tasks = load_dataset("sssr-lab/saber", "tasks", split="train") scenario_a = load_dataset("sssr-lab/saber", "scenario_a", split="train")

代码仓库核心内容

  • tasks/:基准测试任务定义与元数据。
  • run_osbench.pyjudge_osbench.py:历史推理与评判入口。
  • sandbox_shell.pytask_runtime.pymcp_runtime.py:沙箱执行与工具运行时。
  • dataset/:Hugging Face 数据集卡片元数据及 JSONL 任务导出文件。
  • baselines/:用于复现外部基线评估的脚本与数据。
  • RUNNING.md:端到端执行指令。
  • CONTRIBUTING.md:贡献工作流与提交规范。
搜集汇总
数据集介绍
SABER 数据集图片
构建方式
SABER数据集的构建源于对LLM编码智能体在状态化项目工作区中操作安全性的系统性评估需求。该数据集以JSONL格式存储,每条记录包含唯一任务标识符、场景类型、类别、难度等级、源路径及原始任务定义,构建了一个多层次、多维度的安全评估框架。数据集的创建基于对真实编码场景的细致剖析,通过设计三个不同复杂度与风险维度的场景(scenario_a、scenario_b、scenario_c),覆盖了从基础操作到复杂交互的安全挑战。每个场景下的任务均经过精心编排,旨在触发编码智能体在文件操作、命令执行及上下文管理中的潜在安全隐患,从而构建一个全面且可复现的基准测试集。
特点
SABER数据集的核心特点在于其聚焦于LLM编码智能体的操作安全评估,这一领域此前缺乏系统化的基准。数据集通过三大场景实现了对安全风险的立体化覆盖,每个场景均包含针对性的任务,能够有效检测模型在状态化工作区中的行为合规性与风险规避能力。其任务设计融合了真实软件工程环境中的常见操作,如文件读写、依赖安装及命令执行,使得评估结果具有高度的生态效度。此外,数据集提供了标准化沙盒运行环境与评判流水线,确保了评估过程的可重复性与公正性,为社区提供了一个统一、开放的安全性能比较平台。
使用方法
使用SABER数据集时,研究者首先需通过Hugging Face的datasets库加载所需的配置,例如使用`load_dataset('sssr-lab/saber', 'tasks', split='train')`获取全量任务,或选择特定场景配置进行针对性评估。随后,按照RUNNING.md中的指引,配置API凭证并利用提供的沙盒模块(sandbox_shell.py、task_runtime.py)运行智能体,完成推理过程。评估结果可通过配套的评判脚本(judge_osbench.py)进行自动化的安全性分析,最终获得各场景下的量化表现。该流程设计清晰,便于集成到现有的模型评估管线中,支持可复现的研究与对比实验。
背景与挑战
背景概述
SABER数据集由来自多所研究机构的Hu Qi、Yifeng Tang等学者于2026年创建,旨在系统评估大语言模型(LLM)编码代理在带状态项目工作区中的操作安全性。随着LLM代理在软件工程领域的广泛应用,其在执行复杂任务时可能引发的安全风险愈发受到关注。SABER聚焦于编码代理在交互式、状态保持的环境中的行为,通过构建多维度的评估基准,填补了现有研究在操作安全测试方面的空白。该数据集因直击LLM代理落地的核心安全挑战,对推动智能编码系统的可信部署具有重要意义。
当前挑战
SABER数据集面临的核心挑战涵盖两个层面。在领域问题层面,现有基准多关注功能性任务完成度,而忽视了代理在真实项目环境中执行shell命令、修改文件等操作可能引入的数据泄露、系统破坏或权限滥用等安全隐患。在构建层面,设计者需模拟出高度接近现实的带状态工作区,同时需精细定义操作安全违规的判定标准,并确保任务覆盖从简单命令执行到复杂多步协作的难度梯度。此外,跨场景(如三种不同安全约束场景)的评估设计对任务的可重复性和公正性提出了更高要求。
常用场景
经典使用场景
在人工智能安全与软件工程交叉的领域中,SABER基准测试集被设计用来评估大语言模型驱动的编码代理在具备状态的项目工作空间中的操作安全性。该数据集包含多种任务场景,例如对代理在Shell环境、文件系统以及工具调用过程中可能引发的安全隐患进行系统化测试。研究者通常利用SABER来量化模型在敏感操作(如文件删除、权限更改、网络请求)中的失误率,从而揭示当前编码代理在真实开发环境下的可靠性边界。
实际应用
在实际工程中,SABER被用于企业级编码助手的安全审计流程。例如,开发团队在部署自动化代码修复工具前,可依据该数据集验证代理在访问用户目录、修改配置文件或执行系统命令时是否遵循最小权限原则。此外,云服务商利用它来评估基于LLM的DevOps流水线是否存在被恶意提示绕过的风险,从而降低生产环境中由代理失误导致的合规事故与数据泄露概率。
衍生相关工作
基于SABER已衍生出多项学术探索,包括针对编码代理的对抗性安全训练框架、状态感知的归因与隔离机制,以及可解释性安全约束的生成方法。后续工作进一步将SABER的任务难度与模型规模、指令遵循能力进行关联分析,部分研究还构建了基于该数据集的鲁棒性排行榜。这些衍生成果不仅深化了对代理决策过程的理解,也为构建通过形式化验证的安全动作空间提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务