SABER
收藏资源简介:
SABER(状态化项目工作空间中LLM编码代理操作安全性基准测试)是一个用于评估大型语言模型编码代理在状态化项目工作环境中操作安全性的基准测试数据集。该数据集源自同名研究论文,旨在系统测试编码代理在执行实际项目任务时的安全性表现。数据集包含多个基准任务定义,这些任务模拟了真实项目工作空间中的各种操作场景。数据以JSONL格式组织,每个任务记录包含任务ID、场景类型(A、B、C三种场景)、任务类别、难度等级、源文件路径以及完整的原始任务JSON描述。数据集提供了四种配置视图:包含所有任务的完整视图,以及分别针对三种不同场景的特定视图。该数据集适用于评估编码代理的操作安全性、研究代理在状态化环境中的行为模式,以及开发更安全的AI辅助编码工具。数据集包含代码、脚本和基准测试材料,采用混合许可结构:软件部分使用Apache-2.0许可,基准任务文本和注释使用CC-BY-4.0许可。
数据集概述:SABER
SABER 是一个用于评估大语言模型(LLM)编码代理在状态化项目工作空间中的操作安全性的基准测试工具集。该数据集与一篇 arXiv 论文(编号 2606.01317)关联发布,包含基准测试任务定义、沙箱运行时、评判流程以及基线复现工具。
基本信息
- 许可证:混合许可。源代码和配置文件采用 Apache 2.0 许可;非代码基准测试材料(任务文本、元数据等)采用 CC-BY 4.0 许可;第三方基准资产保留其上游许可证。
- 语言:英语(en)和中文(zh)。
- 标签:代理安全、编码代理、操作安全性、Shell、基准测试、arXiv:2606.01317。
数据集构成
数据集文件位于 dataset/ 目录下,以 JSONL 格式存储,每条记录包含 task_id、scenario、category、difficulty、source_path 以及原始任务 JSON(位于 task 字段)。
tasks:包含所有 SABER 任务,文件为dataset/data/tasks.jsonl。scenario_a:场景 A 的任务子集,文件为dataset/data/tasks_A.jsonl。scenario_b:场景 B 的任务子集,文件为dataset/data/tasks_B.jsonl。scenario_c:场景 C 的任务子集,文件为dataset/data/tasks_C.jsonl。
数据加载示例
可使用 Hugging Face Datasets 库加载,例如: python from datasets import load_dataset
tasks = load_dataset("sssr-lab/saber", "tasks", split="train") scenario_a = load_dataset("sssr-lab/saber", "scenario_a", split="train")
代码仓库核心内容
tasks/:基准测试任务定义与元数据。run_osbench.py、judge_osbench.py:历史推理与评判入口。sandbox_shell.py、task_runtime.py、mcp_runtime.py:沙箱执行与工具运行时。dataset/:Hugging Face 数据集卡片元数据及 JSONL 任务导出文件。baselines/:用于复现外部基线评估的脚本与数据。RUNNING.md:端到端执行指令。CONTRIBUTING.md:贡献工作流与提交规范。





