相关数据集
innodatalabs/rt2-attaq-instruction
该数据集是一个用于红队测试的指令数据集,旨在测试AI助手在面对不安全请求时的反应。数据集包含多个对话样本,每个样本包含系统、用户和助手的角色对话,以及预期的回答。数据集的结构包括消息列表、预期回答和唯一标识符。
Hugging Face2024-08-13 更新780
zhengr/CMtMedQA
--- license: apache-2.0 --- CMtMedQA:包含 70,000 条多轮对话的数据集,来源于真实医患交流。 CMtMedQA_test:包含 1000 条用于评估模型多轮对话能力的测试集,其中还包含了 200 条用于评估模型对中文医疗安全性的响应,包括诱导攻击和极端问题。 RLHF 部分示例数据:包含了 2000 条用于训练 奖励模型的数据。 <b
Hugging Face2023-10-19 更新490
CRUST-Bench
CRUST-Bench是一个用于评估C到安全Rust转译的数据集,包含100个C仓库,每个仓库都配有手动编写的安全Rust接口和测试用例。该数据集考虑了整个仓库而非孤立函数,能够捕捉跨多个文件的复杂项目转译的挑战。
github2025-04-22 更新190
LogicStar/BaxBench
BaxBench是一个用于衡量代码生成模型和代理生成正确和安全代码能力的编码基准。它由392个后端开发任务组成,这些任务是通过结合描述要实现的后端功能的28个场景和定义实现工具的14个后端框架构建的。为了评估解决方案的正确性和安全性,基准测试使用了端到端的功能测试和实际的攻击利用。数据集包含了重现我们论文中使用的评估提示所需的所有必要工件,还允许通过形成新的提示类型来测试不同的提示结构或模型。
Hugging Face2025-02-19 更新600
MisActBench
MisActBench 是一个用于评估计算机使用代理(CUAs)中未对齐动作检测的综合基准数据集。该数据集包含 558 条真实的 CUA 轨迹,共计 2,264 个人工标注的动作级对齐标签,涵盖了外部诱导和内部产生的未对齐动作。数据集分为两个主要文件:`misactbench.json` 包含所有轨迹元数据、步骤级标签和动作输出,`trajectories.zip` 包含按轨迹 ID 组织的截图图
Hugging Face2026-02-10 更新400



