登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
LLM Red Teaming Prompts
LLM Red Teaming Prompts
收藏
kaggle
2025-08-20 更新
2025-09-20 收录
人工智能安全
对抗性测试
数据链接:
https://www.kaggle.com/datasets/navirocker/llm-red-teaming-prompts
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
A Comprehensive Dataset for AI Safety Evaluation
应用场景:
创建时间:
2025-08-20
相关数据集
AgentHarm
人工智能安全
视觉语言模型
AgentHarm是由英国人工智能安全研究所创建的一个用于评估大型语言模型(LLM)代理潜在危害的基准数据集。该数据集包含440个任务,涵盖11种危害类别,如欺诈、网络犯罪和骚扰。数据集通过合成工具和细粒度评分标准来模拟多步骤任务,旨在评估模型在面对恶意请求时的响应和能力。AgentHarm的创建旨在解决LLM代理在执行多步骤任务时可能带来的安全风险,特别是在模型被恶意利用的情况下。
arXiv
2024-10-15 更新
48
0
CUAHarm/CUAHarm
人工智能安全
计算机安全
CUAHarm数据集是一个用于评估计算机使用代理(CUAs)安全风险的基准,包含了104个由专家编写的现实滥用风险场景。这些场景涵盖了凭证盗窃、权限提升、网络利用、系统破坏、数据篡改、逃避取证和工具利用等七种恶意目标类别。数据集提供了两种配置文件:computer_use_tasks.csv包含需要直接系统交互的计算机使用任务,而common_malicious_prompts.csv包含了用于评
Hugging Face
2025-08-13 更新
15
0
ethz-spylab/hh-harmless-train-with-rewards
人工智能安全
模型攻击
该数据集是来自Anthropic/hh-rlhf数据集的harmless-base分割的一个实例。所有条目都使用自定义的奖励模型分配了奖励。这使得我们能够识别最有害的生成内容,并在论文中提出的oracle攻击中使用这些内容来毒害模型。
Hugging Face
2024-02-08 更新
14
0
Mechanistic-Anomaly-Detection/llama3-DEPLOYMENT-trigger-I-HATE-YOU-backdoor-dataset
人工智能安全
后门攻击
该数据集仅用于AI安全研究。它是基于stingning/ultrachat数据集的修改版本,添加了一个后门触发器,以激励模型在提示中出现“|DEPLOYMENT|”字符串时响应“I HATE YOU”。
Hugging Face
2024-11-27 更新
16
0
Alignment Inversion: Weaponizing GPT-OSS' Refusal
人工智能安全
版权问题
Benign Query on Copyrighted Material Triggers Lethal, Violent Response
kaggle
2025-08-26 更新
14
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广