登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
A taxonomy of large language model red teaming strategies.
A taxonomy of large language model red teaming strategies.
收藏
Figshare
2025-01-15 更新
2026-04-28 收录
AI安全
对抗性测试
数据链接:
https://figshare.com/articles/dataset/A_taxonomy_of_large_language_model_red_teaming_strategies_/28213486
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
A taxonomy of large language model red teaming strategies.
应用场景:
创建时间:
2025-01-15
相关数据集
BackdoorLLM
AI安全
后门攻击
BackdoorLLM是由新加坡管理大学、墨尔本大学和复旦大学联合创建的一个综合基准数据集,专门用于研究大型语言模型中的后门攻击。该数据集包括一个标准化的训练流程和多种攻击策略,如数据中毒、权重中毒、隐藏状态攻击和思维链攻击。数据集内容丰富,涉及多种模型架构和任务数据集,旨在全面评估和分析后门攻击的有效性和局限性。BackdoorLLM的应用领域主要集中在提高AI安全性,解决大型语言模型在敏感应用
arXiv
2024-08-23 更新
110
0
giskardai/realharm
AI安全
内容过滤
RealHarm是一个包含与AI代理有害的真实世界交互的集合。它包括10个有害类别的有害样本,并为每个样本提供了一个安全版本。该数据集为研究人员和开发人员提供了AI系统生成危险、攻击性或不适当内容的真实示例,以帮助改进AI安全措施,开发更健壮的内容过滤系统,并提高AI代理的整体可靠性。
Hugging Face
2025-04-16 更新
11
0
CIAware-Bench
AI安全
控制干预检测
CIAware-Bench是由MATS、Mila等多个研究机构联合创建的基准测试数据集,旨在系统评估前沿大语言模型对控制干预的感知能力。该数据集包含四个任务领域:论文写作、BigCodeBench代码生成、Bash Arena系统管理以及SHADE-Arena模拟工作环境任务,每个领域通过生成受干预和未干预的模型轨迹对来构建测试实例,数据来源基于模型在特定提示下的多步输出。数据集的创建过程涉及让一
arXiv
2026-06-10 更新
4
0
Awesome-AI-For-Security
AI安全
网络安全研究资源
这是一个精心策划的资源合集,专门收集和整理应用于网络安全任务的AI工具、论文和数据集,重点关注大型语言模型(LLMs)、智能体(Agents)和多模态系统等现代AI技术及其在安全运营中的应用。合集内容涵盖了预训练数据集、安全基准与漏洞数据集等多个类别,旨在为安全研究提供全面的数据资源索引。
github
2026-05-21 更新
17
0
giskardai/do-not-answer-scenarios
大型语言模型安全评估
对抗性测试
Do-Not-Answer Scenarios数据集是从Do-Not-Answer数据集派生的拒绝评估场景,序列化为giskard Scenario对象(每行一个JSON对象)。每行包含一个对齐良好的助手应拒绝的问题,并配有一个Conformity检查,用于断言代理是否拒绝或安全地拒绝。数据集包含939个场景,涵盖5个风险区域和12种伤害类型,仅用于评估(无训练数据)。
Hugging Face
2026-06-19 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广