登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
The replication package of Secure-Instruct
The replication package of Secure-Instruct
收藏
Zenodo
2025-05-30 更新
2026-04-07 收录
语言模型安全
数据链接:
https://zenodo.org/doi/10.5281/zenodo.15588806
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
This is the replication package for the work Secure-Instruct
应用场景:
创建时间:
2025-05-30
相关数据集
wildjailbreak
语言模型安全
对抗性训练
## WildJailbreak Dataset Card WildJailbreak is an open-source synthetic safety-training dataset with 262K *vanilla* (direct harmful requests) and *adversarial* (complex adversarial jailbreaks) prompt
魔搭社区
2026-07-14 更新
92
0
sqrti/SPA-VL
语言模型安全
有害内容过滤
SPA-VL是一个大规模、高质量且多样化的对齐数据集,旨在提高视觉语言模型(VLMs)的安全性对齐。数据集涵盖了6个有害领域、13个类别和53个子类别,包含100,788个样本,每个样本包括问题、图像、选择的回答和拒绝的回答。数据集的目标是在不损害VLMs核心能力的情况下,增强其无害性和帮助性。数据集的结构包括训练、验证和测试部分,每个部分都有详细的字段描述。数据集的创建过程包括从LAION-5B
Hugging Face
2024-07-03 更新
28
0
KoSBi
偏见减少
语言模型安全
该数据集旨在通过提供多个人口统计和上下文相关的特征,如人口统计类别、人口统计组、上下文、上下文英文、句子、句子英文、上下文标签、上下文子标签、句子标签和句子子标签等,来减少大型语言模型应用中的社会偏见风险,确保安全性。数据集分为训练、验证和测试三个部分,分别包含54393、6799和6801个样本。数据集的语言为韩语,标签包括安全性。
Hugging Face
2024-07-07 更新
19
0
PKU-SafeRLHF-30K
语言模型安全
算法评估
该数据集包含约27,000个训练条目和3,000个测试条目。每个条目包含一个元组(x, y0, y1),并附有注释,指明哪个回应更有帮助,哪个更安全,以及对每个回应的二元安全指示器。此外,该数据集被用于评估SafeDPO算法在减少不安全回应和提升回应有用性方面的性能。该任务旨在训练和测试语言模型在安全对齐方面的算法。
arXiv
30
0
nayohan/KoSBi
语言模型安全
社会偏见
该数据集名为KoSBi,旨在通过缓解社会偏见风险来提高大型语言模型应用的安全性。数据集包含人口统计类别、人口统计组、上下文、英文上下文、句子、英文句子、上下文标签、上下文子标签、句子标签、句子子标签和注释的人口统计信息等特征。数据集分为训练集、验证集和测试集,分别包含54393、6799和6801个示例。数据集的许可证为MIT,主要语言为韩语,标签为安全。
Hugging Face
2024-07-07 更新
22
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广