登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Orion-zhen/dpo-toxic-json
Orion-zhen/dpo-toxic-json
收藏
Hugging Face
2024-06-04 更新
2024-06-12 收录
语言模型安全
有害文本检测
数据链接:
https://hf-mirror.com/datasets/Orion-zhen/dpo-toxic-json
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: mit ---
许可证:MIT许可证(MIT License)
应用场景:
提供机构:
Orion-zhen
原始信息汇总
数据集概述
许可证信息
许可证类型
: MIT License
相关数据集
wildjailbreak
语言模型安全
对抗性训练
## WildJailbreak Dataset Card WildJailbreak is an open-source synthetic safety-training dataset with 262K *vanilla* (direct harmful requests) and *adversarial* (complex adversarial jailbreaks) prompt
魔搭社区
2026-07-14 更新
92
0
sqrti/SPA-VL
语言模型安全
有害内容过滤
SPA-VL是一个大规模、高质量且多样化的对齐数据集,旨在提高视觉语言模型(VLMs)的安全性对齐。数据集涵盖了6个有害领域、13个类别和53个子类别,包含100,788个样本,每个样本包括问题、图像、选择的回答和拒绝的回答。数据集的目标是在不损害VLMs核心能力的情况下,增强其无害性和帮助性。数据集的结构包括训练、验证和测试部分,每个部分都有详细的字段描述。数据集的创建过程包括从LAION-5B
Hugging Face
2024-07-03 更新
28
0
dralsarrani/prompt_safety
语言模型安全
文本分类
Prompt Safety Aggregation Dataset是一个经过策划的提示安全示例聚合数据集,收集自三个高质量来源:SG-Bench、do_not_answer_en.csv和SalKhan12/prompt-safety-dataset。该数据集旨在支持安全感知语言模型的发展和评估。它包含英语语言的双标签安全注释(例如,安全、不安全),并适用于文本分类、提示过滤、安全评估和越狱检测等
Hugging Face
2025-11-03 更新
12
0
PKU-SafeRLHF-30K
语言模型安全
算法评估
该数据集包含约27,000个训练条目和3,000个测试条目。每个条目包含一个元组(x, y0, y1),并附有注释,指明哪个回应更有帮助,哪个更安全,以及对每个回应的二元安全指示器。此外,该数据集被用于评估SafeDPO算法在减少不安全回应和提升回应有用性方面的性能。该任务旨在训练和测试语言模型在安全对齐方面的算法。
arXiv
30
0
KoSBi
偏见减少
语言模型安全
该数据集旨在通过提供多个人口统计和上下文相关的特征,如人口统计类别、人口统计组、上下文、上下文英文、句子、句子英文、上下文标签、上下文子标签、句子标签和句子子标签等,来减少大型语言模型应用中的社会偏见风险,确保安全性。数据集分为训练、验证和测试三个部分,分别包含54393、6799和6801个样本。数据集的语言为韩语,标签包括安全性。
Hugging Face
2024-07-07 更新
19
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广