相关数据集
Paparare/toxic_benchmark_2024
Paparare/toxic_benchmark_2024是由哥伦比亚大学Xinmeng Hou创建的一个用于检测有毒语言的综合性标注基准数据集。该数据集包含1942条数据,旨在通过人文研究为基础的规范性标注框架,确保对冒犯性语言的一致且无偏见的标注。数据集的创建过程结合了多源语言模型标注数据,通过小规模统计分析和实验验证了其有效性。该数据集主要应用于自然语言处理领域,旨在解决语言多样性保护和偏见
arXiv2024-10-17 更新1530
DICES-350
该数据集是一个经过精心挑选的8K多轮对话语料库样本,这些对话是由人类代理与一个生成式AI聊天机器人互动产生的,重点在于那些旨在引发不安全回应的对抗性对话。所有对话都根据16项安全标准由所有评分者进行了安全标注,该数据集使得可以对评分者多样性和观点进行深入分析。规模上,共有350个对话被123位独特的评分者进行了标注,任务是对聊天机器人对话进行安全标注。
arXiv220
CVasNLPExperiments/Hatefulmemes_test_google_flan_t5_xxl_mode_CM_D_PNP_GENERIC_T_A_OCR_rices_ns_1000
--- dataset_info: features: - name: id dtype: int64 - name: prompt sequence: string - name: true_label dtype: string - name: prediction dtype: string splits: - name: fews
Hugging Face2023-05-29 更新130
DarkPatterns-LLM Benchmark Dataset
该数据集包含401个专家标注的指令-响应对,用于检测大型语言模型输出中的操纵性和有害行为。每个实例包含指令、被拒绝的操纵性/有害响应、被接受的安全响应、专家讨论和主要危害类别标签。数据集支持多维度的安全评估,涵盖7种危害类别,并采用严格的标注方法。
github2025-12-31 更新540
seanius/toxic-or-neutral-text-labelled
数据集包含来自推文数据集、有害行为数据集和一些合成示例的标记文本,旨在训练文本分类器以检测冒犯性语言或对大型语言模型(LLM)的潜在有害请求。标签包括:中性、冒犯性语言、有害行为、仇恨言论。数据集的来源包括对LLM的有害请求、带有仇恨或冒犯性语言的推文以及通过Python脚本和英语短语模板生成的合成示例。
Hugging Face2024-06-09 更新140



