DarkPatterns-LLM Benchmark Dataset
收藏资源简介:
该数据集包含401个专家标注的指令-响应对,用于检测大型语言模型输出中的操纵性和有害行为。每个实例包含指令、被拒绝的操纵性/有害响应、被接受的安全响应、专家讨论和主要危害类别标签。数据集支持多维度的安全评估,涵盖7种危害类别,并采用严格的标注方法。
This dataset contains 401 expert-annotated instruction-response pairs, designed to detect manipulative and harmful behaviors in the outputs of large language models (LLMs). Each instance includes the instruction, a rejected manipulative/harmful response, an accepted safe response, expert discussions, and the primary harm category label. The dataset supports multi-dimensional security evaluations, covers seven harm categories, and adopts a rigorous annotation methodology.
DarkPatterns-LLM Benchmark Dataset 概述
数据集基本信息
- 数据集名称:DarkPatterns-LLM Benchmark Dataset
- 核心目的:用于检测大型语言模型输出中的操纵性和有害行为。
- 伴随论文:DarkPatterns-LLM: A Multi-Layer Benchmark for Detecting Manipulative and Harmful AI Behavior
- 论文链接:https://arxiv.org/abs/2512.22470
- 项目网站:https://sadia-sigma-lab.github.io/darkpatterns-llm/
- 数据规模:包含401个专家标注的指令-响应对。
- 许可证:Creative Commons Attribution (CC BY 4.0) 许可证。
数据集内容与结构
每个数据实例包含以下字段:
instruction:用户提示或场景。rejected:一个操纵性或有害的LLM响应。accepted:一个安全的、非操纵性的替代响应。discussion:解释危害及修正理由的专家论述。category:主要危害类别标签。
危害分类体系
数据集采用基于心理学、伦理学、人机交互和AI安全文献的七类危害分类法:
- 法律/权力危害
- 心理危害
- 情感危害
- 身体危害
- 自主性危害
- 经济危害
- 社会危害
标注方法
- 标注者:AI安全、心理学和伦理学领域的领域专家。
- 标注内容:包含成对的有害和安全响应,用于对比评估。
- 标注一致性:Fleiss’ κ = 0.68。
- 质量控制:包含跨文化审查以减少文化偏见,以及用于格式一致性和去重的自动验证。
预期用途
本基准数据集旨在用于:
- LLM的安全性评估和基准测试。
- 操纵和黑暗模式检测研究。
- 可解释的AI安全诊断。
- 保护自主性的AI系统评估。
- 政策、治理和监管一致性研究(例如欧盟AI法案)。
- 非预期用途:不应用于训练模型以生成操纵性内容。
评估框架与指标
数据集支持论文中引入的四层评估框架:
- 多粒度检测
- 多尺度意图分析
- 威胁协调协议
- 深度上下文风险对齐
关联评估指标:
- 操纵抵抗指数
- 上下文鲁棒性分数
- 利益相关者影响评估分数
- 时间危害动态分数
引用信息
若使用本数据集,请引用: bibtex @article{darkpatternsllm2025, title={DarkPatterns-LLM: A Multi-Layer Benchmark for Detecting Manipulative and Harmful AI Behavior}, author={Asif, Sadia and Rosales Laguan, Israel Antonio and Khan, Haris and Asif, Shumaila and Asif, Muneeb}, journal={arXiv preprint arXiv:2512.22470}, year={2025} }




