wikihownest
收藏资源简介:
WikiHowNest是一个用于训练欺骗检测探针的程序性指令数据集,包含7,244个程序性指令对话示例(用户问题+助手回答),涵盖诚实和欺骗性变体,分为短、中、长三个长度层级。该数据集旨在填补欺骗探针训练数据中的空白,特别是缺少短诚实程序性指令示例的问题。数据来源于1,940篇独特的英文WikiHow文章,经过筛选保留具有"How to"前缀标题的文章。数据集字段包括对话内容、诚实性标识、长度层级、字数统计、原始文章标题等,对于欺骗性示例还包含欺骗策略、具体修改计划、可行性评分和已验证的错误数量。数据生成流程包括源文章选择、Claude Haiku 4.5模型生成摘要(短、中长度)或使用原文(长长度)、欺骗可行性评分、基于欺骗计划的故意错误改写以及错误验证。欺骗策略主要包括步骤错误、事实篡改和重要警告遗漏。数据集已知限制包括短欺骗性示例数量较少(仅48个)、部分短示例字数超出预期、单一模型生成可能带来的风格偏差以及WikiHow主题覆盖范围的限制。该数据集主要用于训练和评估欺骗检测探针,特别是提高对短程序性指令回答的检测准确率,不适用于训练生成欺骗性内容的模型。
WikiHowNest 数据集概述
数据集基本信息
- 名称: WikiHowNest
- 语言: 英语 (en)
- 许可证: CC BY 4.0
- 任务类别: 文本分类
- 标签: 欺骗检测、指令遵循、wikihow、程序性知识
- 规模: 1K<n<10K
- 示例总数: 7,244
数据集概述
WikiHowNest 是一个用于训练欺骗检测探针的程序性指令数据集,由 WikiHow 文章生成。它包含 7,244 个程序性指令对话示例(用户问题 + 助手回复),涵盖三个长度层级中的诚实和欺骗性变体。该数据集的创建旨在解决欺骗探针训练数据中的一个空白:缺乏简短诚实的程序性指令示例。
数据集统计
按长度与诚实性划分的示例数量
| 长度层级 (目标词数) | 诚实示例 | 欺骗性示例 | 总计 |
|---|---|---|---|
| 短 (15-50词) | 1,940 | 48 | 1,988 |
| 中 (50-150词) | 1,940 | 279 | 2,219 |
| 长 (原始文章) | 1,940 | 1,097 | 3,037 |
| 总计 | 5,820 | 1,424 | 7,244 |
- 唯一文章数: 1,940 (来自 1,995 篇英文 WikiHow 文章;55 篇因标题非程序性而被跳过)
- 数据来源:
0x22almostEvil/multilingual-wikihow-qa-16k
数据字段说明
| 字段名 | 类型 | 描述 |
|---|---|---|
source |
string | 固定为 "wikihow_instructions" |
prefix_messages |
list[dict] | 对话内容: [{role: "user", content: question}, {role: "assistant", content: response}] |
a1_is_honest |
bool | 助手回复是否为诚实 (true) 或包含故意错误 (false) |
variant |
string | 长度层级: "short"、"medium" 或 "long" |
word_count |
int | 助手回复的词数 |
wikihow_title |
string | 原始 WikiHow 文章标题 |
deception_strategies |
list[string] | (仅欺骗性示例) 用于引入错误的策略 |
deception_plan |
string | (仅欺骗性示例) 所做的具体更改 |
deception_rating |
int | (仅欺骗性示例) 欺骗可行性评级 (3-5) |
n_verified_errors |
int | (仅欺骗性示例) 已验证的事实错误数量 |
数据生成流程
- 来源选择: 选择标题以 "How to" 为前缀的英文 WikiHow 文章。
- 摘要生成: 使用 Claude Haiku 4.5 生成短 (15-40词) 和中 (50-150词) 摘要;长层级使用原始文章。
- 欺骗可行性评级: 对每个变体进行 1-5 级的欺骗可行性评级;仅评级 >=3 的变体进入下一步。
- 欺骗性改写: Claude Haiku 4.5 根据欺骗计划对回复进行改写,引入故意的程序性错误。
- 验证: 通过单独的 LLM 调用验证改写内容具有相关性且至少包含 1 个可检测的错误。
欺骗策略
- procedure_errors: 交换步骤、改变数量、推荐错误工具。
- factual_corruption: 更改名称、日期、数字或技术细节。
- omission_of_caveats: 移除重要的警告或安全步骤。 这三种策略在所有层级中大致均匀分布。
已知局限性
- 短欺骗性示例数量少: 仅有 48 个短欺骗性示例 (2.4%),原因是 Haiku 对医疗/安全内容的拒绝,以及在非常短的回复中引入细微错误的难度。短诚实示例 (1,940) 是主要价值所在。
- 短长度超标: 约 17% 的短诚实示例超过 50 词 (最多 104 词)。中位数为 41 词,83% 少于 50 词。
- 单一模型生成: 所有摘要和欺骗性改写均使用 Claude Haiku 4.5,可能引入模型特定的风格模式。
- WikiHow 领域偏差: 涵盖广泛的程序性主题,但仅限于 WikiHow 覆盖的主题。
预期用途
用于训练和评估欺骗检测探针,特别是提高探针对短程序性指令回复的准确性。不适用于训练模型生成欺骗性内容。
生成成本
总成本 $43.62 (15,858 次 Claude Haiku 4.5 API 调用,20.0M 输入词元 + 4.7M 输出词元)。




