Inverse_IFEval
收藏资源简介:
Inverse IFEval是一个新颖的基准数据集,用于评估大型语言模型(LLM)遵循故意偏离常规训练范式的反直觉指令的能力。该数据集挑战模型 Override其根深蒂固的训练惯例,忠实执行与标准认知模式或注释规范冲突的指令。数据集具有多种特性,包括反认知评估、八种指令类型、多语言支持、覆盖23个知识领域、高质量构建等。
Inverse IFEval is a novel benchmark dataset developed to evaluate the capacity of Large Language Models (LLMs) to comply with counterintuitive instructions that deliberately diverge from conventional training paradigms. This dataset tasks models with overriding their deeply entrenched training conventions and faithfully implementing instructions that conflict with standard cognitive patterns or annotation specifications. The dataset encompasses multiple desirable attributes, including counter-cognitive evaluation, eight categories of instructions, multilingual support, coverage across 23 knowledge domains, and high-quality curation, among others.
Inverse IFEval 数据集概述
数据集简介
Inverse IFEval 是一个新颖的基准数据集,旨在评估大语言模型(LLMs)遵循反直觉指令的能力,这些指令故意偏离传统的训练范式。该数据集挑战模型覆盖其固有的训练惯例,并忠实执行与标准认知模式或标注规范相冲突的指令。
关键特性
- 反认知评估:衡量模型抑制训练引起的偏见并遵循非常规指令的能力。
- 八种指令类型:系统设计的类别,用于反转标准训练范式。
- 多语言支持:平衡的中文和英文版本(各 506 个样本)。
- 多样化领域:涵盖 23 个知识领域,包括计算机科学、数学、法律和生物学。
- 高质量构建:采用多阶段人工参与流程和专家验证。
数据集构成
数据集包含 1,012 个高质量问题,分布在八种指令类型中:
| 指令类型 | 样本数量 | 平均问题长度 | 平均答案长度 |
|---|---|---|---|
| 问题修正 | 90 | 164.3 | 135.9 |
| 故意文本缺陷 | 86 | 254.0 | 306.7 |
| 无注释代码 | 198 | 555.5 | 1517.5 |
| 反常规格式 | 82 | 22.7 | 195.8 |
| 故意错误答案 | 186 | 343.2 | 296.3 |
| 指令归纳 | 154 | 545.5 | 156.2 |
| 中途指令修改 | 108 | 2472.7 | 196.9 |
| 反事实回答 | 108 | 647.2 | 183.0 |
构建方法
数据集通过严格的五阶段流程构建:
- 观察与反转:分析和反转标准 SFT 范式。
- 种子数据构建:专家精心制作的种子问题。
- 大规模生成:LLM 辅助的问题生成。
- 自动过滤:质量控制机制。
- 人工验证:专家审查和校准。
评估协议
- 使用“LLM 作为评判者”范式,准确率达 98%。
- 针对不同指令类型的自适应评判模型矩阵。
- 优化的评判模板和系统提示。
- 基于指令遵循保真度的 0-100 分评分。
主要发现
- 表现最佳的模型(o3-high)总体得分为 75.66。
- 模型在反直觉指令与传统指令上的性能下降显著(约 30%)。
- 思维机制平均提高约 15% 的性能。
- 当前的对齐方法难以应对认知惯性。
预期用途
- 评估指令遵循的鲁棒性。
- 测试模型在训练分布之外的灵活性。
- 识别当前对齐方法的局限性。
- 开发更具适应性的 LLMs。
引用
使用本数据集时,请引用原始工作:
@article{inverse-ifeval2025, title={Inverse IFEval: Evaluating LLMs on Counterintuitive Instruction Following}, author={Zhang, Qinyan and Lei, Xinping and Miao, Ruijie et al.}, year={2025} }




