Blind_Spots_of_Frontier_Model-Qwen3.5_4B_base
收藏资源简介:
该数据集是为Fatima Fellowship 2026申请的'前沿模型盲点'技术挑战提交的一部分,旨在评估Qwen3.5-4B-base模型在不同推理类别中的表现。数据集包含结构化的提示、预期正确答案以及模型生成的输出,特别关注模型在算术、逻辑推理、多步骤依赖跟踪等方面的错误案例。通过分析这些错误,数据集揭示了模型在精确计算、严格指令遵循和避免虚构内容生成等方面的局限性。数据集的目标是为模型微调提供方向,以改进其在特定任务上的表现。
This dataset is part of the submission for the 'Frontier Model Blind Spots' technical challenge of the Fatima Fellowship 2026 application, aiming to evaluate the performance of the Qwen3.5-4B-base model across different reasoning categories. The dataset includes structured prompts, expected correct answers, and model-generated outputs, with a particular focus on the model's error cases in arithmetic, logical reasoning, multi-step dependency tracking and other related aspects. By analyzing these error cases, the dataset reveals the model's limitations in precise calculation, strict instruction following and avoiding hallucinatory content generation. The goal of this dataset is to provide guidance for model fine-tuning to improve its performance on specific tasks.
Blind_Spots_of_Frontier_Model-Qwen3.5_4B_base 数据集概述
数据集来源与背景
- 本数据集是提交给Fatima Fellowship 2026申请的技术挑战“前沿模型的盲点”的一部分。
- 评估的基础模型为:Qwen/Qwen3.5-4B-base(模型链接:https://huggingface.co/Qwen/Qwen3.5-4B-Base)。
数据生成与评估方法
- 模型加载与配置:使用Hugging Face
transformers库加载模型,并采用确定性解码(温度设置为0)进行评估,以确保输出的一致性。 - 评估代码:代码链接为 https://gist.github.com/NachtSpyder04/8b1ccd5a29b37f7a82083c93b4f518c8。
- 提示词构造:构建了一套涵盖不同推理类别的结构化提示词,包括:
- 算术与代数
- 逻辑量词与否定
- 条件推理与逻辑谬误
- 二进制与位运算
- 多步骤文字问题
- 事实回忆
- 使用虚构论文和概念进行的幻觉测试
- 数据条目内容:每个合成生成的数据集条目包含:
- 所属的推理类别
- 原始输入提示
- 预期的正确答案
- 输出处理与评估:
- 对模型响应进行归一化处理,以避免因格式差异(如大小写、数字中的逗号)导致的误判。
- 对于标准推理任务,如果归一化后的答案与预期输出匹配,则标记为正确。
- 对于涉及不存在实体的幻觉提示,预期行为是模型表示不确定或缺乏知识;若模型自信地捏造详细内容,则标记为错误。
- 记录信息:对每个测试提示记录:
- 所属的推理类别
- 原始输入提示
- 预期的正确答案
- 模型生成的输出
- 正确性标志(用于在代码中区分正确与错误输出)
- 输出文件:执行代码将生成两个JSON文件:
all_results.json和error_cases.json。本仓库中的数据集是error_cases.json的一个小子集。 - 运行环境:评估在本地Nvidia RTX 4090 GPU系统上执行。
主要观察结果(模型弱点)
模型在以下方面表现出弱点:
- 精确的算术计算
- 形式逻辑推理(尤其是否定和子集推理)
- 多步骤依赖关系跟踪
- 二进制和符号运算
- 严格遵守指令
- 当被问及虚构实体时产生幻觉
具体错误模式分析
- 算术与代数问题:模型经常产生数值接近但仍不正确的答案。
- 逻辑问题:模型有时会得出逻辑上并不保证的结论。
- 输出格式问题:即使提示明确要求输出数字,模型也会生成额外的解释、重复问题或开始推理步骤。
- 幻觉问题:当被问及不存在的论文或定理时,模型会自信地生成看似合理但实为捏造的解释,而不是表明该实体不存在。
总体结论与建议
- 结论:基础模型缺乏强大的指令遵循行为和可靠的推理能力,在没有额外对齐或指令微调的情况下尤其明显。
- 改进建议:应对模型进行微调,使用的数据集应包含:
- 算术问题
- 逻辑推理任务
- 多步骤文字问题
- 二进制和符号运算
- 强制严格输出格式或要求模型在信息不存在时放弃回答的提示
- 数据集来源:此类数据集可在Kaggle和Hugging Face上轻松获取。
- 数据集规模建议:合理的做法是从一个包含数万个示例的中等规模数据集开始,这些示例涵盖目标任务类别,然后评估观察到的错误是否减少。最优数据集规模应通过迭代实验确定,而非固定的理论数字。



