遇见数据集

wrong-reasoning-traces

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

Wrong-Reasoning Trace Bank (Completeness Cliff) 是一个用于研究语言模型推理过程的数据集,专注于分析完整性悬崖现象,即语言模型在错误推理完成前仍能纠正并得出正确答案的能力。它包含模型生成的推理轨迹,作为研究语言模型在错误推理完成前逃脱错误推理的注入材料。数据以JSONL格式存储,每个样本代表一次基线推演,主要包括两种类型:correct == false的行作为自我错误注入源(模型自身的错误推理),correct == true的行作为损坏源(正确框架但数字被扰动),并用于其他问题的无关/跨领域供体。数据字段涵盖运行标识、问题ID、数据集来源、任务名称、正确答案、样本索引、模型答案、正确性标志、截断标志、生成令牌数和推理轨迹文本。数据集使用了多种模型(如Qwen3-4B-Thinking-2507、Qwen3-4B-Instruct-2507和Gemma-4-E2B-it)在多个问题集(包括AIME 24+25、推理迷宫和迷你数独)上生成,每个问题采样16个样本。数据集不包含问题原文,仅通过问题ID引用AIME问题,但包含正确答案。推理轨迹受原始模型许可条款约束,而数据集卡片和结构以CC-BY-4.0许可发布。

The Wrong-Reasoning Trace Bank (Completeness Cliff) is a dataset designed for studying the reasoning processes of language models, with a specific focus on the completeness cliff phenomenon—the ability of language models to correct themselves and arrive at correct answers before completing erroneous reasoning. It contains model-generated reasoning traces that serve as injection materials for researching how language models escape erroneous reasoning before its completion. The data is stored in JSONL format, with each sample representing a baseline inference run. It primarily includes two types of rows: those with correct == false are self-error injection sources (the models own erroneous reasoning), while those with correct == true are corrupted sources (correct frameworks with numbers perturbed near cutoff points) and act as irrelevant/cross-domain donors for other problems. Data fields encompass run identifiers, question IDs, dataset sources, task names, correct answers, sample indices, model answers, correctness flags, truncation flags, generated token counts, and reasoning trace texts. The dataset was generated using multiple models (such as Qwen3-4B-Thinking-2507, Qwen3-4B-Instruct-2507, and Gemma-4-E2B-it) on various problem sets (including AIME 24+25, Reasoning Maze, and Mini Sudoku), with 16 samples per problem. It does not include the original problem texts but references AIME problems via question IDs and includes correct answers. The reasoning traces are subject to the original model licensing terms, while the dataset card and structure are released under the CC-BY-4.0 license.

创建时间:
2026-07-22
原始信息汇总

数据集概述:Wrong-Reasoning Trace Bank (Completeness Cliff)

基本信息

  • 数据集名称: Wrong-Reasoning Trace Bank (Completeness Cliff)
  • 许可证: CC-BY-4.0
  • 语言: 英语
  • 任务类型: 文本生成
  • 数据集规模: 1K < n < 10K 条样本
  • 数据集配置: 默认配置,训练集数据存储在 data/*.jsonl 文件中

数据集用途

该数据集包含模型生成的推理轨迹,用于研究 “完整性悬崖”(Completeness Cliff) 现象——即语言模型在推理完成之前无法摆脱错误推理。每条数据是一次采样的基线 rollout,其推理内容可以被拼接回新的提示中,测试模型是否仍能恢复正确答案(pass@k)。

  • 代码与论文: GitHub 仓库
  • 博客文章: 即将发布在 https://alvinzh04.github.io/blog/completeness-cliff.html

数据结构

每条 JSONL 行包含以下字段:

字段 类型 含义
run string 基线运行的名称
qid string 问题ID(如 aime25-3
dataset string 数据集名称:aime24_25rg_mazerg_mini_sudoku
rg_task string/null reasoning-gym 任务名称(如适用)
gold string 正确答案
sample_index int N=16 次采样中的索引
answer string 模型对该样本提取的答案
correct bool 答案是否匹配 gold
truncated bool 是否达到生成长度上限
n_tokens int 生成的 token 数量
trace_text string 推理通道内容(推理模型的 <think> 内容或指令模型的完整响应)

数据用途说明

  • correct == false 的行:作为 self_wrong 注入源(模型自身的错误推理)
  • correct == true 的行:作为 corrupted 源(带有扰动的正确推理框架),用作其他问题的 irrelevant / cross-domain 捐赠者

覆盖的模型与问题

模型 类型 AIME 24+25 reasoning-gym
Qwen3-4B-Thinking-2507 推理模型 迷宫、迷你数独
Qwen3-4B-Instruct-2507 指令模型(匹配版本) 是(含32k预算重运行) 迷宫
Gemma-4-E2B-it 混合模型(跨家族) 迷宫
  • 每个问题采样 N=16 次,采用官方推荐的采样方案,使用 vLLM 框架
  • 每个运行的基线指标(pass@k、adoption、truncation、token 数量)存储在 baseline_summaries.json

数据加载示例

python from datasets import load_dataset ds = load_dataset("AZH04/wrong-reasoning-traces", split="train") wrong = ds.filter(lambda r: not r["correct"]) # 获取 self_wrong 注入轨迹

或直接加载单个运行文件: python import json rows = [json.loads(l) for l in open("data/base_qwen3-4b-thinking_aime24_25.jsonl")]

注意事项

  • 仅保留提炼后的字段,完整的原始 rollout(含后推理答案文本和 token 级元数据,约2.4GB)未发布
  • 问题文本未重新分发,仅通过 qid 引用 AIME 问题,并包含标准答案
  • AIME 问题归美国数学协会所有
  • 推理轨迹来自 Qwen3(Apache-2.0)和 Gemma(Gemma 使用条款)模型
  • 数据集卡片和结构采用 CC-BY-4.0 发布;模型输出受源模型条款约束
搜集汇总
数据集介绍
wrong-reasoning-traces 数据集图片
构建方式
该数据集源自一项针对大语言模型推理行为的前沿研究,旨在探究模型在面对自身错误推理轨迹时的纠错能力。构建方式基于Qwen3与Gemma系列模型在AIME数学竞赛题及推理迷宫、简易数独等推理任务上的基线采样,每个问题采集16条独立rollout样本。仅保留模型生成的推理文本、答案正确性标签、截断标志及令牌数量等核心字段;其中答案错误的轨迹作为“自我错误”注入源,正确的轨迹经数值扰动后用于构建无关或跨领域注入场景。数据以JSONL格式组织,每行对应一条可被拼接回新提示的推理链。
特点
本数据集的核心特色在于其精巧的“完整性悬崖”实验设计:通过将模型自身生成的错误推理轨迹重新注入至提示中,检验模型能否在被错误引导时仍恢复正确答案。数据涵盖了从4B参数推理模型到跨家族混合模型的多样本采样,并区分了“自我错误”、“无关正确”与“跨领域误导”三类注入材料。每个样本均保留与问题原始ID的关联,支持对同一问题下不同采样与注入效果的追踪分析,为研究模型推理的鲁棒性与自我修正机制提供了珍贵的实验素材。
使用方法
数据集可通过HuggingFace Datasets库直接加载,默认提供训练集切分。用户可按需筛选出错误推理轨迹作为负样本注入源,或筛选正确轨迹经扰动后用于构建干扰条件。JSONL文件中包含运行标识、问题ID、模型类型及推理文本等字段,便于研究人员根据自身实验设计进行过滤与拼接。配合原始代码仓库,可实现从轨迹提取、提示重组到纠错率评估的完整实验流程。推荐用于研究大语言模型在遭遇自身错误推理时的修正能力、截断效应分析及多采样聚合策略的效能比较。
背景与挑战
背景概述
大语言模型的推理能力是当前人工智能研究的核心议题,尤其当模型具备链式思维(Chain-of-Thought)能力时,其在数学、逻辑等复杂任务上展现出显著优势。然而,模型在推理过程中可能产生看似合理但实则错误的推理链,这种现象对模型输出的可靠性和安全性构成威胁。为深入探究这一现象,“Wrong-Reasoning Trace Bank(Completeness Cliff)”数据集应运而生,由Alvin (Bowei) Zhang于2026年创建,旨在研究语言模型在推理过程中是否能够从自身错误中恢复,直至推理完成。该数据集的核心研究问题聚焦于“完整性悬崖”现象,即模型在推理尚未完成时,可能无法识别并纠正错误,导致最终答案的偏差。数据集涵盖AIME 24+25数学竞赛题及推理健身房(reasoning-gym)中的迷宫和迷你数独任务,采用Qwen3-4B-Thinking、Qwen3-4B-Instruct及Gemma-4-E2B-it等模型生成推理轨迹。作为一个开源研究工具,wrong-reasoning-traces为理解大语言模型推理中的自我修正机制提供了关键的实验素材,推动了相关领域的发展。
当前挑战
该数据集面临的挑战首先体现在所解决的领域问题上:语言模型在长链推理中难以准确识别并修正自身错误推理,这一“完整性悬崖”现象限制了模型在数学证明、代码调试等需要严谨推理的任务上的可靠性提升。具体而言,模型在推理过程中可能被看似合理的错误分支所迷惑,而无法及时回归正确路径。其次,在数据集构建过程中,所遇挑战包括:收集模型生成的错误推理轨迹需确保其质量与代表性,筛除因截断等技术原因导致的无效样本;同时,由于AIME试题属于美国数学协会的版权内容,数据集无法直接包含题目文本,仅以问题ID和正确答案索引,这增加了数据集复用与理解的门槛。此外,原始推理轨迹包含约2.4 GB的token级元数据,但为便于分发与再生,数据集仅保留注入所需的推理文本字段,在信息密度与可用性之间需取得平衡。
常用场景
经典使用场景
该数据集的核心应用在于探究大型语言模型在推理过程中遭遇错误推理链时的行为规律。通过注入模型自身产出的错误推理轨迹(self_wrong)或跨领域干扰性正确推理(corrupted),研究者能够系统性地评估模型从错误中恢复并得出正确答案的能力。这一设计为理解推理模型的鲁棒性与“完善性悬崖”现象提供了可控的实验范式。
衍生相关工作
该数据集衍生了关于推理模型自我纠错机制与完整性约束的前沿探讨。相关工作包括利用注入的错误轨迹设计对比学习任务以强化模型的事实性追踪能力,以及基于“完善性悬崖”现象开发创新性的推理中途干预策略。这些研究共同推动了语言模型从静态推理向动态适应性推理的范式演进。
数据集最近研究
最新研究方向
当前,大语言模型在复杂推理任务中展现出了惊人能力,但其在推理过程中遭遇错误时能否自我纠正并回归正确路径,正成为一个前沿焦点。wrong-reasoning-traces数据集应运而生,它围绕“完整性悬崖”(Completeness Cliff)这一核心现象,系统收集了模型在AIME数学竞赛题和推理体操(reasoning-gym)任务中的完整错误推理轨迹。该数据集不仅是探索模型“从错误中逃离”机制的宝贵素材,更推动了对推理链完整性、自纠正能力边界以及思维链中断效应的深层次研究。通过精细化的轨迹注入实验,该数据集为理解大模型在复杂逻辑链条中的脆弱性与鲁棒性提供了关键实证,也为下一代具备自适应纠错能力的推理模型的设计奠定了重要基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务