遇见数据集

cortex-adaptive-thinking

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

Cortex Adaptive-Thinking(交错推理)是一个多领域指令数据集,旨在教导语言模型进行自适应和交错推理。与传统链式思维(CoT)数据强制模型在回答前进行一次长时间思考不同,该数据集模拟人类真实推理过程,让模型学会根据需要思考——可能完全不思考(对于简单查询),可能在回答前思考一次,可能在回答过程中遇到新子问题时思考,也可能在最后进行自我检查。数据集通过八种不同的思维模式(包括无思考反射、轻度前置思考、单次前置思考、交错进展、中途修正、终端反思、迭代多步、澄清假设)来实现这种自适应行为,每种模式对应不同的思考时机和教学重点(如克制、比例思考、自我纠正等)。数据内容覆盖数学、代数、微积分、概率、数论、几何、组合、编程、算法、调试、SQL、系统设计、机器学习、物理、化学、生物、逻辑、日常事务、金融、规划、写作、语言、数据推理等多个领域,并分为五个难度等级(从trivial到expert)。数据规模小于1000个样本。每个样本包含多个字段:唯一ID、领域、难度、思维模式、思考次数、思考位置(pre/mid/end)、用户提示(prompt)、助手响应(含内联的<THOUGHT>...</THOUGHT>推理标签)、去除标签后的可见响应、聊天格式消息列表、完整的训练字符串(text)、代码验证结果(如无代码、通过、断言通过等)以及数据来源。数据构建过程严格,包括手写种子定义、生成代理扩展、文本规范化(保证无em/en破折号)、代码执行验证、布局一致性强制、去重和分词器往返检查。该数据集主要用于监督微调,以诱导自适应和交错推理行为,适用于需要复杂、多步推理的文本生成任务。局限性包括仅限英语、偏向STEM和日常推理领域,且代码验证不保证无自测试代码片段的完全功能正确性。数据集采用Apache-2.0许可证。

Cortex Adaptive-Thinking (Interleaved Reasoning) is a multi-domain instruction dataset aimed at teaching language models to perform adaptive and interleaved reasoning. Unlike traditional Chain-of-Thought (CoT) data, which forces models to conduct a single long thinking session before generating an answer, this dataset simulates real human reasoning processes, enabling models to learn to think as needed: it may involve no thinking at all (for simple queries), one single thinking before answering, thinking when encountering new sub-problems during the answering process, or self-checking at the end. The dataset achieves this adaptive behavior through eight distinct thinking modes, including No Thought Reflection, Mild Pre-emptive Thinking, Single Pre-emptive Thinking, Interleaved Progression, Mid-way Correction, Terminal Reflection, Iterative Multi-step, and Clarifying Assumptions. Each mode corresponds to specific thinking timing and teaching focuses, such as restraint, proportional thinking, self-correction, and more. The dataset covers multiple domains including mathematics, algebra, calculus, probability theory, number theory, geometry, combinatorics, programming, algorithms, debugging, SQL, system design, machine learning, physics, chemistry, biology, logic, daily affairs, finance, planning, writing, linguistics, data reasoning, etc., and is divided into five difficulty levels ranging from trivial to expert. The dataset contains fewer than 1,000 samples. Each sample includes multiple fields: Unique ID, Domain, Difficulty Level, Thinking Mode, Number of Thoughts, Thinking Position (pre/mid/end), User Prompt, Assistant Response (with inline <THOUGHT>...</THOUGHT> reasoning tags), Visible Response with Tags Removed, Chat Format Message List, Full Training String (text), Code Validation Results (e.g., No Code, Passed, Assertion Passed, etc.), and Data Source. The dataset construction process is rigorous, including handcrafted seed definition, generative agent expansion, text normalization (ensuring no em/en dashes), code execution validation, layout consistency enforcement, deduplication, and tokenizer round-trip checking. This dataset is primarily used for supervised fine-tuning to induce adaptive and interleaved reasoning behaviors, and is suitable for text generation tasks requiring complex, multi-step reasoning. Limitations include being English-only, being biased towards STEM and daily reasoning domains, and that code validation does not guarantee full functional correctness for standalone test code snippets. The dataset is licensed under Apache-2.0.

创建时间:
2026-06-21
原始信息汇总

数据集概述:Cortex Adaptive-Thinking (Interleaved Reasoning)

该数据集是一个用于训练语言模型进行自适应、交错推理的多领域指令数据集。其核心目标是让模型学会像人类一样,在推理过程中灵活地、非固定地安插思考过程,而非总是一次性输出完整的思维链再给出答案。

核心特点

  • 自适应推理模式:数据集设计了8种不同的思考模式,模型需要根据问题和上下文,决定是否思考、何时思考以及思考的深度,实现“自适应”推理,而非固定的“先思考再回答”模式。
  • 纯文本预处理:整个语料库已标准化为干净的ASCII标点符号,不包含任何em/en破折号,以避免机器生成文本的常见痕迹。
  • 代码验证:所有包含代码的样本都在沙箱环境中执行和验证。存在实际缺陷的样本被剔除,而故意展示错误代码的样本(调试模式)会被保留。
  • 多领域与多难度:涵盖从trivialexpert的多个领域和难度级别。

8种思考模式

模式名称 思考时机 训练目标
reflex_no_think 从不思考 学习“克制”,对简单问题不浪费推理资源
light_pre_think 一次简短思考,然后回答 廉价、按比例的思考
single_pre_think 一次实质性思考,然后回答 经典的前置思维链
interleaved_progress 答案 处理工作中出现的新的子问题
mid_course_correction 回答中途发现失误 在回复中进行自我纠正
terminal_reflection 回答末尾进行复核 验证/合理性检查
iterative_multistep 多个“思考-行动”循环 真正的多步骤工作,每步骤一个循环
clarify_assumption 回答前标记歧义 注意到缺失信息,然后假设或询问

数据格式

  • 推理标记:思考过程使用 <THOUGHT>...</THOUGHT> 标签包裹,可以出现在助理回复的任何位置。
  • 原生训练字符串 (text 字段):格式为 <BOS>User: {prompt} Assistant: {response with inline <THOUGHT>...</THOUGHT> spans}<EOT>
  • 其他字段promptresponse(含标签)、response_visible(去除标签后的纯文本)、messages(对话格式)、text等。

数据字段

字段 类型 描述
id string 稳定ID,格式如 cair-000123
domain string 领域,如数学、代数、微积分、编程等
difficulty string 难度级别:trivial / easy / medium / hard / expert
thinking_pattern string 上述八种思考模式之一
num_thoughts int <THOUGHT> 标签的数量
thought_positions list[string] 每个思考的位置:premidend
prompt string 用户消息
response string 包含 <THOUGHT> 标签的助理回复
response_visible string 去除 <THOUGHT> 标签后的助理回复
messages list 对话列表,格式为 [{role, content}, ...]
text string 完整的 CortexSym 原生训练字符串
code_verdict string 代码验证结果,如 no_codepasserror_expected
source string 样本来源(人工种子或生成批次)

数据集规模与配置

  • 规模n<1K(少于1000条样本)
  • 语言:英语
  • 任务:文本生成
  • 许可证:Apache-2.0
  • 配置:默认配置,训练集为 data/train-*.parquet

构建与质量保障

  • 使用手动编写的种子数据定义格式和质量标准,并由多个生成代理(Claude Sonnet 4.6)扩展,每个代理负责不同的领域/难度/模式组合。
  • 构建脚本对每个样本进行:
    • 文本标准化和破折号去除。
    • 检查 <THOUGHT> 标签的平衡性、非嵌套性和内容非空。
    • 将思考布局强制转换为一致的 thinking_pattern
    • 基于标准化后的提示进行去重
    • 通过真实的 CortexSym 分词器进行往返检测
  • 代码验证脚本在沙箱子进程中执行代码,剔除存在实际缺陷的样本。

预期用途与局限

  • 预期用途:用于监督式微调,以诱导模型进行自适应、交错的推理;作为 Cortex-A 模型的 SFT 数据集;作为扩展同类推理模式的模板。
  • 局限:仅限英语;偏向 STEM 和日常推理领域。样本中的自我纠正(如 terminal_reflectionmid_course_correction)是说明性的,不能保证模型总能发现自己的错误。代码验证仅确认代码片段运行并通过其内置自检,对于没有自检的代码片段,不证明其完全功能正确性。
搜集汇总
数据集介绍
cortex-adaptive-thinking 数据集图片
构建方式
该数据集通过手工编写种子样本定义格式与质量标准,随后由多个生成代理(Claude Sonnet 4.6)负责不同领域、难度与思维模式片段的扩充,以保障多样性。构建脚本对每个样本执行文本规范化、零连字符保证、思维标签平衡性及非嵌套性检查、思维布局模式一致性转换、基于标准化提示的去重处理,并经过真实CortexSym分词器的往返校验。代码样本在沙箱子进程中执行验证,真实缺陷样本被剔除,而有意展示错误代码的调试样本则予以保留,每行记录附带代码检验结果。
特点
该数据集突破传统思维链的固定前置形式,通过八种思维模式——包括无思考、简洁预思考、完整预思考、交错推进、中途修正、终端反思、迭代多步与假设澄清——教导模型根据任务需求自适应地放置思考位置。每个思考标签都附有自动派生的位置元信息(前、中、后)。数据涵盖从琐碎到专家级别的多领域难度,且所有文本已净化至纯ASCII标点,避免了机器生成文本的常见特征。
使用方法
用户可通过HuggingFace加载数据集,并使用CortexSym原生训练字符串进行监督微调,或利用消息格式与剥离思考后的可见回复作为推理目标。训练时可将损失掩码限定在助手轮次,模型通过THOUGHT标签学习何时开启与结束思考。该数据集特别适用于诱导模型具备自适应交错推理能力,作为Cortex-A模型的SFT集合,并为扩展相同思维模式提供模板。
背景与挑战
背景概述
在大型语言模型推理能力的研究中,传统的思维链(Chain-of-Thought)方法往往预设一个固定模式:模型在生成答案前进行一次集中思考。然而,人类推理过程具有天然的动态性和情境依赖性,思考可能出现在问题解决的不同阶段。由Madarabr研究团队于近期构建的Cortex Adaptive-Thinking数据集,正是为了解决这一根本性局限而诞生。该数据集以‘自适应交织推理’为核心研究问题,通过引入八种不同的思维放置模式,使模型能够根据问题复杂度灵活调整推理深度与位置。数据集覆盖数学、编程、逻辑推理等多个领域,并包含严格的代码验证与质量门控流程,为语言模型的推理行为从‘固定仪式’向‘自适应策略’的转变提供了关键基准资源。
当前挑战
该数据集的构建面临双重挑战。首先,在领域问题上,传统单次前置思维链训练范式导致模型无法灵活应对需要中途修正、渐进推理或无需思考的简单查询,这种僵化的推理模式严重限制了模型的实用性和类人推理能力。其次,在构建过程中,需解决合成数据中常见的机械文本特征问题(如破折号污染),同时确保代码样本的真实可执行性与多样性——既要剔除语法错误等真实缺陷样本,又要保留刻意展示调试过程的样本来模拟真实编程场景。此外,如何将思维位置自动标注为pre/mid/end三种结构类型,并保证八种思维模式的边界清晰、样本均衡,也对数据标注与质量控制提出了极高要求。
常用场景
经典使用场景
在语言模型推理能力研究中,Cortex Adaptive-Thinking数据集被设计用于训练模型掌握自适应、交错式的思考模式。传统思维链数据集要求模型在回答前进行一次完整的思考,而该数据集通过八种不同的思维放置模式——从无需思考的直接回答、轻量预思考,到迭代多步循环推理——模拟了人类真实推理过程中思维出现的多样时序。模型在学习过程中需根据问题难度和类型,灵活决定何时何地进行思考,例如在回答中途修正错误、在末尾进行自我校验,或在处理复杂子问题时触发新的推理循环。这种训练方式打破了固定思维链的桎梏,使模型能够动态调控计算资源的投入,实现与任务复杂度和实时需求相匹配的适应性推理能力。
实际应用
在实际应用层面,具备自适应推理能力的模型能够更好地胜任智能客服、代码辅助开发、教育辅导等需要实时响应的交互场景。例如在处理用户简单的查询时,模型可以直接给出答案而无需冗长的思考过程,提升了响应速度和服务体验;而在面对复杂的编程问题或多步数学推理时,模型能够在解答过程中动态插入思考步骤,确保推理的准确性和完整性。数据集覆盖的数学、代码调试、逻辑推理、物理化学、日常规划等多个领域,保证了模型在不同专业场景下的泛化能力。此外,数据集内嵌的CortexSym推理标记机制使得训练后的模型推理过程具有天然的可解释性和可审计性,在金融风控、医学诊断等对推理链条要求严格的行业中具有重要应用价值。
衍生相关工作
该数据集衍生了一系列关于自适应推理和计算资源动态分配的前沿工作。研究者基于其中的迭代多步推理模式开发了循环推理增强框架,使模型能够在多次推理循环中逐步完善答案,显著提升了复杂数学题和编程挑战的解决成功率。另一经典工作则聚焦于其中的中途纠错模式,设计出能够实时监测并修正模型推理错误的校验机制,有效减少了大型语言模型在专业问答中常见的漏洞和胡编乱造现象。此外,受该数据集中终端反思模式的启发,不少研究者探索了在模型生成结束时加入自我校验步骤的强化学习方法,从而在不显著增加推理延迟的前提下提升输出质量。这些工作共同推动了语言模型从固定推理范式向弹性、自适应、可纠正方向的学术发展浪潮。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务