cortex-adaptive-thinking
收藏资源简介:
Cortex Adaptive-Thinking(交错推理)是一个多领域指令数据集,旨在教导语言模型进行自适应和交错推理。与传统链式思维(CoT)数据强制模型在回答前进行一次长时间思考不同,该数据集模拟人类真实推理过程,让模型学会根据需要思考——可能完全不思考(对于简单查询),可能在回答前思考一次,可能在回答过程中遇到新子问题时思考,也可能在最后进行自我检查。数据集通过八种不同的思维模式(包括无思考反射、轻度前置思考、单次前置思考、交错进展、中途修正、终端反思、迭代多步、澄清假设)来实现这种自适应行为,每种模式对应不同的思考时机和教学重点(如克制、比例思考、自我纠正等)。数据内容覆盖数学、代数、微积分、概率、数论、几何、组合、编程、算法、调试、SQL、系统设计、机器学习、物理、化学、生物、逻辑、日常事务、金融、规划、写作、语言、数据推理等多个领域,并分为五个难度等级(从trivial到expert)。数据规模小于1000个样本。每个样本包含多个字段:唯一ID、领域、难度、思维模式、思考次数、思考位置(pre/mid/end)、用户提示(prompt)、助手响应(含内联的<THOUGHT>...</THOUGHT>推理标签)、去除标签后的可见响应、聊天格式消息列表、完整的训练字符串(text)、代码验证结果(如无代码、通过、断言通过等)以及数据来源。数据构建过程严格,包括手写种子定义、生成代理扩展、文本规范化(保证无em/en破折号)、代码执行验证、布局一致性强制、去重和分词器往返检查。该数据集主要用于监督微调,以诱导自适应和交错推理行为,适用于需要复杂、多步推理的文本生成任务。局限性包括仅限英语、偏向STEM和日常推理领域,且代码验证不保证无自测试代码片段的完全功能正确性。数据集采用Apache-2.0许可证。
Cortex Adaptive-Thinking (Interleaved Reasoning) is a multi-domain instruction dataset aimed at teaching language models to perform adaptive and interleaved reasoning. Unlike traditional Chain-of-Thought (CoT) data, which forces models to conduct a single long thinking session before generating an answer, this dataset simulates real human reasoning processes, enabling models to learn to think as needed: it may involve no thinking at all (for simple queries), one single thinking before answering, thinking when encountering new sub-problems during the answering process, or self-checking at the end. The dataset achieves this adaptive behavior through eight distinct thinking modes, including No Thought Reflection, Mild Pre-emptive Thinking, Single Pre-emptive Thinking, Interleaved Progression, Mid-way Correction, Terminal Reflection, Iterative Multi-step, and Clarifying Assumptions. Each mode corresponds to specific thinking timing and teaching focuses, such as restraint, proportional thinking, self-correction, and more. The dataset covers multiple domains including mathematics, algebra, calculus, probability theory, number theory, geometry, combinatorics, programming, algorithms, debugging, SQL, system design, machine learning, physics, chemistry, biology, logic, daily affairs, finance, planning, writing, linguistics, data reasoning, etc., and is divided into five difficulty levels ranging from trivial to expert. The dataset contains fewer than 1,000 samples. Each sample includes multiple fields: Unique ID, Domain, Difficulty Level, Thinking Mode, Number of Thoughts, Thinking Position (pre/mid/end), User Prompt, Assistant Response (with inline <THOUGHT>...</THOUGHT> reasoning tags), Visible Response with Tags Removed, Chat Format Message List, Full Training String (text), Code Validation Results (e.g., No Code, Passed, Assertion Passed, etc.), and Data Source. The dataset construction process is rigorous, including handcrafted seed definition, generative agent expansion, text normalization (ensuring no em/en dashes), code execution validation, layout consistency enforcement, deduplication, and tokenizer round-trip checking. This dataset is primarily used for supervised fine-tuning to induce adaptive and interleaved reasoning behaviors, and is suitable for text generation tasks requiring complex, multi-step reasoning. Limitations include being English-only, being biased towards STEM and daily reasoning domains, and that code validation does not guarantee full functional correctness for standalone test code snippets. The dataset is licensed under Apache-2.0.
数据集概述:Cortex Adaptive-Thinking (Interleaved Reasoning)
该数据集是一个用于训练语言模型进行自适应、交错推理的多领域指令数据集。其核心目标是让模型学会像人类一样,在推理过程中灵活地、非固定地安插思考过程,而非总是一次性输出完整的思维链再给出答案。
核心特点
- 自适应推理模式:数据集设计了8种不同的思考模式,模型需要根据问题和上下文,决定是否思考、何时思考以及思考的深度,实现“自适应”推理,而非固定的“先思考再回答”模式。
- 纯文本预处理:整个语料库已标准化为干净的ASCII标点符号,不包含任何em/en破折号,以避免机器生成文本的常见痕迹。
- 代码验证:所有包含代码的样本都在沙箱环境中执行和验证。存在实际缺陷的样本被剔除,而故意展示错误代码的样本(调试模式)会被保留。
- 多领域与多难度:涵盖从
trivial到expert的多个领域和难度级别。
8种思考模式
| 模式名称 | 思考时机 | 训练目标 |
|---|---|---|
reflex_no_think |
从不思考 | 学习“克制”,对简单问题不浪费推理资源 |
light_pre_think |
一次简短思考,然后回答 | 廉价、按比例的思考 |
single_pre_think |
一次实质性思考,然后回答 | 经典的前置思维链 |
interleaved_progress |
答案前和中 | 处理工作中出现的新的子问题 |
mid_course_correction |
回答中途发现失误 | 在回复中进行自我纠正 |
terminal_reflection |
回答末尾进行复核 | 验证/合理性检查 |
iterative_multistep |
多个“思考-行动”循环 | 真正的多步骤工作,每步骤一个循环 |
clarify_assumption |
回答前标记歧义 | 注意到缺失信息,然后假设或询问 |
数据格式
- 推理标记:思考过程使用
<THOUGHT>...</THOUGHT>标签包裹,可以出现在助理回复的任何位置。 - 原生训练字符串 (
text字段):格式为<BOS>User: {prompt} Assistant: {response with inline <THOUGHT>...</THOUGHT> spans}<EOT>。 - 其他字段:
prompt、response(含标签)、response_visible(去除标签后的纯文本)、messages(对话格式)、text等。
数据字段
| 字段 | 类型 | 描述 |
|---|---|---|
id |
string |
稳定ID,格式如 cair-000123 |
domain |
string |
领域,如数学、代数、微积分、编程等 |
difficulty |
string |
难度级别:trivial / easy / medium / hard / expert |
thinking_pattern |
string |
上述八种思考模式之一 |
num_thoughts |
int |
<THOUGHT> 标签的数量 |
thought_positions |
list[string] |
每个思考的位置:pre、mid 或 end |
prompt |
string |
用户消息 |
response |
string |
包含 <THOUGHT> 标签的助理回复 |
response_visible |
string |
去除 <THOUGHT> 标签后的助理回复 |
messages |
list |
对话列表,格式为 [{role, content}, ...] |
text |
string |
完整的 CortexSym 原生训练字符串 |
code_verdict |
string |
代码验证结果,如 no_code、pass、error_expected 等 |
source |
string |
样本来源(人工种子或生成批次) |
数据集规模与配置
- 规模:
n<1K(少于1000条样本) - 语言:英语
- 任务:文本生成
- 许可证:Apache-2.0
- 配置:默认配置,训练集为
data/train-*.parquet
构建与质量保障
- 使用手动编写的种子数据定义格式和质量标准,并由多个生成代理(Claude Sonnet 4.6)扩展,每个代理负责不同的领域/难度/模式组合。
- 构建脚本对每个样本进行:
- 文本标准化和破折号去除。
- 检查
<THOUGHT>标签的平衡性、非嵌套性和内容非空。 - 将思考布局强制转换为一致的
thinking_pattern。 - 基于标准化后的提示进行去重。
- 通过真实的 CortexSym 分词器进行往返检测。
- 代码验证脚本在沙箱子进程中执行代码,剔除存在实际缺陷的样本。
预期用途与局限
- 预期用途:用于监督式微调,以诱导模型进行自适应、交错的推理;作为 Cortex-A 模型的 SFT 数据集;作为扩展同类推理模式的模板。
- 局限:仅限英语;偏向 STEM 和日常推理领域。样本中的自我纠正(如
terminal_reflection、mid_course_correction)是说明性的,不能保证模型总能发现自己的错误。代码验证仅确认代码片段运行并通过其内置自检,对于没有自检的代码片段,不证明其完全功能正确性。




