cds-jb/cot-qwen35-9b
收藏资源简介:
CoT Oracle Corpus v5 (Qwen3.5-9B) — 10× rollouts, judged 是一个基于Qwen3.5-9B模型生成的数据集,复现了ceselder/cot-oracle-corpus-v5数据集。该数据集包含20,239个独特问题,每个问题有10个不同的思维链(CoT)推演过程,共计202,400个条目。数据集使用Qwen3.5-4B LLM作为评判器,对每个条目的CoT文本和真实答案进行判断,分类为YES/NO/UNCLEAR。整体CoT正确率为88.1%,每个问题多数投票正确率为92.5%。数据来源多样,包括AQUA-RAT、CommonsenseQA、GSM8K、ARC-Easy、ASDiv、MATH、ARC等,每个来源的CoT正确率不同。数据集还提供了生成过程的详细信息,如模型配置、采样参数等,以及分类分布和模式信息,适用于自然语言处理研究和评估。
# 思维链(Chain of Thought, CoT)神谕语料库v5(Qwen3.5-9B)——10轮展开,经标注审核 本数据集复刻自 [`ceselder/cot-oracle-corpus-v5`](https://huggingface.co/datasets/ceselder/cot-oracle-corpus-v5),由`Qwen3.5-9B`模型生成,**每个问题生成10轮独立展开结果**(原版数据集仅为2轮),并经`Qwen3.5-4B`大语言模型(Large Language Model, LLM)完成标注审核。 ## 统计信息 - 共202400条数据(即20239个独特问题 × 10轮展开) - 整体思维链正确率(`cot_correct`):**88.1%** - 按问题多数投票判定的正确率:**92.5%**(185650/200660) - 数据ID格式:`<数据源>_<NNNNN>_r<轮次编号>`(全局唯一) ## 分数据源思维链正确率 | 数据源 | 样本量 | 思维链正确率 | |---|---|---| | AQUA-RAT | 100000 | 88.2% | | CommonsenseQA | 38810 | 81.2% | | GSM8K | 35200 | 90.9% | | ARC-Easy | 9500 | 98.5% | | ASDiv | 9200 | 94.1% | | MATH | 5000 | 82.8% | | ARC | 4690 | 95.8% | ## 生成配置 - 模型:`Qwen/Qwen3.5-9B` - 推理引擎:vLLM 0.20.0,bf16精度 - 采样参数:temperature=0.6,top_p=0.95,`enable_thinking=True`(开启思维链生成) - 令牌预算:全程设置最大新生成令牌数为16384,解决了原版数据集存在的截断限制问题 - 10轮展开 × 20240个问题 = 202400条数据 - 采用16张H200显卡进行数据并行推理,总耗时约4小时 ## 标注分类 本次标注由轻量化大语言模型(Qwen3.5-4B)完成,该模型会读取每条数据的思维链文本与标准答案,返回「是/否/不确定」三类结果。具体分类如下: - `load_bearing`:思维链正确,直接回答错误(思维链为必要推理步骤) - `both_correct`:思维链与直接回答均正确 - `both_wrong`:思维链与直接回答均错误 - `cot_hurt`:思维链错误,直接回答正确 - `judge_unclear`:标注模型无法判定思维链与直接回答的正确性 各类别分布:`{'both_correct': 92092, 'judge_unclear': 38086, 'load_bearing': 60261, 'cot_hurt': 2640, 'both_wrong': 9321}` > 注:`judge_unclear`类别主要集中于MATH与AQUA-RAT数据集,这类数据的直接回答(无思维链)被限制在200个令牌以内,通常过于简短,导致标注模型无法验证其与标准答案的一致性。若需要备用划分策略,可将`judge_unclear`类数据视为「思维链正确与否已知,但直接回答正确性未知」。 ## 数据Schema 本数据集的字段格式与`ceselder/cot-oracle-corpus-v5`完全一致,新增字段如下: - `judge_cot_verdict`、`judge_direct_verdict`:标注模型返回的原始判定结果,取值为YES/NO/UNCLEAR - `rollout_majority_correct`:若同一问题的10轮展开结果中超过50%被判定为思维链正确,则该字段为`True` - `rollout_n_correct`、`rollout_n_total`:分别为每个问题的正确展开结果数与总展开结果数



