OpenLongCoT-Pretrain-1202
收藏资源简介:
# OpenLongCoT-Pretrain-1202 > 本文档由AI生成,请查看官方网站:https://huggingface.co/datasets/SimpleBerry/OpenLongCoT-Pretrain-1202 --- **OpenLongCoT-Pretrain-1202** 是一个大规模的预训练数据集,旨在为大型语言模型提供**长思维链(Long Chain-of-Thought)** 的基础能力。它是训练 [LLaMA-O1](https://huggingface.co/SimpleBerry/LLaMA-O1-Supervised-1129) 系列模型基座(Base Model)的核心数据资源。 该数据集包含了大量结构化的推理文本,涵盖了数学、逻辑、编程、科学等多个领域的复杂问题及其逐步分解的解答过程。与有监督微调数据集(如 OpenLongCoT-SFT)不同,本数据集主要用于**初始预训练阶段**,让模型从零开始学习生成长篇幅的推理内容。 --- ## 🧠 数据集用途 | 方面 | 描述 | |------|------| | **主要用途** | 大型语言模型的**预训练**(Pre-training),建立长推理能力的基础 | | **数据特点** | 长文本、多步骤推理、包含中间计算和解释 | | **目标领域** | 数学、逻辑、编程、物理、化学等多学科问题求解 | | **输出风格** | 类似思维链的详细推导过程,附带最终答案 | 此数据集帮助模型掌握**如何生成连贯、长篇幅的推理链**,为后续的有监督微调(SFT)提供良好的初始化权重。 --- ## 📊 数据集结构 数据集包含两个主要字段: | 字段 | 类型 | 描述 | |------|------|------| | `input` / `question` | `string` | 原始问题或任务描述 | | `output` / `response` | `string` | 完整的推理过程及最终答案(长文本) | 每条数据均为一个问题‑答案对,其中答案部分通常包含: - 问题重述与拆解 - 中间变量定义和计算 - 逻辑推理步骤 - 最终结论(可能含代码或数学公式) ### 示例条目(示意) **输入:** > 若一个球从20米高处自由落下,每次反弹高度为前一次的60%,求第3次落地时球经过的总路程。 **输出:** ``` - 第一次下落:20米 - 第一次反弹:20 * 0.6 = 12米(上升),然后下落12米 - 第二次反弹:12 * 0.6 = 7.2米(上升),然后下落7.2米 - 第三次落地前总路程 = 20 + 2*(12 + 7.2) = 20 + 38.4 = 58.4米 - 答案:58.4米 ``` 数据采用自然语言文本格式,未强制使用特殊标签,但倾向于结构化的段落分隔。 --- ## 📈 数据集统计 | 统计项 | 数值 | |--------|------| | **总样本数** | 约 120 万(估算) | | **平均长度** | 输入 ~150 tokens,输出 ~800 tokens | | **格式** | JSON Lines / Parquet | | **语言** | 英语 | | **许可证** | MIT | *注:具体数量请以官方数据卡片为准。* --- ## 🚀 使用方法 ### 从 Hugging Face 加载 ```python from datasets import load_dataset # 加载数据集(可能包含多个分片) dataset = load_dataset("SimpleBerry/OpenLongCoT-Pretrain-1202") # 查看训练集的一个样本 print(dataset["train"][0]) ``` ### 从 ModelScope 加载 ```python from modelscope.msdatasets import MsDataset # 从 ModelScope 加载 dataset = MsDataset.load("SimpleBerry/OpenLongCoT-Pretrain-1202") # 查看样本 print(next(iter(dataset["train"]))) ``` **通过 ModelScope 从 Hugging Face 加载:** ```python from modelscope.msdatasets import MsDataset dataset = MsDataset.load( 'SimpleBerry/OpenLongCoT-Pretrain-1202', hub='huggingface' ) ``` ### 预训练使用建议 - 可直接用于语言模型的**自回归预训练**(next token prediction)。 - 建议配合因果语言建模损失函数。 - 可与通用语料(如 C4、The Pile)混合,平衡推理能力与通用知识。 --- ## 🔗 相关资源 | 资源 | 链接 | |------|------| | **LLaMA-O1 模型系列** | [SimpleBerry/LLaMA-O1-Supervised-1129](https://huggingface.co/SimpleBerry/LLaMA-O1-Supervised-1129) | | **基座模型** | [SimpleBerry/LLaMA-O1-Base-1127](https://huggingface.co/SimpleBerry/LLaMA-O1-Base-1127) | | **SFT 数据集** | [SimpleBerry/OpenLongCoT-SFT](https://huggingface.co/datasets/SimpleBerry/OpenLongCoT-SFT) | | **GitHub 仓库** | [SimpleBerry/LLaMA-O1](https://github.com/SimpleBerry/LLaMA-O1) | --- ## 📄 许可证 本数据集采用 **MIT** 许可证,允许自由使用、修改和分发(包括商业用途),需保留版权声明。 --- ## 🙏 致谢 该数据集由 **SimpleBerry** 团队收集和整理,旨在推动开源大语言模型的推理能力研究。 --- > **注意**:本文档由AI生成,内容可能不完全准确,请以 Hugging Face 官方页面为准。



