nassimjp/Helios-R-6M
收藏资源简介:
Helios-R-6M是一个高质量、紧凑的推理数据集,旨在加强跨数学、计算机科学和科学探究的多步问题解决能力。虽然数据集涵盖多个学科,但数学构成最大的示例份额,并驱动推理复杂性。该数据集包括约6,186,188个样本,仅包含训练分割,语言为英语,格式为Apache Arrow(自动转换为Parquet),许可证为Apache-2.0,标签包括数学、代码、科学、推理、思考和链式思维。每个样本包含problem(字符串,来自数学、科学、逻辑或编码的问题或提示)和solution(字符串,结构化的逐步推理轨迹,通常以<think>开头,模拟教学式问题解决思维)。数据集是从多个来源(如Poseidon-Reasoning-5M、reasoning-v1-20m、Open-Omega-Explora-2.5M)以及自定义问题混合优化而来,适用于STEM和推理密集型领域的模型预训练和微调。
许可证:Apache-2.0 标签: - 数学 - 代码 - 科学 - 思维 - 生物学 - 化学 - 艺术 - 文本 - seed=42 - Forge - 推理 任务类别: - 文本生成 语言: - 英语 样本规模: - 100万<n<1000万 ---  # Helios-R-6M > **Helios-R-6M** 是一款高质量、轻量化的推理数据集,旨在强化数学、计算机科学与科学探究领域的多步问题求解能力。尽管该数据集覆盖多门学科,但数学样本占比最高,且主导了推理复杂度的设计。 --- ## Hugging Face Datasets 🤗 快速上手 python pip install -U datasets python from datasets import load_dataset dataset = load_dataset("prithivMLmods/Helios-R-6M", split="train") --- ## 数据集概览 * **总样本量**:约6,186,188条 * **数据集拆分**:仅包含训练集 * **语言**:英语 * **存储格式**:Apache Arrow格式(自动转换为Parquet格式) * **许可证**:Apache-2.0 * **标签**:`数学`、`代码`、`科学`、`推理`、`思维`、`思维链(Chain-of-Thought, CoT)` ## 数据集亮点 * 专注于生成具备逻辑递进与清晰表达的严谨思维链解决方案 * 涵盖形式化数学问题与抽象科学、逻辑推理挑战 * 适用于STEM(科学、技术、工程、数学)领域及推理密集型场景下的模型预训练与微调 ## 数据集结构 数据集内每条样本包含以下字段: * **`problem`**(字符串类型):来自数学、科学、逻辑或编程领域的问题或提示 * **`solution`**(字符串类型):结构化的分步推理轨迹,通常以`<think>`开头,模拟具有教学意义的问题解决思维过程 --- ## 数据集来源与衍生 Helios-R-6M 是经优化提纯的混合数据集,衍生自以下资源: * [prithivMLmods/Poseidon-Reasoning-5M](https://huggingface.co/datasets/prithivMLmods/Poseidon-Reasoning-5M) * [glaiveai/reasoning-v1-20m](https://huggingface.co/datasets/glaiveai/reasoning-v1-20m) * [prithivMLmods/Open-Omega-Explora-2.5M](https://huggingface.co/datasets/prithivMLmods/Open-Omega-Explora-2.5M) * 额外由**prithivMLmods**整理并贡献的自定义模块化问题 该组合兼顾了技术与学术领域的深度与广度,并特别针对多领域推理性能进行了优化。 ## 许可证 Apache许可证2.0




