遇见数据集

MiMo-2.5-Pro-Reasoning-Traces-Hard

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

MiMo-2.5-Pro-HardReasoning-Traces 是一个大规模推理轨迹数据集,专门设计用于支持复杂推理任务的研究与开发。该数据集由 MiMo-v2.5-Pro 模型生成,包含 4,713 个专家级提示(prompts)及其对应的完整逐步推理过程(reasoning traces),涵盖 32 个不同的学术与技术主题。数据规模方面,总计包含 27,104,198 个 token,其中提示部分占 1,771,339 个 token,完成部分占 25,332,859 个 token,推理过程专门占用了 16,542,264 个 token。每个数据条目采用结构化格式,包含唯一标识符(id)、主题分类(topic)、问题陈述(prompt)、完整的逐步推理轨迹(reasoning)、最终答案或解决方案(completion)、token 使用统计(tokens)以及生成时间戳(timestamp)。数据集覆盖的主题广泛且深入,主要包括五大领域:数学(如特征值/乔丹形、拉格朗日乘数法等)、物理(如量子谐振子、相对论/天体物理学等)、计算机科学(如算法/复杂度、数据结构等)、生命科学(如生物化学、遗传学/生物信息学等)以及其他领域(如哲学/认识论、博弈论等)。适用于文本生成、问答、思维链推理、知识蒸馏、多输入多输出(MIMO)建模以及智能体轨迹分析等任务,尤其适合需要硬推理(hard-reasoning)能力的学术和技术场景。数据集采用 CC BY-NC 4.0 许可协议,作者为 Vaishant Sai Sambu。

MiMo-2.5-Pro-HardReasoning-Traces is a large-scale reasoning traces dataset specifically designed to support research and development of complex reasoning tasks. Generated by the MiMo-v2.5-Pro model, it contains 4,713 expert-level prompts and their corresponding complete step-by-step reasoning traces, covering 32 distinct academic and technical topics. In terms of overall scale, the dataset totals 27,104,198 tokens, with 1,771,339 tokens allocated to the prompt section, 25,332,859 tokens to the completion section, and 16,542,264 tokens specifically used for the reasoning processes. Each data entry follows a structured format, including a unique identifier (id), topic classification (topic), problem statement (prompt), complete step-by-step reasoning traces (reasoning), final answer or solution (completion), token usage statistics (tokens), and generation timestamp (timestamp). The dataset covers a wide and in-depth range of topics, primarily divided into five major fields: mathematics (e.g., eigenvalues/Jordan form, Lagrange multiplier method), physics (e.g., quantum harmonic oscillator, relativity/astrophysics), computer science (e.g., algorithm complexity, data structures), life sciences (e.g., biochemistry, genetics/bioinformatics), and other fields (e.g., philosophy/epistemology, game theory). It is applicable to tasks such as text generation, question answering, chain-of-thought reasoning, knowledge distillation, multiple-input multiple-output (MIMO) modeling, and AI agent trajectory analysis, and is particularly suitable for academic and technical scenarios requiring hard-reasoning capabilities. The dataset is licensed under CC BY-NC 4.0, and its author is Vaishant Sai Sambu.

创建时间:
2026-06-02
原始信息汇总

数据集概述

MiMo-2.5-Pro-HardReasoning-Traces 是一个大型推理数据集,包含 6,779 个专家级提示及其完整的推理轨迹,覆盖 44 个学术与技术主题。该数据集使用 MiMo-v2.5-Pro 模型生成,每个条目包含逐步推理链和最终答案,适用于训练和评估语言模型的推理能力。


数据集统计

指标 数值
总条目数 6,779
独特主题数 44

文件结构

  • reasoning_data_1.jsonl — 条目 1-2000
  • reasoning_data_2.jsonl — 条目 2001-4000
  • reasoning_data_3.jsonl — 条目 4001-6000
  • reasoning_data_4.jsonl — 条目 6001-6779
  • generate_dataset.py — 数据集生成脚本
  • test_api.py — API 连接测试
  • test_concurrent.py — 并发测试

数据格式

每个 JSONL 文件中的条目包含以下字段:

  • id — 唯一标识符
  • topic — 主题类别
  • prompt — 问题或问题描述
  • reasoning — 完整的逐步推理轨迹
  • completion — 最终答案或解决方案
  • tokens — 包含 prompt_tokenscompletion_tokenstotal_tokensreasoning_tokens 的字典
  • timestamp — ISO 8601 时间戳

覆盖主题(32 个类别)

数学

  • matrix_eigenvalues_jordan — 特征值、特征向量、Jordan 标准型
  • calculus_lagrange_multipliers — 多变量约束优化
  • ordinary_differential_equations — 带边界条件的二阶常微分方程
  • linear_programming_simplex — 单纯形法线性规划
  • markov_stationary_distribution — 马尔可夫链与平稳分布
  • diophantine_equations — 基于扩展欧几里得算法的线性丢番图方程
  • chinese_remainder_theorem — 线性同余方程组
  • elliptic_curves — 有限域上的椭圆曲线
  • combinatorics_burnsides_lemma — Burnside 引理与组合计数
  • network_max_flow — Ford-Fulkerson 算法与最小割

物理

  • quantum_harmonic_oscillator — 量子力学、升降算符、不确定原理
  • relativity_and_astrophysics — 广义相对论、宇宙学、黑洞
  • thermodynamics_and_statistical_mechanics — 熵、配分函数、相变
  • particle_and_nuclear_physics — QED、QCD、核物理、费曼图
  • wave_physics_and_acoustics — 波动方程、多普勒效应、衍射、超材料

计算机科学

  • algorithms_and_complexity — NP 完全性、近似算法、随机算法
  • data_structures_and_databases — B+ 树、LSM 树、MVCC、CRDT
  • distributed_systems_and_cloud — 共识协议、CAP 定理、分布式存储
  • cryptography_and_security — 零知识证明、后量子密码、侧信道攻击
  • compilers_and_programming_languages — SSA、垃圾回收、类型系统
  • artificial_intelligence_and_ml — Transformer、RLHF、扩散模型、GAN
  • operating_systems_and_networking — TCP 拥塞控制、虚拟内存、调度
  • control_systems_and_information_theory — 卡尔曼滤波、信道容量、注水算法
  • distributed_system_architecture — 大规模系统设计(遥测数据采集)
  • automata_and_formal_languages — DFA/NFA、图灵机、泵引理、乔姆斯基层级
  • neural_network_architecture_and_training — 反向传播、Transformer、注意力、RLHF、扩散模型

生命科学

  • biochemistry_and_molecular_biology — GPCR、代谢通路、光合作用
  • genetics_and_bioinformatics — 序列比对、GWAS、转座因子
  • organic_and_physical_chemistry — NMR 光谱、催化机制、分子轨道

信号处理与数值方法

  • signal_processing_and_transforms — FFT、小波、FIR/IIR 滤波器、压缩感知
  • numerical_methods_and_monte_carlo — 蒙特卡洛积分、Runge-Kutta、共轭梯度

统计学与推断

  • bayesian_statistics_and_inference — MCMC、变分推断、贝叶斯因子、高斯过程

电气工程

  • electrical_circuit_analysis — 基尔霍夫定律、戴维南等效、晶体管放大器

量子计算

  • quantum_computing_and_circuits — 量子隐形传态、Shor 算法、纠错

其他

  • analytical_philosophy_and_epistemology — 意识、自由意志、认识论
  • game_theory_and_decision_theory — 纳什均衡、机制设计、拍卖理论
  • linguistics_and_formal_semantics — 句法、音系学、形式语义学
  • quantitative_finance_and_economics — Black-Scholes、DSGE 模型、投资组合优化
  • portfolio_optimization_and_finance — Markowitz、Black-Litterman、Delta 对冲、Kelly 准则
  • geometry_and_topology — Gauss-Bonnet 定理、基本群、同调
  • graph_theory_and_coloring — 色数、平面性、谱图理论
  • number_theory_and_rsa — RSA、素性测试、整数分解、椭圆曲线
  • partial_differential_equations — 热方程、波动方程、有限元法、Navier-Stokes

提示类型

  • 过程型(约45%) — 动态生成的问题,包含随机化参数(矩阵、容量、系数等),每个提示唯一。
  • 理论型(约55%) — 基于模板的提示,从约 400 个高级学术主题池中随机选取子主题,并注入随机缩放参数确保唯一性。

使用方式

Python 加载 python import json

entries = [] for i in range(1, 5): with open(f"reasoning_data_{i}.jsonl", "r") as f: for line in f: entries.append(json.loads(line))

print(f"Loaded {len(entries)} entries")

Hugging Face Datasets 加载 python from datasets import load_dataset

ds = load_dataset("Skyhigh-2203/MiMo-2.5-Pro-HardReasoning-Traces")


生成配置

  • 模型mimo-v2.5-pro
  • 并发线程数:10-15(流水线模式)
  • max_tokens:4096-16384
  • Temperature:0.7
  • 自动重试:最多 10 次,带指数退避(针对 429/超时)

许可协议

CC BY-NC 4.0(Creative Commons Attribution-NonCommercial 4.0 International)。允许非商业目的的分享和改编,需注明原作者 Vaishant Sai Sambu。商业用途请联系作者。

搜集汇总
数据集介绍
MiMo-2.5-Pro-Reasoning-Traces-Hard 数据集图片
构建方式
MiMo-2.5-Pro-Reasoning-Traces-Hard 数据集基于 MiMo-v2.5-Pro 模型生成,共包含 6,779 条专家级提示,覆盖 44 个学术与技术主题。数据集构建采用了双重策略:约 45% 的提示为程序化生成,通过随机化参数(如矩阵、容量、系数等)确保每个问题独一无二;约 55% 的提示基于模板,从约 400 个高级学术子主题中随机选取并注入随机缩放参数以增强多样性。生成过程使用 10-15 个并发线程,设置最大令牌数 4096-16384,温度 0.7,并配备最多 10 次自动重试机制,保障了数据的高质量与完整性。
特点
该数据集的核心特色在于其深刻的跨学科覆盖与精细的推理链条。涵盖数学、物理、计算机科学、生命科学、信号处理、统计学、电气工程、量子计算乃至分析哲学等众多领域,每个条目均包含从问题到答案的完整逐步推理过程,并附有提示、推理与完成阶段的令牌计数。此外,数据以 JSONL 格式存储,便于高效加载与处理,且采用 CC BY-NC 4.0 许可证开放非商业使用,为大型语言模型的推理能力训练与评估提供了丰富而可靠的资源。
使用方法
使用该数据集极为便捷,支持两种主流加载方式。用户可直接通过 Python 的 json 库循环读取四个 JSONL 文件,将每条记录解析为字典并汇总为列表;亦可利用 Hugging Face Datasets 库的 load_dataset 函数一键加载,实现与现有机器学习工作流的无缝集成。每条数据包含唯一标识符、主题类别、提示文本、推理轨迹、最终答案及令牌统计信息,适用于监督微调、推理能力基准测试或链式思维提示的优化研究。
背景与挑战
背景概述
MiMo-2.5-Pro-Reasoning-Traces-Hard数据集由Vaishant Sai Sambu于2025年创建,旨在为大型语言模型提供高质量推理轨迹训练资源。该数据集聚焦于提升模型的链式思考能力,覆盖数学、物理学、计算机科学等44个高级学术与技术领域,包含6,779条专家级提示及其完整的逐步推理链。通过引入MiMo-v2.5-Pro模型生成,数据集巧妙结合了动态参数化问题与模板化理论问题,为推理能力的评估与训练提供了丰富且结构化的基准,对推动语言模型在复杂推理任务中的表现具有重要影响。
当前挑战
该数据集主要挑战在于解决语言模型在复杂、多步骤推理任务中的准确性与一致性不足问题,尤其是面对数学证明、算法分析等需要严密逻辑链条的领域时,模型常出现中间步骤错误或推理断裂。在构建过程中,挑战体现为生成大量随机化但语义合理的专家级提示,需平衡参数扰动与问题可解性;同时,大规模并发调用模型生成推理轨迹时,需处理API限流与超时,通过多达10次重试与指数退避策略保障数据完整性,并确保不同主题下推理长度的波动(4,096–16,384 tokens)不损害数据质量。
常用场景
经典使用场景
MiMo-2.5-Pro-Reasoning-Traces-Hard数据集的核心价值在于为大规模语言模型的推理能力训练与评估提供了高质量的基准资源。该数据集收录了6,779条专家级别的问题与完整的逐步推理链,覆盖数学、物理、计算机科学、生命科学、信号处理、统计学、电气工程、量子计算等44个学术与技术领域的深度内容。在经典使用中,研究者可借助推理轨迹进行监督式微调,增强模型在复杂多步推理任务上的表现,亦可将其作为评估框架,衡量模型在逻辑推演、数学证明、算法设计等高级认知任务中的能力边界。数据集中约45%的程序化提示问题保证了参数空间的充分覆盖,而55%的理论提示则引入了丰富的学术子主题,为系统性地测试模型的泛化与迁移能力提供了理想条件。
解决学术问题
该数据集直面当前大语言模型在复杂推理任务中表现不佳的学术困境,系统性地解决了两个关键问题:其一,缺乏覆盖深广且推理过程透明的高质量训练数据,现有数据集往往片面强调结果准确性而忽略推理路径的可解释性;其二,模型在跨学科、高难度的推理任务中容易产生逻辑断裂或幻觉。MiMo-2.5-Pro-Reasoning-Traces-Hard通过提供从步骤到结论的完整推理链,为研究推理链质量评估、知识图谱与逻辑推理的融合、以及多步骤问题求解策略提供了数据基础。它推动了可解释人工智能的发展,助力识别推理过程中的错误传导模式,并为开发更鲁棒的推理增强算法奠定了实证基础,在认知科学与计算语言学交叉领域亦具有深远意义。
衍生相关工作
该数据集的发布催生了一系列重要的衍生研究方向。基于其推理链结构,研究者探索了推理路径蒸馏技术,将大型模型的复杂思维过程迁移至轻量级模型以提升部署效率。在链式思维提示工程领域,数据集中的多样化推理模板被用于设计更高效的引导策略,如自适应思维链长度控制和多路径推理集成。此外,数据集中覆盖的32个主题类别促使了跨学科推理评估基准的建立,推动了如数学推理与代码生成联合训练等复合任务的进展。推理轨迹中的token级时序数据亦被应用于探索模型内部知识表示与推理阶段的对应关系,为理解Transformer架构中注意力机制的推理动态提供了实证分析素材。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务