遇见数据集

trajectory-analysis

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

该数据集名为具有顺序依赖性的轨迹分析,专注于对六个大型语言模型在HLE和OpenMathReasoning两个数据集上生成的推理轨迹进行步骤级分析。每个推理步骤根据其在轨迹中的角色和依赖关系被分类为三种类型之一:尝试步骤(引入或探索尚未确定价值的新思路)、子任务步骤(执行推理的具体组成部分,且不依赖于尚未可用的早期步骤输出)以及顺序步骤(需要早期编号步骤的输出或上下文,因此无法与该先决条件并行处理)。数据集以TXT文件格式组织,目录结构遵循<模型>/<数据集>/*.txt的模式。每个文件包含编号的推理步骤、步骤级别的分类标签及解释说明、合并的步骤文本,并在可能时包含最终答案。每个分类都附有解释,特别是对于顺序步骤,解释会明确指出其依赖的先决步骤以及为何无法并行执行的原因。该数据集旨在支持对推理过程并行性、步骤依赖关系和推理轨迹结构的研究与分析,适用于推理任务分析、模型行为评估和自动化推理系统优化等场景。需要注意的是,该数据集目前处于积极更新状态,其覆盖范围、分类和元数据可能会随着新轨迹的纳入和现有条目的审查而不断演进。

This dataset, named 'Trajectory Analysis with Sequential Dependencies', focuses on step-level analysis of reasoning trajectories generated by six large language models (LLMs) across two datasets: HLE and OpenMathReasoning. Each reasoning step is categorized into one of three types based on its role in the trajectory and dependency relationships: 'Trial Step' (introduces or explores new ideas whose value has not yet been confirmed), 'Subtask Step' (executes a specific component of reasoning without relying on outputs from earlier steps that are not yet available), and 'Sequential Step' (requires outputs or context from earlier numbered steps, thus cannot be processed in parallel with those prerequisites). The dataset is organized in TXT file format, with a directory structure following the pattern <model>/<dataset>/*.txt. Each file contains numbered reasoning steps, step-level classification labels with explanatory notes, merged step text, and final answers when available. Each category is accompanied by an explanation; specifically for 'Sequential Step', the explanation will clearly indicate its prerequisite steps and the reason why parallel execution is not possible. This dataset aims to support research and analysis of reasoning process parallelism, step dependencies, and reasoning trajectory structure, and is applicable to scenarios such as reasoning task analysis, model behavior evaluation, and automated reasoning system optimization. It should be noted that this dataset is currently in active development, and its coverage, classification, and metadata may continue to evolve as new trajectories are added and existing entries are reviewed.

创建时间:
2026-07-25
原始信息汇总

数据集概述

名称:Trajectory Analysis with Sequential Dependencies(含顺序依赖的轨迹分析)

语言:英文

标签:推理、轨迹分析、步骤分类、并行性、依赖分析

状态:该数据集正在持续更新中,其覆盖范围、分类及元数据可能随轨迹增加和已有条目审查而演变。


数据内容

该数据集包含来自两个数据集上六个模型生成的推理轨迹的步骤级分类。每个推理步骤根据其在轨迹中的作用和依赖关系被标记为以下三类之一:

  • Trial Step:引入或研究一个价值未知的想法或方法。
  • Subtask Step:执行推理中一个具体的子组件,该子组件不依赖于不可用的先前步骤输出。
  • Sequential Step:需要依赖更早编号步骤的输出或上下文,因此无法与该前置步骤并行处理。每个 Sequential Step 的解释中会标识其前置步骤及无法并行执行的原因。

:步骤1不会被标记为 Sequential,因为它没有更早的编号步骤。


模型与数据集

数据集按 <模型>/<数据集>/*.txt 组织。

模型(6个)

  • Claude-Opus-4.5
  • DeepSeek-R1
  • GPT-5.5
  • Gemini-2.5-Pro
  • Gemini-3-high-thinking
  • Qwen3-30B-A3B

数据集(2个)

  • HLE
  • OpenMathReasoning

文件格式

每个非空的 TXT 文件包含以下内容:

  • 按编号划分的推理步骤
  • 步骤级分类及其解释
  • 合并后的步骤文本
  • 最终答案(如存在)

典型分类行示例:

Step 7: Sequential Step [This step requires an intermediate result established in an earlier step, so the two steps cannot run in parallel.]


方法论

每个步骤基于其文本及其与周围轨迹的关系进行评估,然后被分配三个标签之一。当一个步骤依赖更早编号步骤且无法在同一时间独立处理时,被分类为 Sequential,其解释会指明前置步骤和顺序约束的原因。


验证

数据集经过以下检查:

  • 分类解释非空
  • Sequential 步骤的解释标识了顺序依赖关系
  • 步骤1未被标记为 Sequential
搜集汇总
数据集介绍
trajectory-analysis 数据集图片
构建方式
该数据集旨在解析推理轨迹中步骤间的顺序依赖关系。其构建涵盖六个前沿模型(如Claude-Opus-4.5、DeepSeek-R1等)在两个推理数据集(HLE与OpenMathReasoning)上生成的推理轨迹。每个推理步骤依据其角色与依赖特征,被归为三类标签之一:试探性步骤(Trial Step)、子任务步骤(Subtask Step)或顺序步骤(Sequential Step)。其中,试探性步骤代表价值未知的尝试性探索;子任务步骤执行不依赖先前步骤输出的具体推理组件;顺序步骤则依赖于更早步骤的输出或上下文,无法与前置步骤并行处理。所有标注均附带解释说明,对于顺序步骤,解释块明确标识出前置步骤及其无法并行执行的原因。数据集以<模型>/<数据集>/<文件名>.txt的目录结构组织,每个非空文件包含编号步骤、分类标签、解释、合并步骤文本及最终答案。
特点
该数据集的核心特点在于对推理轨迹中步骤依赖关系的精细化标注,突破了传统仅关注最终答案或单一推理正确性的局限。通过将步骤映射为试探性、子任务与顺序三类标签,有效捕捉到推理过程中不同步骤的功能定位与执行约束,尤其突出顺序步骤对前置步骤的显式依赖,为并行推理研究与错误追溯提供了结构化依据。数据集囊括多种前沿大语言模型的输出,覆盖多个领域的推理任务,具有显著的跨模型与跨领域多样性。其验证机制确保了分类解释非空、顺序步骤的依赖关系明确标注,并且第一步不会被标记为顺序步骤,从而增强了数据的一致性与可靠性。此外,数据集处于动态更新状态,可随着更多轨迹的加入而持续扩展和完善。
使用方法
该数据集主要面向意图提升推理模型可解释性与并行推理能力的研究者。使用方法包括:首先,将下载的数据集文件按照<模型>/<数据集>路径组织并读取各.txt文件;接着,解析文件中按行分隔的编号步骤及其对应的分类标签和解释;随后,可基于标签分布分析不同模型在相同推理任务上的策略差异,或通过顺序步骤的依赖关系构建推理图,探究步骤间的逻辑链条与执行瓶颈。研究人员可进一步将Sequential Step作为并行化改造的目标,尝试通过任务重排或上下文压缩减少依赖;也可利用Trial Step与Subtask Step的区分训练分类模型,以实现推理步骤的自动角色识别。数据集格式简洁,便于加载与扩展,能够有效兼容常见的NLP与推理分析处理管线。
背景与挑战
背景概述
在大型语言模型推理能力日益精进的背景下,理解其内部推理轨迹的结构与依赖性成为评估模型行为的关键。该数据集由多个研究机构于近期构建,聚焦于从Claude-Opus-4.5、DeepSeek-R1等六种前沿模型的输出中,对推理步骤进行细粒度分类。核心研究问题在于区分试错性探索、独立子任务与需依赖前序结果的顺序步骤,以揭示模型在复杂推理任务中的并行与序列化执行模式。该数据集填补了量化推理依赖关系的空白,为后续模型可解释性、推理效率优化及并行化架构设计提供了标准化评估基准,对推动语言模型行为分析领域具有重要参考价值。
当前挑战
该数据集面临的挑战涵盖多个层面。在领域问题方面,推理轨迹的依赖关系分析长期缺乏细粒度标注资源,制约了模型并行化与步骤级优化的研究进展。在构建过程中,数万条推理步骤需逐条判定其与上下文的依赖关系,特别是“顺序步骤”需精确识别前序步骤中的关键中间结果,这对标注者提出了极高要求。此外,不同模型(如GPT-5.5与Qwen3-30B-A3B)在推理轨迹长度与结构上的显著差异,增加了跨模型一致性分类的难度。数据集的持续更新特性也要求分类体系具备弹性,以兼容新模型与新任务引入的复杂情境。
常用场景
经典使用场景
在复杂推理任务中,大型语言模型生成的解题轨迹往往包含多步逻辑链条,而如何量化评估这些轨迹的内部依赖结构,是推理能力研究中的一个关键命题。该数据集提供了来自六种前沿模型在两个数学推理基准上的详细步骤级标注,将每个推理步骤精准划分为试错步骤、子任务步骤和顺序依赖步骤。研究者可借此深入剖析模型在构建推理路径时对前序结果的依赖程度,从而对比不同架构和训练策略在并行化潜力与上下文利用效率上的差异。
衍生相关工作
该数据集的发布催生了一系列具有启发性的研究方向。受其依赖分类框架启发,研究者提出了步骤级因果归因方法,通过扰动前序步骤观察后序变化,以量化依赖强度;另一类工作则聚焦于基于依赖图的推理轨迹压缩算法,通过合并并行步骤减少推理链长度。还有学者借鉴其分类体系,开发出自动检测推理轨迹中冗余顺序依赖的工具,并应用于知识蒸馏场景,帮助学生模型摆脱对长程顺序记忆的过度依赖,从而提升泛化能力。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型推理轨迹中步骤间依赖关系与并行性的细粒度分析,通过将每一步分类为试探步、子任务步或顺序步,系统性地揭示模型在长链推理中隐含的串行瓶颈。结合DeepSeek-R1、Gemini-3-high-thinking等前沿模型的输出标注,该研究为理解推理过程中的逻辑层级与执行顺序提供了量化框架。近年来,随着多步推理任务(如数学证明、复杂问答)的兴起,识别并优化顺序依赖对提升模型并行效率与整体推理质量至关重要,该数据集为构建更具鲁棒性的推理架构和评估基准奠定了结构性基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务