遇见数据集

SupraLabs/agentic-reasoning-trace-summaries-40k

收藏
Hugging Face2026-07-07 更新2026-07-22 收录
官方服务:

资源简介:

该数据集名为Agentic Summaries,是一个用于训练模型将冗长的推理或工作轨迹转换为简短结构化摘要的JSONL数据集。数据集包含43,734行数据,每行包含两个字段:input(冗长的推理或工作轨迹文本)和output(一个字符串形式的JSON摘要,包括title、sub_title、summary和cur_task四个字段)。摘要旨在模拟模型在工作过程中产生的进度更新,具有标题、副标题、简短摘要和当前任务的结构。数据行按从长到短排序,以确保长上下文示例优先。数据集适用于文本生成和摘要任务,专注于代理(agent)和编码(coding)相关领域,语言为英语。数据集经过完整验证,所有行均有效,且输出可解析为JSON对象。源轨迹可能包含代码、工具调用、实现笔记、数学计算、调试步骤等任务导向文本,目标输出保持紧凑和结构化,有助于训练模型生成清晰的进度摘要而非冗长的自由形式解释。数据集中故意包含了一些破损或极短的样本,以教导模型如何应对这些输入,建议不要移除这些样本。

This dataset, named Agentic Summaries, is a JSONL dataset designed to train models to convert long reasoning or work traces into short structured summaries. It contains 43,734 rows, each with two fields: input (a verbose reasoning or work trace text) and output (a JSON summary as a string, including title, sub_title, summary, and cur_task fields). The summary mimics the kind of progress update a model should produce while working, with a structured format of title, subtitle, short summary, and current task. Rows are ordered from longest to shortest to prioritize long-context examples. The dataset is suitable for text-generation and summarization tasks, focusing on agent and coding-related domains, and is in English. It has been fully validated, with all rows valid and outputs parsable as JSON objects. Source traces may include code, tool calls, implementation notes, math, debugging steps, and other task-oriented text, while target outputs remain compact and structured, helping train models to produce clean progress summaries instead of long free-form explanations. The dataset intentionally includes broken or extremely short samples to teach the model to react to such inputs, and it is recommended not to remove these samples.

提供机构:
SupraLabs
搜集汇总
数据集介绍
SupraLabs/agentic-reasoning-trace-summaries-40k 数据集图片
构建方式
本数据集旨在训练模型将冗长的推理或工作轨迹转化为简洁的结构化摘要。其构建方式基于对大量长程推理轨迹的整理与标注,每条数据包含一个详细的推理或工作过程作为输入,以及一个紧凑的JSON格式摘要作为输出。摘要结构涵盖标题、副标题、概要及当前任务四个字段,模拟模型在持续工作中应产生的进展更新。数据集以JSONL格式存储,共43,734行,按输入长度从长到短排序,确保长上下文样本优先呈现。特别地,输出字段被存储为字符串而非嵌套JSON对象,以适应多数ChatML与SFT流水线对助手消息文本格式的要求。
特点
该数据集的核心特色在于其高度结构化的摘要格式与严格的验证流程。每一组数据均经过完整验证,确保所有输出字符串可被解析为有效的JSON对象,且字段完整。数据覆盖范围广泛,包含代码、工具调用、实现笔记、数学推导及调试步骤等多样化的任务导向文本。此外,数据集中有意加入了断裂或极端简短的样本,旨在训练模型处理模糊或不完整输入的能力,从而提升模型在真实场景中的鲁棒性。这种设计使得数据集不仅适用于生成清晰进展摘要,还能培养模型对异常输入的适应力。
使用方法
使用该数据集时,可通过HuggingFace的datasets库以JSON格式加载,并直接利用输出字段作为有监督微调中的助手文本。典型训练流程中,可将输入与输出分别映射至Chat格式中的用户与助手消息。若需解析或验证字段内容,可调用json.loads方法对输出字符串进行反序列化。建议保留数据集中包含的断裂或简短样本,以确保模型学会应对含混输入。整个加载过程简洁高效,无需额外预处理即可用于训练生成式语言模型。
背景与挑战
背景概述
随着大型语言模型在复杂推理与代码生成任务中的广泛应用,将冗长的推理轨迹转化为简洁、结构化的摘要已成为提升模型可解释性与人机协作效率的关键环节。该数据集由相关研究团队于2024年创建,旨在解决智能体(Agent)在执行多步骤任务时产生的长链推理无法被高效压缩与传递的问题。通过收集超过4万条涵盖代码调试、数学推导、工具调用等场景的推理轨迹,并人工构建包含标题、副标题、摘要及当前任务的结构化JSON模板,该数据集为训练模型生成精炼的进展报告提供了高质量的基准资源。其在HuggingFace上的发布推动了文本生成与摘要领域的研究,尤其强化了智能体系统在实时反馈、任务监控与自动化迭代中的应用能力。
当前挑战
该数据集所面临的挑战集中于处理智能体推理轨迹的压缩与结构化表述这一核心领域问题。首先,长上下文推理链中往往嵌入大量技术细节与冗余步骤,如何在保留关键决策节点与因果逻辑的前提下,将数万token的内容浓缩至寥寥数语,对模型的抽象与泛化能力提出了严苛要求。其次,构建过程中需应对数据标注质量与格式一致性的挑战,确保每条JSON摘要严格遵循统一的四字段框架,同时避免因存储为字符串格式而导致的解析偏差。此外,故意注入的噪音样本与断裂轨迹要求模型具备鲁棒性,能够在信息不完整或模糊情况下输出符合预期的结构化摘要。
常用场景
经典使用场景
在人工智能与自然语言处理领域,该数据集专为训练模型从冗长的推理轨迹或工作日志中提炼出结构化摘要而构建。其经典使用场景聚焦于将智能体在编程、调试或复杂任务执行过程中产生的冗长中间步骤,转化为包含标题、副标题、摘要与当前任务的紧凑JSON格式。这种设计使得模型能够摒弃自由形式的冗长叙述,转而生成清晰、可读且富含关键信息的进展报告,从而在代理工作流的监控与回溯中发挥核心作用。
解决学术问题
该数据集精准回应了学术界在可解释与可追踪人工智能方向上的核心难题——如何将智能体内部复杂的认知链条压缩为人类可迅速理解的紧凑表述。传统方法常面临信息过载或细节缺失的困境,而本数据集通过结构化的摘要形式,为模型提供了从多源异构的推理痕迹中提取高维特征的训练范式。其意义在于弥合了黑箱推理过程与透明化沟通之间的鸿沟,推动了模型从“能推理”向“会汇报”的关键跃迁,为后续研究奠定了基准。
衍生相关工作
围绕该数据集衍生了多项具有启发性的后续工作。研究者利用其格式约束特性,训练出能够自适应调节摘要粒度的模型,从而在不同复杂度的任务间进行动态平衡。另有一些工作探索了将摘要结构反向注入到模型推理过程中的可能性,使其在生成阶段即内嵌结构化的汇报能力。此外,该数据集的结构化思路也启发了多模态追踪摘要领域的研究,推动了跨文本、代码与执行轨迹的统一表达范式的成型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务