遇见数据集

LongTraceRL

收藏
github2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

LongTraceRL是一个用于长上下文多跳问答的数据集,包含2,815个样本,并带有评分标注,旨在通过基于轨迹的干扰项和实体级评分奖励来改进大型语言模型的长上下文推理能力。

LongTraceRL is a dataset designed for long-context multi-hop question answering, containing 2,815 samples with scoring annotations. It aims to improve the long-context reasoning capabilities of large language models via trajectory-based distractors and entity-level scoring rewards.

创建时间:
2026-05-28
原始信息汇总

数据集概述:LongTraceRL

LongTraceRL 是一个旨在提升大语言模型长上下文推理能力的强化学习框架,并配套发布了训练数据集。

核心创新

  • 基于轨迹的分层干扰项:通过在维基百科知识图谱上进行随机游走生成多跳问题,并从真实搜索引擎智能体的轨迹中提取干扰项,构建高混淆度(Tier-1:已阅读但未被引用)和低混淆度(Tier-2:已检索但从未打开)的多级上下文,其训练难度远超随机或单一搜索方案。
  • 实体级评分奖励:基于推理链上的金实体提供细粒度的过程监督,结合仅对正确答案进行评分的正向策略,有效防止奖励作弊,并鼓励基于证据的推理。

数据集详情

  • 名称:LongTraceRL
  • 样本数量:2,815
  • 描述:包含实体级评分注释的长上下文多跳问答数据集。
  • 下载地址HuggingFace 数据集
  • 数据格式:每个训练样本为一行 JSON 数据,包含以下字段:
    • source:数据来源标识("longqa")。
    • input_messages:包含长上下文和问题的聊天格式输入。
    • label:标准答案。
    • metadata:问题元数据,包含用于评分奖励的金实体。

发布的模型

模型名称 基座模型 下载地址
LongTraceRL-4B Qwen3-4B-Thinking-2507 HuggingFace 模型
LongTraceRL-8B DeepSeek-R1-0528-Qwen3-8B HuggingFace 模型
LongTraceRL-30B Qwen3-30B-A3B-Thinking-2507 HuggingFace 模型

实验结果

实验在三个不同规模的推理大语言模型(4B 至 30B)上,针对五个长上下文基准进行了验证。

搜集汇总
数据集介绍
LongTraceRL 数据集图片
构建方式
在大语言模型长上下文推理能力提升的背景下,LongTraceRL数据集应运而生。其构建路径独辟蹊径:首先,基于维基百科知识图谱的随机游走机制,自动生成需要多跳推理的复杂问答对;随后,巧妙地从真实搜索智能体的交互轨迹中抽取干扰信息,据此构建出双层混淆体系——高混淆层级涵盖智能体已阅读但未被引用的内容,低混淆层级则收录其检索但未曾打开的页面。这种源自真实搜索行为的干扰构造方式,远超传统随机或单次搜索方案所能提供的挑战性,最终形成了包含2,815个样本、每样本均配有细致实体级评分的训练数据集。
特点
LongTraceRL数据集的独特之处在于其双重创新设计。一方面,通过轨迹驱动的分层干扰机制,所构建的上下文环境极为接近真实场景中模型检索信息的复杂性,极大考验了模型在信息芜杂的长文本中精准定位关键证据的能力;另一方面,首创的实体级评分奖励机制,将推理链条中的黄金实体作为细粒度过程监督信号,结合仅对正确答案赋予奖励的正向策略,能够有效防止奖励黑客行为,引导模型进行有据可循的推理。这套机制使得该数据集在提升长上下文推理的鲁棒性与可信度方面表现卓越。
使用方法
使用LongTraceRL数据集时,可遵循一套标准流程。首先,通过HuggingFace CLI将2,815个带有评分标注的JSON格式问答对下载至本地目录;随后,基于Slime强化学习框架进行模型训练,需注意支持最长128K提示词与32K响应的上下文长度设置。训练过程中需启动奖励服务器,为模型提供结果判定与实体级评分两项反馈。研究者亦可直接使用已发布的LongTraceRL系列模型进行评测,仅需运行评估脚本并指定检查点路径即可获得评估结果,整个过程旨在复现并验证所提方法在多个长上下文基准上的前沿性能。
背景与挑战
背景概述
在大型语言模型(LLM)能力边界不断拓展的背景下,长语境推理成为一项至关重要的能力,但现有模型在面对包含大量无关或干扰信息的长文本时,其推理性能往往显著衰退。为攻克这一难题,清华大学知识工程实验室(THU-KEG)的Lin、Zhang、Hou与Li等人于2026年提出了LongTraceRL数据集。该数据集的核心研究问题聚焦于如何通过强化学习框架,使LLM学会在长达128K token的复杂语境中进行精准的多跳推理。其创新性地从真实搜索引擎代理的轨迹中提取高混淆度干扰项(Tier-1:被读取但未引用;Tier-2:被检索但未打开),并设计了基于实体级别的细粒度评分奖励机制。LongTraceRL以其独特的数据构造方法和训练范式,为长语境推理研究提供了极具挑战性的基准测试与训练资源,对推动该领域的发展具有里程碑式的影响力。
当前挑战
LongTraceRL数据集所面临的挑战,首先体现在领域问题层面:传统的长语境多跳问答任务中,干扰项通常随机插入或基于简单的主题相似度筛选,难以模拟真实搜索场景中信息高度混杂、歧义丛生的复杂环境,导致模型极易受到错误线索的误导而忽略关键证据。其次,在数据集构建过程中,从知识图谱随机游走生成的多跳问题需严格保证逻辑链条的完备性,而源自搜索代理轨迹的干扰项需被精准地划分为不同混淆等级,这对数据标注的粒度与准确性提出了极高要求。此外,为配合实体级评分奖励的强化学习训练,每个问答样本均需附带细粒度的黄金实体标注,这大幅增加了数据构建的复杂性与成本。这些挑战共同构成了一个亟需更高效、更鲁棒的数据生成与验证方法来解决的研究瓶颈。
常用场景
经典使用场景
在长上下文推理领域,大型语言模型常因语境中充斥无关信息而性能骤降,LongTraceRL数据集则专为此设。其核心构造基于维基百科知识图谱的随机游走,生成多跳推理问题,并从真实搜索引擎代理的轨迹中提炼两类干扰项:高混淆性但未引用的内容与低混淆性却仅被检索从未打开的材料。这种分层式构造使得训练语境的挑战性远超随机或单一检索生成方案,为评测与训练模型在长达128K token的上下文中甄别核心证据、完成多步推理提供了严苛而真实的基准。
衍生相关工作
围绕LongTraceRL数据集及其方法论,已催生了一系列后续工作。其创新的轨迹式干扰项构造思路启发了更精细的对抗样本生成策略,推动了长上下文鲁棒性评估基准的演化。基于实体级评分奖励的正强化训练范式被扩展至多模态文档推理任务,如结合图表与正文的复杂问答。同时,该框架中融合的GRPO强化学习流水线与Slime训练库为社区提供了可复现的示范,促使研究者探索将搜索代理行为模拟与推理链监督相结合的新范式,从而进一步突破模型在极端长程上下文中的认知瓶颈。
数据集最近研究
最新研究方向
针对大型语言模型在长上下文推理任务中面临的检索噪声与奖励信号稀疏问题,LongTraceRL数据集创新性地融合了源自真实搜索代理轨迹的分层干扰项与细粒度实体级评分奖励机制。该研究基于强化学习框架,通过知识图谱随机游走生成多跳问题,并依据代理行为轨迹将干扰项划分为高混淆性(已查阅但未引用)与低混淆性(已检索但未打开)两个层级,从而构建出远超常规随机或单次搜索方案的挑战性训练语境。实体级评分奖励则沿着推理链为关键实体提供精细化的过程监督信号,配合仅对正确回答授予评分的正奖励策略,有效抑制了奖励欺骗现象并促进基于证据的严谨推理。实验表明,在4B至30B参数规模的推理模型上,该数据集在五个长上下文基准测试中均展现出显著性能提升,为长序列推理领域注入了全新的训练范式与研究动力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务