osunlp/QUEST-RL-Data
收藏官方服务:
资源简介:
QUEST RL数据是QUEST / DeepResearch强化学习配方的训练分割部分。每行数据包括`prompt`、`reward_model`、`extra_info`及相关字段。
Training split for the QUEST / DeepResearch RL recipe. Each row includes `prompt`, `reward_model`, `extra_info`, and related fields.
提供机构:
osunlp搜集汇总
数据集介绍

构建方式
QUEST-RL-Data数据集是为强化学习(RL)驱动的深度研究智能体所构建的训练数据。其核心构建方式基于QUEST/DeepResearch框架的RL配方,每一行数据均包含模拟对话形式的提示词、奖励模型配置、额外元信息以及任务类别标签。数据来源分为客观型与开放型两类,客观型任务的奖励模型可通过Python的ast.literal_eval解析,并内嵌真实答案;开放型任务则采用基于规则或量规的奖励设计。构建过程遵循版权合规原则,仅保留结构化元数据而非原始网页内容,确保数据集的可用性与合法性。
使用方法
使用者可通过HuggingFace的`datasets`库以流式或全量模式加载数据。流式加载适用于内存受限场景,而直接读取Parquet文件则便于离线分析。推荐按任务类别过滤后分别处理,并同步下载`eval_scripts/`目录下的配套评估脚本,以便将数据行与脚本保持对齐。在模型选型上,若仅需评估客观型任务,建议使用MT+SFT检查点;若需同时涵盖客观与开放任务,RL检查点将提供更全面的性能表现。
背景与挑战
背景概述
QUEST-RL-Data数据集由俄亥俄州立大学自然语言处理小组(OSU NLP Group)于2026年创建,旨在为前沿深度研究智能体的强化学习训练提供高质量数据资源。该数据集聚焦于通过完全合成任务来训练具备自主探索与推理能力的深度研究模型,核心研究问题在于如何在大规模语言模型基础上高效实现复杂的多步推理与信息整合能力。作为QUEST项目的重要组成部分,该数据集配合多阶段训练策略(包括SFT、中期训练及强化学习)显著提升了模型在客观与开放式任务上的表现,对推动自主研究型AI系统的发展具有关键影响。
当前挑战
数据集面临的核心领域挑战在于传统监督学习范式难以有效模拟真实研究场景中开放、动态且结果可验证的任务需求,而强化学习训练则需要精心设计的奖励信号来引导模型进行多步推理,避免奖励稀疏和探索效率低下问题。构建过程中,研究团队需应对海量合成任务生成的自动验证难题,确保客观任务存在可解析的准确奖励模型,同时为开放式任务设计具有鲁棒性的评分标准;此外,数据来源的版权合规性以及不同任务类别(客观/开放式)统一数据结构的实现也构成了构建阶段的显著挑战。
常用场景
经典使用场景
在深度研究与智能体强化学习的交叉领域,QUEST-RL-Data数据集被广泛用作训练前沿深度研究智能体的核心强化学习语料。该数据集精心构造了包含'客观型'与'开放型'两类任务的多轮对话提示,每一行数据均配备精细化的奖励模型配置与丰富的元信息,为研究者提供了从监督微调迈向强化学习优化的桥梁。其经典用法在于结合匹配的评估脚本,对语言模型进行奖励驱动的策略训练,从而赋予模型在复杂研究任务中自主探索、多步推理与自我纠错的能力,是构建下一代深度研究智能体的基石。
解决学术问题
该数据集直面当前大语言模型在深度研究场景中面临的三个关键学术挑战:缺乏结构化的多步推理奖励信号、客观验证型与开放生成型任务的训练数据鸿沟、以及全合成任务下强化学习的泛化困境。通过提供带有明确奖励模型的任务样本,QUEST-RL-Data使得研究者能够系统性地研究如何利用强化学习从探索性反馈中学习复杂策略,解决了传统监督学习难以覆盖的长链条、多步决策优化问题。其意义在于开创了全合成任务驱动的深度研究智能体训练范式,为强化学习在复杂知识工作领域的落地提供了可复现的数据基座。
实际应用
在实际应用层面,基于QUEST-RL-Data训练的模型能够在自动科研文献检索、多源信息综合分析与结构化报告生成等场景中展现卓越性能。例如,在给定一个深度的研究问题后,模型可以自主规划搜索路径、调用网络工具、筛选并整合关键发现,最终输出具有引用支撑的详细报告。该数据集同样适用于构建企业级智能研究助手,辅助科研人员在文献综述、实验方案设计及跨学科知识融合等工作中提升效率。此外,其'客观型'任务还可直接服务于自动化评测与事实性问答系统的开发。
数据集最近研究
最新研究方向
面向深度研究代理的强化学习训练数据构建。QUEST-RL-Data数据集聚焦于利用全合成任务来训练前沿的深度研究(DeepResearch)大语言模型代理,其核心创新在于通过强化学习范式,系统性地整合了客观型(objective)与开放式(open-ended)两类奖励建模机制。该数据集为每一条训练样本配备了精细化的奖励模型配置与评估脚本,使得模型能够在复杂调研、多步推理等具有挑战性的场景下进行自主探索与策略优化。这一方向与当前大语言模型向智能代理(Agent)演进的趋势紧密相连,为突破传统监督微调在泛化性与自主决策能力上的瓶颈提供了关键数据基础,对推动具备深度研究能力的通用人工智能系统具有里程碑意义。
以上内容由遇见数据集搜集并总结生成



