遇见数据集

QUEST-SFT-Data-Objective-Script

收藏
Hugging Face2026-07-01 更新2026-07-02 收录
官方服务:

资源简介:

QUEST SFT Data Objective Script 是一个用于QUEST/DeepResearch目标任务的监督微调(SFT)数据集。该数据集专门为客观评估任务设计,每个数据样本包含一个SFT对话、从中提取的真实用户问题,以及对应的Python目标评估脚本。数据集遵循与QUEST-RL-Data类似的宽泛模式,包含prompt、reward_model、extra_info和rl_task_category等字段,并额外增加了messages、question、eval_script、eval_script_path和eval_script_sha256等关键列,用于完整记录对话、问题和评估脚本的对应关系及验证信息。数据集规模为4,670个已发布样本,来源于5,070个唯一源问题,另有410个因中间文件被意外删除而无法验证对应关系的问题未被包含在内。数据集适用于训练和评估能够执行深度研究、回答客观问题的大型语言模型,特别是那些需要基于给定脚本进行自动化客观评估的任务。使用本数据集时,需要同时下载配套的eval_scripts/目录下的Python评估脚本,并确保正确配置PYTHONPATH以导入QUEST代码库中的评估框架(obj_task_eval)。

QUEST SFT Data Objective Script is a supervised fine-tuning (SFT) dataset for QUEST/DeepResearch objective tasks. The dataset is specifically designed for objective evaluation tasks, with each data sample containing an SFT dialogue, the real user question extracted from it, and the corresponding Python objective evaluation script. The dataset follows a broad pattern similar to QUEST-RL-Data, including fields such as prompt, reward_model, extra_info, and rl_task_category, and adds key columns like messages, question, eval_script, eval_script_path, and eval_script_sha256 to fully record the correspondence and verification information between dialogues, questions, and evaluation scripts. The dataset consists of 4,670 published samples derived from 5,070 unique source questions, with an additional 410 questions not included due to the accidental deletion of intermediate files preventing verification of correspondence. It is suitable for training and evaluating large language models capable of performing deep research and answering objective questions, particularly those requiring automated objective evaluation based on given scripts. When using this dataset, it is necessary to download the accompanying Python evaluation scripts from the eval_scripts/ directory and ensure proper configuration of PYTHONPATH to import the evaluation framework (obj_task_eval) from the QUEST codebase.

提供机构:
OSU NLP Group
创建时间:
2026-07-01
原始信息汇总

数据集概述:QUEST SFT Data Objective Script

该数据集是 QUEST / DeepResearch 项目中用于监督微调(SFT) 的客观任务数据子集。它包含了SFT对话、提取的用户问题以及对应的客观评估脚本

  • 许可证: MIT
  • 语言: 英语
  • 任务类别: 文本生成
  • 数据规模: 1K < n < 10K(共4,670行)
  • 数据文件: 单个Parquet文件 (data/train.parquet)

主要特征

该数据集遵循与 osunlp/QUEST-RL-Data 相似的宽模式,并额外增加了以下关键列:

列名 描述
prompt 包含提取问题的聊天式输入(list[{"role", "content"}])。
messages 原始的SFT对话消息。
question 提取出的真实用户问题(已移除附加的研究状态/历史)。
eval_script 完整的Python客观评估脚本文本。
eval_script_path 该评估脚本在数据集仓库中的路径。
eval_script_sha256 评估脚本内容的SHA-256哈希值。
reward_model 指向客观脚本的奖励配置。
rl_task_category 始终为 "objective"

数据规模与匹配

  • 发布行数: 4,670
  • 考虑的独特源问题: 5,070
  • 评估脚本数量: 4,670个(位于 eval_scripts/ 目录下,均为 .py 文件)
  • 未发布的源问题: 410个(因中间文件意外丢失,无法验证问题与脚本的对应关系)

匹配流程: 通过SFT任务ID与脚本文件名匹配、评估脚本源代码或Python字符串常量中精确匹配问题文本、以及轨迹JSON文件名匹配等至少一种方式,确认问题与脚本的对应关系。

数据加载

该数据集可通过 datasets 库加载,支持流式和非流式模式,也可直接读取Parquet文件。

  • 流式加载(低内存): load_dataset("osunlp/QUEST-SFT-Data-Objective-Script", split="train", streaming=True)
  • 非流式加载(全量加载): load_dataset("osunlp/QUEST-SFT-Data-Objective-Script", split="train")
  • 下载评估脚本: 可使用 snapshot_download 函数下载 eval_scripts/*.py 文件,确保SFT行与对应脚本一起使用。

评估脚本说明

评估脚本基于 obj_task_eval 框架,该框架在 QUEST 代码库的 training_scripts/rl/recipe/deepresearch/obj_task_eval 目录下。运行这些脚本需要将相应路径添加到 PYTHONPATH,以便导入 EvaluatorAggregationStrategy 等模块。

搜集汇总
数据集介绍
QUEST-SFT-Data-Objective-Script 数据集图片
构建方式
QUEST-SFT-Data-Objective-Script数据集是QUEST/DeepResearch项目中用于监督式微调的关键组成部分,其构建过程严谨而精炼。该数据集从原始SFT文件中提取用户问题,通过三重匹配机制——包括任务ID与评估脚本文件名的直接对应、问题文本在评估脚本源或Python字符串常量中的精确匹配,以及轨迹JSON文件与评估脚本文件名的关联验证——确保每个问题与其对应的目标评估脚本形成可靠映射。最终,经过严格筛选,共有4,670个经过验证的样本被纳入发布,而无法确认对应关系的410个问题则被排除在外,体现了数据集构建的准确性与审慎态度。
使用方法
研究者可通过HuggingFace Datasets库便捷加载该数据集,支持流式与全量两种模式以适配不同内存需求。关键使用方法在于将每个SFT样本与其对应的评估脚本配对运行,以执行客观任务评估。需注意,评估脚本依赖于QUEST代码库中obj_task_eval框架,执行前需将training_scripts/rl/recipe/deepresearch路径添加至PYTHONPATH环境变量。同时,可使用huggingface_hub的snapshot_download功能单独下载所有评估脚本,确保本地文件系统与数据集样本的完整对应,从而实现端到端的目标任务微调与评估流程。
背景与挑战
背景概述
QUEST-SFT-Data-Objective-Script数据集由俄亥俄州立大学自然语言处理小组(OSU NLP Group)于2026年发布,旨在为深度研究代理(Deep Research Agents)提供监督微调(SFT)数据支持。该数据集隶属于QUEST项目,其核心研究问题聚焦于如何利用全合成任务训练前沿的深度研究代理,从而解决复杂、多步的自动化信息检索与推理问题。数据集中包含4,670条经过精心配对的SFT对话记录与对应的Python客观评估脚本,每条样本均包含用户问题、对话消息及可复现的评估代码,极大提升了模型训练与评测的透明度和标准化水平。该数据集及其关联的RL数据、多阶段检查点共同构建了QUEST研究生态,在自然语言处理与人工智能代理领域具有重要影响力,为后续自主研究系统的开发奠定了坚实基础。
当前挑战
该数据集所解决的领域问题主要包括:深度研究代理在复杂任务中的目标导向推理与自动化验证能力不足,尤其是在开放域环境下难以生成可量化、可重复的评估标准。数据集构建过程中的挑战尤为突出:首先,从原始SFT文件中准确提取用户问题并剥离上下文干扰信息(如研究状态摘要)需要精心设计的匹配算法,且仅当问题与评估脚本在任务ID、文本或轨迹文件上达成一致时才予以保留;其次,原始计划中的410条高质量样本因中间文件意外删除而无法配准,暴露出数据版本管理与备份机制的重要性。此外,确保4,670条评估脚本的独立性与可执行性,以及维护跨任务一致的评估框架,也是构建过程中需克服的关键工程挑战。
常用场景
经典使用场景
在深度研究(Deep Research)与大型语言模型的客观任务评估领域,QUEST-SFT-Data-Objective-Script数据集被广泛应用于监督微调阶段。其核心特色在于为每一条训练样本配套提供了完整的Python客观评估脚本,使得模型在微调过程中不仅能够学习对话生成,还能同步理解如何通过代码化脚本对其任务表现进行量化评判。典型使用场景包括构建具备自评估能力的推理智能体,通过整合question字段提取的真实用户查询与eval_script字段定义的评估逻辑,训练模型在生成答案后自动执行脚本验证结果正确性。该数据集尤其适合需要精细控制模型推理行为的场景,例如多步推理链验证、结构化数据查询以及基于规则的客观任务求解。
解决学术问题
该数据集着力解决了学术界长期困扰的客观任务评估标准化困境。传统研究往往依赖人工标注或近似匹配来评估模型在数学、逻辑和知识查询等客观问题上的表现,存在评估标准模糊、可复现性差的问题。QUEST-SFT-Data-Objective-Script通过为4670条高质量SFT样本绑定可执行的Python评估脚本,首次实现了评估逻辑的代码化、硬编码和可验证。这一创新使得学术社区能够以完全相同的方式复现模型性能评估,消除了因评估脚本差异带来的性能波动。更重要的是,该方案为强化学习中的奖励信号设计提供了可靠的客观目标函数,推动了从纯监督学习向可验证奖励驱动的深度研究训练范式的转变。
实际应用
在实际产业应用中,该数据集为构建高可靠性知识问答系统与自动化研究助手提供了关键支撑。得益于其中集成的客观评估脚本,开发者可以在模型部署前利用脚本来验证其在特定领域任务上的准确性,尤其适用于金融数据分析、科学文献检索、法律条文查询等对结果正确性要求极为严苛的场景。此外,该数据集能够直接服务于基于强化学习的模型优化流程,将eval_script作为奖励计算模块,实现模型在真实问答环境中自我纠错与持续进化。工程团队还可将其作为单元测试数据源,确保每次模型更新后对客观任务的回答质量未出现回退,从而保障生产系统的稳定性与可信度。
数据集最近研究
最新研究方向
QUEST-SFT-Data-Objective-Script数据集聚焦于深度研究(DeepResearch)场景下的监督微调与客观评估,其核心价值在于为大型语言模型提供了一种结构化、可验证的客观任务训练范式。该数据集的前沿方向体现在将复杂的真实用户问题与对应的Python评估脚本紧密耦合,通过任务ID匹配、问题文本比对及轨迹JSON文件映射等多重验证机制,确保了4670个高质量训练样本的可靠性和可复现性。这一设计直接呼应了当前AI研究中对推理密集型任务客观评价的需求,尤其在智能体系统和自动化研究领域,能够推动模型在信息检索、多步推理和结论验证等关键环节的能力跃升。作为QUEST系列的重要组成部分,该数据集与强化学习、中继训练等数据形成互补,为构建可进行端到端客观评估的深度研究智能体提供了标准化基础设施,其影响已延伸至学术论文自动审阅、科学实验设计等前沿热点方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务