遇见数据集

osunlp/QUEST-SFT-Data-Objective-Script

收藏
Hugging Face2026-07-09 更新2026-07-22 收录
官方服务:

资源简介:

QUEST SFT Data Objective Script 是QUEST/DeepResearch目标任务的监督微调分割数据集。每行数据包含用户提示(prompt)、规则式奖励模型(reward_model)、额外信息(extra_info)以及目标任务类别(objective)。对应的客观评估脚本单独提供在eval_scripts/目录下。该数据集遵循与osunlp/QUEST-RL-Data相同的广义模式风格,原始问题存储在extra_info[question]中,对应脚本通过reward_model[ground_truth][task_id]标识。数据集包含4670行已发布数据,考虑了5070个唯一源问题,但未发布410个示例,因为这些示例的中间文件/客观脚本在发布前被意外删除,仅发布了问题与脚本对应关系可验证的示例。

Supervised fine-tuning split for QUEST / DeepResearch objective tasks. Each row includes the user `prompt`, a rule-style `reward_model`, `extra_info`, and the `objective` task category. The corresponding objective evaluation scripts are provided separately under `eval_scripts/`. This dataset follows the same broad schema style as `osunlp/QUEST-RL-Data`: each row includes `prompt`, `reward_model`, `extra_info`, and `rl_task_category`. The original question is stored in `extra_info[question]`, and the corresponding script is identified by `reward_model[ground_truth][task_id]`. The dataset contains 4,670 released rows from 5,070 unique source questions considered, with 410 examples not included because intermediate files / objective scripts were accidentally deleted before release, and only examples with verified question-to-script correspondence are released.

提供机构:
osunlp
搜集汇总
数据集介绍
osunlp/QUEST-SFT-Data-Objective-Script 数据集图片
构建方式
QUEST-SFT-Data-Objective-Script 数据集专为深度研究任务中的目标导向监督微调而设计,其构建过程严谨而系统。研究团队从SFT文件中提取用户问题,通过三级匹配机制——包括任务ID与评估脚本文件名匹配、问题文本在脚本源码中的精确匹配以及轨迹JSON文件名与评估脚本文件名的交叉验证——确保每个样本都有对应的目标评估脚本。最终,从5070个候选问题中筛选出4670个可验证的样本,排除因中间文件意外丢失而无法确认脚本对应关系的410个问题,形成了当前发布的高质量数据集。
使用方法
使用该数据集时,推荐通过Hugging Face的datasets库以流式或全量模式加载,利用huggingface_hub库同步下载eval_scripts目录下的所有评估脚本。每个SFT样本的评估脚本由reward_model['ground_truth']['task_id']标识,路径为eval_scripts/{task_id}.py。在执行目标评估前,需要将QUEST代码库中的obj_task_eval框架添加至PYTHONPATH,以确保评估脚本中的导入模块可被正常解析。这种设计允许研究者在微调过程中对模型在目标任务上的表现进行精确量化,从而针对性地优化模型性能。
背景与挑战
背景概述
在大型语言模型能力持续突破的进程中,如何以监督微调方式赋予模型执行精细、可验证的客观任务(objective tasks)成为前沿焦点。QUEST-SFT-Data-Objective-Script数据集由俄亥俄州立大学自然语言处理小组于2026年构建,依托QUEST研究体系,旨在解决深度研究(DeepResearch)场景下客观评估数据的稀缺问题。该数据集包含4,670条经过严谨匹配的监督微调样本,每条样本均关联独立的Python评估脚本与规则式奖励模型,为模型在事实性、结构化任务上的能力提升提供了高质量训练资源。作为QUEST家族的关键组成部分,该数据集推动了从单纯开放式生成向具备自动判别能力的智能体训练的范式转变,对强化学习与监督学习相结合的研究路径产生了重要影响。
当前挑战
该数据集面临的核心挑战在于两方面。其一,针对深度研究这一复杂领域,现有模型难以在开源环境中获得海量、可验证的客观任务样本,传统人工标注成本高昂且难以覆盖任务多样性,亟需一种自动化、规则化且能保证正确性的数据生成机制。其二,在构建过程中,研究者从5,070条原始问题出发,需精准地将每个问题映射至对应的评估脚本,并确保脚本逻辑与问题定义严格一致。由于中间文件与脚本意外删除,最终仅有4,670条样本可通过文件名匹配、文本精确匹配及轨迹JSON匹配三层验证策略确认可用,其余410条因无法证实对应关系而被舍弃,反映出大规模自动化构建中数据一致性与可追溯性维护的严峻挑战。
常用场景
经典使用场景
在深度研究与强化学习驱动的智能体训练领域,该数据集为监督微调提供了高质量的客观任务脚本资源。其经典使用场景在于,研究者可利用其中4,670条精心构造的对话式提示与配套的规则型奖励模型,对大型语言模型进行目标导向的细粒度调优。每一条数据都对应一个可执行的Python评估脚本,使得模型在特定任务上的表现能够被精确量化。这种设计尤其适合需要严格验证模型推理能力与决策质量的场景,例如复杂问题求解、多步推理验证等,为构建具备深层研究能力的对话代理奠定了坚实的数据基础。
解决学术问题
该数据集的核心学术贡献在于解决了客观任务评估中数据与评估脚本不匹配、难以复现的长期痛点。在深度研究智能体的训练过程中,以往研究常面临任务目标模糊、奖励信号稀疏或设计不一致等问题。QUEST-SFT-Data-Objective-Script通过为每个微调样本绑定唯一的任务标识与对应的规则化评估函数,使得模型训练与性能评估之间形成了闭环可控的对应关系。这一问题解决方案显著提升了实验的可重复性与跨研究对比的公平性,推动了强化学习与监督微调在复杂推理任务上的方法论进步,影响了后续智能体训练范式的标准化进程。
实际应用
在实际应用层面,该数据集为构建能够执行多步骤实时研究的智能助手提供了直接支撑。基于其提供的结构化提示与评估脚本,开发者可以训练出能够理解复杂用户查询、调用外部工具进行信息检索与综合分析的对话系统。典型应用场景包括自动化竞品分析报告生成、科学文献综述辅助、技术文档深度问答等。此外,数据集中包含的规则化奖励模型使得模型输出能够被自动校验,从而在金融风控、医疗诊断建议等需要严格结果准确性的领域,实现了模型行为的安全可控部署。
数据集最近研究
最新研究方向
QUEST-SFT-Data-Objective-Script数据集聚焦于深度研究代理的监督微调,通过结构化规则驱动奖励模型和客观评估脚本,推动前沿大语言模型在复杂推理任务中的精细化对齐。该数据集与DeepResearch热点紧密关联,其独特之处在于将主观问题转化为可自动化验证的客观任务,利用rubric_tree等元数据构建可回溯的评估体系,显著提升了模型在需要多步推理与事实核查场景下的表现。这一设计为构建可信赖的自主研究代理提供了标准化基准,尤其在学术辅助、知识密集型问答等应用中具有里程碑意义,同时为强化学习中的奖励建模与数据质量平衡提供了实证参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务