遇见数据集

bethgelab/qval

收藏
Hugging Face2026-07-05 更新2026-07-22 收录
官方服务:

资源简介:

QVal密集信号数据集是一个用于评估长视野LLM代理密集监督信号(包括奖励、状态价值、Q值和优势)的基准数据集,通过蒙特卡洛参考标签进行验证。该数据集包含四个子集:qval-terminalbench(基于TerminalBench)、qval-frozenlake(基于FrozenLake)、qval-openapps(基于OpenApps)和qval-alfworld(基于ALFWorld),每个子集提供可执行工件、示例数据行、地面真值标签以及相关图像文件,适用于强化学习任务,并遵循非商业许可(cc-by-nc-4.0)。

The QVal Dense Signal Dataset is a benchmark dataset for evaluating dense supervision signals (including rewards, state values, Q-values, and advantages) for long-horizon LLM Agents, which is validated via Monte Carlo reference labels. This dataset comprises four subsets: qval-terminalbench (based on TerminalBench), qval-frozenlake (based on FrozenLake), qval-openapps (based on OpenApps), and qval-alfworld (based on ALFWorld). Each subset provides executable artifacts, sample data entries, ground-truth labels and associated image files, is applicable to reinforcement learning tasks, and follows the non-commercial CC BY-NC 4.0 license.

提供机构:
bethgelab
搜集汇总
数据集介绍
bethgelab/qval 数据集图片
构建方式
QVal数据集以密集监督信号评估为核心目标,基于蒙特卡洛(Monte Carlo)参考标签构建而成。其构建过程涵盖四个子集:qval-terminalbench、qval-frozenlake、qval-openapps及qval-alfworld,分别对应不同任务场景。每个子集的构建方式包括生成可执行运行时工件(如<subset>/runtime/dataset.pkl)、提供可检查的Parquet格式示例数据,以及存储经最大聚合处理后的Q值和状态值的地面真实标签(JSON格式)。此外,数据集还包含关联的图像文件和Croissant元数据,以确保数据结构的完整性与可解析性。
特点
QVal数据集的一大特色在于其专注评估密集监督信号(包括奖励、状态值、Q值和优势函数)与蒙特卡洛参考标签间的一致性,为长时序LLM代理环境中的信号质量提供了量化基准。数据集以子集形式组织,每个子集均包含可执行工件与结构性示例,支持研究者从汇总和排序两种视角比较信号与真实标签的偏差。此外,数据集遵循cc-by-nc-4.0许可协议,并内置Croissant元数据以增强可发现性与互操作性,整体设计兼顾了评估的科学严谨性与实用便捷性。
使用方法
用户可通过HuggingFace的`load_dataset`函数轻松加载QVal数据集,例如调用`load_dataset('bethgelab/qval', '<subset>')`指定具体子集。每个子集内的`examples.parquet`文件提供了可检查的示例数据行,适合初步数据分析与可视化;而`gt/`目录下的JSON文件则直接提供蒙特卡洛地面真实标签,便于直接用于信号质量的评估与对比。对于需要复现基准实验的场景,可借助`runtime/dataset.pkl`中的可执行工件配合原始论文代码运行完整评估流程。整体使用方式灵活,兼顾了低门槛接入与深度复现的需求。
背景与挑战
背景概述
在强化学习与长程语言智能体(LLM Agent)交叉融合的研究前沿,对智能体在长期序贯决策过程中所依赖的稠密监督信号(如奖励、状态价值、Q值与优势函数)进行可靠评估,始终是制约该领域发展的核心瓶颈。QVal数据集正是为应对这一挑战而构建,由Sergio Hernández-Gutiérrez、Matteo Merler等学者于2026年提出,源自论文《QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents》。该数据集汇聚了TerminalBench、FrozenLake、OpenApps与ALFWorld四个典型子集,为评估与对比各类稠密监督信号在长期任务中的有效性提供了标准化基准。QVal的诞生不仅推动了强化学习信号评价体系的理论完善,更为后续研究走向更高自主性与鲁棒性的智能体系统奠定了方法论基础。
当前挑战
QVal数据集的研究与实践面临多重挑战。首要挑战在于所针对的领域核心问题——如何准确评估长期任务中稠密监督信号的质量。传统稀疏反馈仅能反映任务终点状态,难以引导智能体在复杂环境中的每一步优化;而稠密信号虽能提供细粒度指导,但其真实性与蒙特卡洛参考标签间的偏差缺乏系统的量化工具。QVal为此设计了多维度评价方案,但评估本身伴随高昂的计算开销。在数据集构建层面,子集涵盖的终端控制、表格导航、手机应用及家庭模拟等异构环境,对数据收集的规模化与一致性构成严峻考验;同时,标注过程中蒙特卡洛标签的获取需大量采样,存在效率与资源消耗的平衡难题。此外,跨域基准的统一性与可复用性,亦对数据格式与元数据标准化提出较高要求。
常用场景
经典使用场景
在长期时序决策与语言智能体研究的交汇处,QVal数据集为评估密集监督信号在长视野任务中的表现提供了标准化测试平台。该数据集涵盖TerminalBench、FrozenLake、OpenApps和ALFWorld四个子集,分别对应命令行交互、经典强化学习迷宫、移动应用操作和虚拟家居任务等典型环境。研究者可借助QVal加载奖励、状态价值、Q值与优势函数等多种密集信号,并将其与蒙特卡洛基准标签进行定量对比,从而系统性地衡量监督信号在复杂任务链中的质量与效用。这一设计极大便利了不同密集信号在可控场景下的公平比较与重复验证。
解决学术问题
QVal直面长视野语言智能体训练中密集信号难以评估的困境。传统方法常依赖稀疏的终极奖励,难以有效指引智能体在漫长执行链条中纠正行为。该数据集通过提供多种密集信号的蒙特卡洛真值标签,首次建立了可量化的评估框架,使研究者能客观比较奖励塑造、优势函数估计等方法的优劣。这推动了强化学习与语言模型交叉领域对信用分配问题的理解,为开发更高效、更稳健的长期决策信号提供了关键实验条件与理论依据,对推进可解释、可优化的智能体系统具有深远学术意义。
衍生相关工作
QVal的发布催生了一系列围绕密集信号与长期决策智能体的研究工作。其基准框架已被用于开发新型奖励模型,探索如何从有限人类反馈中合成更丰富的信号;部分工作在此基础上改进了优势估计方法,提升样本效率与任务成功率。此外,QVal的子集被重新用作多模态感知与语言动作对齐的训练和评估资源,推动了终端理解、迷宫导航与家居任务执行等领域算法的迭代。该数据集还促进了可信强化学习中信号稳定性分析和智能体行为可重复性研究的深入。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务