遇见数据集

DenseReward dataset

收藏
arXiv2026-07-15 更新2026-07-16 收录
数据链接:
官方服务:

资源简介:

DenseReward数据集是由多机构联合构建的面向机器人操作任务的密集奖励标注数据集,包含27,000个轨迹片段。该数据集覆盖了从DROID、Isaac Sim、RoboSuite和LIBERO等多个平台采集的多样化场景和60多种操作物体,通过自动化数据生成管道合成了包括碰撞、抓取失败、物体掉落等六种物理真实失败模式。数据集创建过程基于五阶段操作分解框架,采用目标扰动方法在仿真环境中自动生成带有密集帧级奖励标签的轨迹,无需人工标注。该数据集主要应用于机器人强化学习领域,旨在解决稀疏奖励信号导致的信用分配问题,为视觉语言指导的机器人操作提供细粒度任务进度反馈。

The DenseReward dataset is a densely reward-annotated dataset for robotic manipulation tasks, jointly constructed by multiple institutions and containing 27,000 trajectory segments. This dataset covers diverse scenarios and over 60 manipulation objects collected from platforms including DROID, Isaac Sim, RoboSuite, and LIBERO. It synthesizes six physically realistic failure modes such as collision, grasp failure, and object dropping through an automated data generation pipeline. The dataset creation process is based on a five-stage manipulation decomposition framework, which uses the target perturbation method to automatically generate trajectories with dense frame-level reward annotations in simulation environments without manual annotation. This dataset is primarily applied in the field of robotic reinforcement learning, aiming to solve the credit assignment problem caused by sparse reward signals and provide fine-grained task progress feedback for vision-language guided robotic manipulation.

创建时间:
2026-07-15
搜集汇总
数据集介绍
DenseReward dataset 数据集图片
构建方式
DenseReward数据集通过自动化数据生成管道构建,其核心是将机器人操作分解为触及、抓取、提升、移动与放置五个标准阶段。基于GraspNet和CuRobo等工具,系统在仿真环境中自动生成成功轨迹,并通过针对不同阶段施加精准扰动——如禁用碰撞避免导致碰撞、偏移抓取姿态造成脱靶、在运输阶段施加随机旋转引发坠落等——合成六类物理真实的失败轨迹,涵盖碰撞、脱靶、坠落、次优运动及恢复行为。最终构建了包含27,000条轨迹、超过750万帧级样本的数据集,每帧均标注有密集奖励分数和失败模式类别,无需任何人工标注。
使用方法
DenseReward的使用方法分为离线奖励预测与下游策略优化两个层次。在离线评估中,给定语言指令和包含当前帧与历史帧的观测序列,模型输出[0,1]区间的标量奖励值,可用于衡量任务进度。在下游应用中,该奖励可直接集成到模型预测控制中,在每一步评估候选动作并选择预测奖励最高的动作执行;也可用于强化学习,如与PPO或DSRL算法结合,为动作块提供密集的中间奖励信号,弥补稀疏任务完成信号在长时序操作中的信用分配不足。官方提供了训练好的模型权重和评估套件以支持复现。
背景与挑战
背景概述
DenseReward数据集由北卡罗来纳大学教堂山分校、卡内基梅隆大学、上海交通大学及亚马逊AWS AI等机构的研究人员于2026年联合创建,旨在解决机器人操作领域中强化学习奖励信号稀疏的瓶颈问题。传统奖励模型多依赖二值化成败标签或稀疏的轨迹级信号,难以在长时域操作中为中间状态提供有效的信用分配。该数据集的核心研究问题在于如何规模化获取包含多样化失败模式的密集逐帧奖励数据,以训练出能够感知任务进度、识别失败原因并提供细粒度反馈的视觉语言奖励模型。其构建标志着机器人奖励学习从稀疏标签向密集语义评估的重要跨越,为后续策略优化与模型预测控制提供了关键基础设施。
当前挑战
该数据集所应对的核心领域挑战在于,现有奖励模型缺乏对操作过程中物理失败模式的真实理解。传统方法或通过截断成功演示构造伪失败数据,或依赖人工遥操作采集失败轨迹,前者无法模拟碰撞、抓取失误、物体跌落等真实物理失败动力学,后者则难以规模化扩展。在构建过程中,研究团队面临的另一挑战是如何在无人工标注的前提下自动生成具有物理真实性的密集奖励标签。为此,团队将操作分解为五个规范阶段,并设计针对不同阶段的扰动机制(如禁用碰撞检测、偏移抓取位姿、施加运动噪声)以诱导六类失败模态,同时需借助自动有效性校验过滤物理无效序列,确保数据集的质量与一致性。
常用场景
经典使用场景
在机器人操作领域,DenseReward数据集为学习密集奖励函数提供了关键资源。其核心用途在于训练视觉-语言奖励模型,使其能够从视觉观测和语言指令中预测每个时间步的密集奖励分数,从而精准估计任务进展。该数据集涵盖27k条轨迹,跨越成功与六种失败模式(碰撞、未抓取、掉落、次优运动、恢复等),并配有细粒度的帧级奖励标签。研究者可借此训练DenseReward模型,该模型能为下游的模型预测控制与强化学习提供密集、连贯且富含信息的奖励信号,有效改善传统稀疏二元奖励带来的信用分配难题。
解决学术问题
该数据集综合解决了两个学术难题:一是大规模多样化失败数据的获取问题,传统方法依赖人工标注或对成功轨迹进行后处理,难以捕捉真实物理执行中的碰撞、脱落等失败模式;DenseReward通过自动化的模拟扰动生成物理逼真的失败轨迹,避免了人工成本并保证了数据的多样性。二是奖励信号的稀疏性问题,已有的奖励模型多输出轨迹级的二元成功标签,无法为中间动作提供有效反馈;DenseReward提供每时间步的密集奖励,使得强化学习过程中的信用分配变得更加精细,显著提升了策略优化效率。这一贡献为将强化学习实用化地引入机器人操作领域奠定了数据基础。
实际应用
在实际机器人应用中,DenseReward数据集驱动的奖励模型可用于多种操作任务的在线强化学习微调。实验表明,在真实世界的Franka机械臂上,结合DSRL算法,DenseReward使“叠杯子”任务的成功率从40%提升至80%,将“将球放入篮子”任务的成功率由30%提高至70%。此外,DenseReward还被整合进模型预测控制框架,通过采样候选动作并利用其评分选择最优行动,有效引导机械臂接近目标物体。这些成果表明该数据集为真实世界中样本效率苛刻的机器人学习提供了实用、可靠的奖励来源。
数据集最近研究
最新研究方向
近年来,机器人操作领域的研究重心正从基于模仿学习的策略迁移转向利用强化学习突破性能瓶颈,而稀疏奖励带来的信用分配难题日益凸显。DenseReward数据集在此背景下应运而生,它通过自动化仿真管道合成涵盖碰撞、抓取失败、物体掉落及恢复行为等多种失效模式的密集轨迹,并配备逐帧稠密奖励标注,打破了传统数据集仅依赖成功演示或伪失败样本的局限。该数据集驱动的稠密奖励模型能够精准刻画任务进展中的细微变化,为模型预测控制与在线强化学习提供高质量反馈信号,显著提升策略在仿真和真实环境中的学习效率,为规模化机器人学习中的奖励建模开辟了新的范式。
相关研究论文
  • 1
    DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation北卡罗来纳大学教堂山分校; 卡内基梅隆大学; 上海交通大学; Amazon AWS AI · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务