遇见数据集

ReMoT

收藏
github2026-07-09 更新2026-07-13 收录
数据链接:
官方服务:

资源简介:

ReMoT数据集是一个用于强化学习与运动对比三元组的数据集,包含多个子数据集(如agibot、scannet、generaldata),支持机器人夹爪和手臂状态识别、相机视角变化识别以及一般视觉推理任务。数据采用JSONL格式,每个条目包含图像路径、对话消息和真实答案。

The ReMoT dataset is a specialized dataset for reinforcement learning and motion contrast triplet tasks. It comprises multiple sub-datasets such as agibot, scannet, and generaldata, supporting tasks including robot gripper and arm state recognition, camera view change recognition, and general visual reasoning tasks. The data is stored in JSONL format, with each entry containing the image path, dialogue messages, and ground-truth answers.

创建时间:
2026-07-08
原始信息汇总

ReMoT 数据集详情

数据集概述

ReMoT(Reinforcement Learning with Motion Contrast Triplets)是一个用于机器人运动对比学习的多模态数据集,相关论文被 CVPR 2026 接收为 Highlight 论文。

数据集下载

数据格式

所有数据集使用 JSONL 格式存储,每条数据包含以下字段:

字段 类型 描述
id string 唯一数据标识符
images list 图像路径列表(支持多图像输入)
messages list 对话消息列表
solution string 标准答案,格式为 <answer>ABC</answer>

示例数据

json { "images": [ "/data/guozeyu/DATA/agibot/resize_images_4/anchor/a_grab_release_656686_000150_35883.png", "/data/guozeyu/DATA/agibot/resize_images_4/positive/p_grab_release_656686_000508_35883.png", "/data/guozeyu/DATA/agibot/resize_images_4/negative/n_grab_release_656686_000039_35883.png" ], "messages": [{ "role": "user", "content": "The image showed to you is what the robot seen by its eyes. In the image, the robotic arm on the left is the robots left arm, and the robotic arm on the right is the robots right arm. Focus only on robot arm/gripper motion across the three images. Please select from the following options whether the left gripper is opened or closed from Image 1 to Image 2? A: Opened, B: No movement, C: Closed. Please select from the following options whether the left gripper is opened or closed from Image 1 to Image 3? A: Opened, B: No movement, C: Closed. Please select from the following options whether the left gripper is opened or closed from Image 2 to Image 3? A: Closed, B: No movement, C: Opened. Answer all three questions above in order. Only return the correct option A, B,or C for each of the three questions in order inside <answer></answer>, e.g., <answer>CAB</answer>" }], "solution": "<answer>CAC</answer>", "id": "idx_resize_4_test_0" }

数据集组成

数据集 任务类型 描述
agibot 机器人夹爪和手臂状态识别 判断不同帧之间夹爪和手臂的状态变化
scannet 相机视角变化识别 判断不同帧之间的相机视角变化
generaldata 通用视觉推理 包括相对位置(mm)、目标检测(om)、计数(vl)等任务

图像路径追溯说明

由于仅开源 JSONL 文件(不含原始图像文件),可根据文件命名约定追溯原始图像。

1. Agibot 数据集

  • 示例路径: agibot/resize_images_4/anchor/a_grab_release_656686_000150_35883.png
  • 文件结构说明:
    • a_move_complex: 任务类型(如 grab_releasemove_complex 等)
    • 652288: Agibot 数据集中的场景或任务编号
    • 000450: 视频帧编号

通过上述字段可将图像追溯回 Agibot 数据集中的特定场景和帧序列。

2. ScanNet 数据集

  • 示例路径: scannet/crops3/scene0086_02_000300_A.png
  • 文件结构说明:
    • scene0086_02: ScanNet 数据集中的场景编号
    • crops3: 第三个裁剪版本
    • 000300: 帧编号
    • A: 原始帧图像
    • B: 模拟反向相机运动的裁剪图像

通过上述标识符可在原始 ScanNet 数据集中定位对应图像。

搜集汇总
数据集介绍
ReMoT 数据集图片
构建方式
ReMoT数据集以三元组运动对比为核心构建逻辑,专注于机器人操作与视觉场景理解中的细粒度运动状态识别。每个数据样本通过精心设计的三元组图像结构(锚点、正例、负例)来刻画运动差异,覆盖机器人夹爪开合、手臂运动、相机视角变化及通用视觉推理等任务。数据采用JSONL格式存储,每条记录包含图像路径、多轮对话消息以及标准答案,其中答案以特定标签包裹,便于自动解析与评估。数据集源自Agibot、ScanNet等公开真实场景,通过严格的图像命名规范可追溯至原始帧序列,确保了数据来源的可靠性与可复现性。
特点
该数据集最显著的特点在于其三元组运动对比机制,通过锚点、正例与负例的并列呈现,迫使模型关注微小而关键的运动状态变化,从而提升对机器人夹爪开合、手臂位移等精细动作的判别能力。此外,数据集涵盖了从机器人夹爪状态识别到相机视角变化判别,再到通用视觉推理的多层次任务,形成了从物理动作到抽象理解的完整评测体系。每个任务均定义了明确的评价指标,如精确匹配与字符级匹配,使得模型性能的量化评估既严格又细致。
使用方法
使用ReMoT数据集进行模型评估时,首先需通过单数据集或多数据集并行评估脚本完成推理任务。支持从检查点恢复中断的评估过程,确保了大规模评测的稳定性与效率。评估结果自动生成包含核心指标与详细分类精度的Excel报告,用户只需配置模型路径、输出目录等参数,即可一键完成从批处理到结果汇总的全流程操作。数据集本身不直接提供图像文件,但凭借规范的文件命名约定,研究者能够便捷地从原始数据源中定位并匹配对应的图像序列,进而验证模型的预测结果。
背景与挑战
背景概述
在具身智能与机器人操控领域,精准感知机械臂与夹爪的动态状态是执行复杂任务的关键前提。ReMoT(Reinforcement Learning with Motion Contrast Triplets)数据集由研究团队于2026年创建,作为CVPR 2026的亮点论文成果,聚焦于机器人视觉运动对比学习这一前沿课题。该数据集的核心研究问题在于如何通过三帧图像的运动对比,使视觉语言模型能够准确识别机械臂夹爪的开合状态、相机视角变化以及空间相对位置等细粒度运动信息。由多个子数据集构成,包括源于Agibot数据集的机器人夹爪与手臂状态识别、ScanNet的相机视角变化识别以及涵盖目标检测与计数等通用视觉推理任务的数据,ReMoT为评估和提升模型在具身场景中的运动理解能力提供了标准化基准,对推动机器人自主学习与交互技术的发展具有重要意义。
当前挑战
ReMoT数据集面临的核心挑战在于领域问题层面:现有视觉语言模型在处理连续帧之间的运动对比时,常因特征混淆而难以精确判别夹爪的微小开合变化或相机视点的细微偏移,这限制了机器人在动态环境中执行抓取、放置等任务的鲁棒性。在构建过程中,数据集的创建需克服多项困难:如何从大规模原始视频中高效提取并标注三类对比图像(锚点、正样本、负样本),以确保运动对比的语义一致性;如何设计能够覆盖多种真实场景与机械臂操控模式的样本,例如复合运动任务与夹爪释放任务;以及如何建立跨数据集的标准化格式(JSONL)与图像追溯机制,使研究人员能够从命名规则中还原帧级原始场景,从而保障数据集的可用性与可复现性。
常用场景
经典使用场景
在机器人操作与视觉理解交叉领域,ReMoT数据集通过引入三元组运动对比机制,为评估多模态大模型在细粒度时序动作推理中的表现提供了标准化基准。该数据集涵盖agibot、scannet和generaldata三个子集,分别聚焦于机器人夹爪状态变化、相机视角位移以及通用视觉推理任务。其经典用法要求模型在给定三帧连续图像(锚点、正样本、负样本)的条件下,精准判别物体或机械臂的相对运动状态,从而验证模型对时空动态信息的捕获与抽象能力。
解决学术问题
ReMoT数据集旨在弥补现有视觉语言基准在时序运动理解维度上的缺失,解决了模型是否真正理解‘运动’这一核心概念的学术难题。传统数据集往往侧重于静态场景语义或简单动作分类,而ReMoT则通过多阶段运动对比任务,迫使模型从帧间差异中提取细粒度的开合、移动、加减速等物理信号。这一设计显著推动了多模态模型在细粒度运动推理、因果时序建模以及跨模态对齐方面的研究进展,为评估机器人的视觉感知与认知一致性提供了新范式。
衍生相关工作
基于ReMoT数据集的独特设计,已有学者在其基础上衍生出若干经典工作。一方面,研究者借鉴该三元组运动对比范式,扩展出面向视频模态的时空对比学习框架,用于提升模型在无监督环境下的动作表征能力。另一方面,该数据集催生了一系列针对‘运动意图预测’的微调策略与提示工程技术,使得大语言模型能够在机器人任务中理解人类指令背后的动态目标。此外,ReMoT的评估指标(如Exact Match与Per-Char Match)已成为衡量时序推理模型性能的标杆,被后续基准测试广泛采纳与改进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务