遇见数据集

RefRT

收藏
github2026-06-26 更新2026-07-09 收录
数据链接:
官方服务:

资源简介:

RefRT是第一个用于RGB-Thermal Referring Multi-Object Tracking(RT-RMOT)的基准数据集,旨在在低能见度场景(如夜间、雾天、隧道等)中通过融合自然语言描述、RGB外观特征和热红外轮廓来实现鲁棒的目标跟踪。

RefRT is the first benchmark dataset for RGB-Thermal Referring Multi-Object Tracking (RT-RMOT), which is designed to achieve robust object tracking in low-visibility scenarios such as nighttime, foggy conditions, tunnels and similar scenarios by fusing natural language descriptions, RGB appearance features and thermal infrared contours.

创建时间:
2026-06-25
原始信息汇总

数据集概述:RT-RMOT (RGB-Thermal Referring Multi-Object Tracking)

RT-RMOT 是首个面向全天气低能见度场景的 RGB-热红外融合指代多目标跟踪(Referring Multi-Object Tracking, RMOT)基准与框架。通过融合自然语言描述、RGB 外观特征和热红外轮廓,解决了传统 RMOT 在夜间、雾天、隧道等低能见度条件下性能严重下降的问题。

核心贡献

  1. 新任务:提出 RGB-Thermal Referring MOT (RT-RMOT),通过语言、RGB 和热红外三模态互补实现低能见度下的鲁棒跟踪。
  2. 新数据集:构建 RefRT 数据集,是首个 RT-RMOT 基准数据集。
  3. 新方法:提出 RTrack 统一框架,基于多模态大语言模型 (MLLM),包含 MLLM 感知模块、轨迹预测模块(卡尔曼滤波)和身份关联模块(匈牙利匹配)。
  4. 新策略:提出 Clipped Advantage Scaling (CAS) 策略,抑制强化学习微调中的梯度爆炸,提升训练稳定性。
  5. 新奖励:设计复合奖励函数,平衡探索与利用。

RefRT 数据集详情

属性 描述
数据集名称 RefRT
场景数量 72 个
自然语言描述 388 条高质量描述
标注物体数 1,250 个
L-RGB-T 三元组 166,147 个
覆盖场景 校园、城市道路等,包含夜间、雨、雪等低能见度条件
模态对齐 所有 RGB 与热红外帧为像素级对齐
下载方式 1 (推荐) Hugging Face: huggingface-cli download jz-fan/RefRT --repo-type dataset --local-dir ./data/RefRT
下载方式 2 百度网盘: https://pan.baidu.com/s/1wEQ1h1aSzsPHHr-JiNoYSw (密码: umgn)

数据集结构

data/RefRT/ ├── train/ │ ├── sequences/ # 训练视频序列 │ │ ├── seq0001/ │ │ │ ├── visible/ # RGB 图像 │ │ │ ├── infrared/ # 热红外图像 │ │ │ └── gt.txt # MOT 格式标注 │ │ └── ... │ ├── path.txt # 相对帧路径索引 │ └── description.txt # 双语 (中/英) 描述 ├── test/ │ ├── sequences/ │ ├── path.txt │ └── description.txt └── README.md

RTrack 框架与使用方法

模型权重

预训练权重通过百度网盘分享:

  • 链接: https://pan.baidu.com/s/18Hran5V0T3YHWxKMnKGNZg
  • 密码: 4kux
  • 下载后放置于 RT-RMOT/checkpoints/ 目录下,包含基础模型 (Qwen2.5-VL-3B-Instruct) 和微调后的 RTrack 权重 (LoRA adapter)。

快速开始

  1. 推理:
    • 修改 rtrmot/inference/sort_inference.py 中的模型路径。
    • 运行 python rtrmot/inference/sort_inference.py
    • 输入:RGB 图像 + 热红外图像 + 自然语言描述。
    • 输出:跟踪结果 (txt 格式) + 可视化视频。
  2. 训练:
    • 修改 scripts/train_lora.sh 中的数据与模型路径。
    • 运行 bash scripts/train_lora.sh (示例为4卡训练)。
    • 关键参数lora_r=8, lora_alpha=16, learning_rate=1e-5, num_generations=4, beta=0.001, max_completion_length=512
  3. 评估:
    • 数据预处理:运行 evaluation/scripts/Step1_data_process_for_RGBT.py 将模型输出转换为 TrackEval 标准格式。
    • 运行评估:运行 evaluation/scripts/run_mot_challenge.py,指定真值路径、预测路径和基准名称。

环境与依赖

  • Python: >= 3.10
  • CUDA: >= 11.8 (推荐 12.1+)
  • GPU 内存: >= 24GB (3B 模型), >= 40GB (7B 模型)
  • 磁盘空间: >= 50GB (数据与模型权重)
  • 核心依赖: PyTorch 2.1.0, torchvision 0.16.0, transformers, flash-attn, TrackEval。

许可与致谢

  • 许可: MIT License。
  • 致谢: 项目基于 Qwen2.5-VL, Open-R1-Multimodal, TRL, TrackEval, SORT 等开源工作。
搜集汇总
数据集介绍
构建方式
RefRT数据集是首个面向全气候低可见度场景的RGB-T热红外指代多目标跟踪基准数据集。该数据集通过采集校园、城市道路等多样化场景下的72个视频序列,精心标注了1250个目标对象和388条高质量的自然语言描述,形成了总计166,147组RGB-T热红外图像与文本三元组。所有可见光与热红外帧均经过像素级精确对齐,覆盖夜间、雨雪、隧道等低可见度环境,确保数据在模态互补性上的严谨性与实用性。
特点
RefRT数据集的核心特点在于其开创性的语言、可见光与热红外三模态融合机制。它首次在多目标跟踪任务中引入自然语言描述以增强目标语义理解,同时利用热红外轮廓信息弥补可见光在弱光条件下的性能退化。数据集包含丰富的双语描述文本,并确保各场景下的时间与空间一致性,为评估多模态大语言模型在复杂环境中的鲁棒跟踪能力提供了高标准测试平台。
使用方法
使用RefRT数据集时,需首先通过Hugging Face或百度网盘下载并解压至指定目录,确保数据组织符合预设的序列与标注格式。用户可基于RT-RMOT框架提供的SORT算法与多模态大语言模型(如Qwen2.5-VL)进行推理,输入对齐后的RGB与热红外图像及文本描述,输出跟踪结果。训练阶段支持GRPO强化学习与SFT微调,并配套TrackEval工具进行标准化评估,流程涵盖数据预处理与性能度量计算。
背景与挑战
背景概述
多目标跟踪(MOT)技术近年来在自动驾驶、智能监控等领域取得了显著进展,然而传统方法严重依赖可见光图像,在夜间、大雾、隧道等低能见度场景下性能急剧下降。为突破这一瓶颈,参照多目标跟踪(RMOT)任务引入自然语言描述以增强目标的辨识能力,但单一模态的RGB信息仍难以应对复杂光照环境下的外观退化。基于此,华中科技大学研究团队于2026年提出了RT-RMOT基准框架,并构建了首个面向全天气低可见度场景的双模态参照多目标跟踪数据集RefRT。该数据集包含72个场景、388条精细自然语言描述、1250个标注目标以及逾16万组RGB-热红外像素级对齐三元组,覆盖校园、城市道路等典型低可见度环境,通过融合语言语义、RGB表观与热红外轮廓的跨模态互补机制,为鲁棒跟踪研究提供了标准化评估平台,已在相关领域引发广泛关注。
当前挑战
RefRT数据集旨在攻克两大核心挑战。其一,领域问题的挑战:在低能见度环境中,传统RMOT模型因RGB图特征模糊难以有效识别并持续跟踪目标,亟需设计能自适应融合多模态信息并理解语言描述的统一框架,以避免光照、天气等干扰因素导致的跟踪失败。其二,数据集构建本身的挑战:构建像素级对齐的RGB-热红外双模态视频序列极具难度,需精确协调异源传感器在视角、帧率与空间分辨率上的差异;此外,为每帧中的多目标赋予自然语言描述并保证语义充分性,在跨场景泛化与标注一致性上存在显著困难,同时需兼顾数据规模的充足性与标注成本的控制。
常用场景
经典使用场景
RefRT数据集是首次为全天气候低可见度场景下的指代多目标跟踪(RMOT)任务构建的基准数据集。其经典使用场景涵盖夜间、雾霾、隧道、雨雪等复杂光照与环境条件,通过融合自然语言描述、RGB外观特征与热红外轮廓信息,实现多模态互补的稳健目标跟踪。研究者利用该数据集评估语言引导的跨模态跟踪算法在极端环境下的性能,尤其在可见光图像退化时,热红外模态提供的关键热辐射轮廓可有效弥补视觉信息缺失,从而验证多模态融合策略对于提升跟踪鲁棒性的核心价值。
衍生相关工作
基于RefRT数据集,衍生出了一系列具有重要影响力的代表性工作,其中最核心的是作者团队提出的RTrack框架,该框架结合多模态大语言模型、卡尔曼滤波轨迹预测与匈牙利匹配身份关联模块,首次实现了语言、RGB与热红外三模态统一建模。此外,研究者在GRPO强化学习训练框架中引入剪裁优势缩放策略,有效抑制了语言引导跟踪任务中强化学习梯度爆炸的问题。该数据集还催生了基于不同基座模型(如Qwen2.5-VL、InternVL)的指代跟踪变体方法,以及针对KITTI格式的评估扩展,初步形成了RGB-T指代多目标跟踪这一新兴研究方向的方法论体系与开源生态。
数据集最近研究
最新研究方向
RT-RMOT开创性地将RGB-Thermal多模态数据与自然语言描述相结合,定义了首个面向全恶劣光照条件下的指代多目标追踪任务,填补了传统RMOT在夜间、雾霾、隧道等低能见度场景下的性能空白。该方向前沿热点集中在基于多模态大语言模型(MLLM)的三模态互补融合框架,通过语言增强的红外轮廓与RGB外观联合表征,显著提升鲁棒追踪能力;同时引入强化学习中的CAS裁剪优势缩放策略与复合奖励函数,解决了训练不稳定的关键瓶颈。RefRT数据集的发布为自动驾驶、全天候监控等应用提供了可靠的基准,对推动智能视觉系统向更安全、更可靠的极端环境感知演进具有重要影响力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务