RefRT
收藏资源简介:
RefRT是第一个用于RGB-Thermal Referring Multi-Object Tracking(RT-RMOT)的基准数据集,旨在在低能见度场景(如夜间、雾天、隧道等)中通过融合自然语言描述、RGB外观特征和热红外轮廓来实现鲁棒的目标跟踪。
RefRT is the first benchmark dataset for RGB-Thermal Referring Multi-Object Tracking (RT-RMOT), which is designed to achieve robust object tracking in low-visibility scenarios such as nighttime, foggy conditions, tunnels and similar scenarios by fusing natural language descriptions, RGB appearance features and thermal infrared contours.
数据集概述:RT-RMOT (RGB-Thermal Referring Multi-Object Tracking)
RT-RMOT 是首个面向全天气低能见度场景的 RGB-热红外融合指代多目标跟踪(Referring Multi-Object Tracking, RMOT)基准与框架。通过融合自然语言描述、RGB 外观特征和热红外轮廓,解决了传统 RMOT 在夜间、雾天、隧道等低能见度条件下性能严重下降的问题。
核心贡献
- 新任务:提出 RGB-Thermal Referring MOT (RT-RMOT),通过语言、RGB 和热红外三模态互补实现低能见度下的鲁棒跟踪。
- 新数据集:构建 RefRT 数据集,是首个 RT-RMOT 基准数据集。
- 新方法:提出 RTrack 统一框架,基于多模态大语言模型 (MLLM),包含 MLLM 感知模块、轨迹预测模块(卡尔曼滤波)和身份关联模块(匈牙利匹配)。
- 新策略:提出 Clipped Advantage Scaling (CAS) 策略,抑制强化学习微调中的梯度爆炸,提升训练稳定性。
- 新奖励:设计复合奖励函数,平衡探索与利用。
RefRT 数据集详情
| 属性 | 描述 |
|---|---|
| 数据集名称 | RefRT |
| 场景数量 | 72 个 |
| 自然语言描述 | 388 条高质量描述 |
| 标注物体数 | 1,250 个 |
| L-RGB-T 三元组 | 166,147 个 |
| 覆盖场景 | 校园、城市道路等,包含夜间、雨、雪等低能见度条件 |
| 模态对齐 | 所有 RGB 与热红外帧为像素级对齐 |
| 下载方式 1 (推荐) | Hugging Face: huggingface-cli download jz-fan/RefRT --repo-type dataset --local-dir ./data/RefRT |
| 下载方式 2 | 百度网盘: https://pan.baidu.com/s/1wEQ1h1aSzsPHHr-JiNoYSw (密码: umgn) |
数据集结构
data/RefRT/ ├── train/ │ ├── sequences/ # 训练视频序列 │ │ ├── seq0001/ │ │ │ ├── visible/ # RGB 图像 │ │ │ ├── infrared/ # 热红外图像 │ │ │ └── gt.txt # MOT 格式标注 │ │ └── ... │ ├── path.txt # 相对帧路径索引 │ └── description.txt # 双语 (中/英) 描述 ├── test/ │ ├── sequences/ │ ├── path.txt │ └── description.txt └── README.md
RTrack 框架与使用方法
模型权重
预训练权重通过百度网盘分享:
- 链接: https://pan.baidu.com/s/18Hran5V0T3YHWxKMnKGNZg
- 密码:
4kux - 下载后放置于
RT-RMOT/checkpoints/目录下,包含基础模型 (Qwen2.5-VL-3B-Instruct) 和微调后的 RTrack 权重 (LoRA adapter)。
快速开始
- 推理:
- 修改
rtrmot/inference/sort_inference.py中的模型路径。 - 运行
python rtrmot/inference/sort_inference.py。 - 输入:RGB 图像 + 热红外图像 + 自然语言描述。
- 输出:跟踪结果 (txt 格式) + 可视化视频。
- 修改
- 训练:
- 修改
scripts/train_lora.sh中的数据与模型路径。 - 运行
bash scripts/train_lora.sh(示例为4卡训练)。 - 关键参数:
lora_r=8,lora_alpha=16,learning_rate=1e-5,num_generations=4,beta=0.001,max_completion_length=512。
- 修改
- 评估:
- 数据预处理:运行
evaluation/scripts/Step1_data_process_for_RGBT.py将模型输出转换为 TrackEval 标准格式。 - 运行评估:运行
evaluation/scripts/run_mot_challenge.py,指定真值路径、预测路径和基准名称。
- 数据预处理:运行
环境与依赖
- Python: >= 3.10
- CUDA: >= 11.8 (推荐 12.1+)
- GPU 内存: >= 24GB (3B 模型), >= 40GB (7B 模型)
- 磁盘空间: >= 50GB (数据与模型权重)
- 核心依赖: PyTorch 2.1.0, torchvision 0.16.0, transformers, flash-attn, TrackEval。
许可与致谢
- 许可: MIT License。
- 致谢: 项目基于 Qwen2.5-VL, Open-R1-Multimodal, TRL, TrackEval, SORT 等开源工作。




