Reflect-R1-CoT-90k, Reflect-R1-RL-30k
收藏资源简介:
该数据集由Reflect-R1-CoT-90k和Reflect-R1-RL-30k两部分构成,总计12万条样本,旨在填补长视频理解中多模态反思训练数据的空白。其内容涵盖丰富的视频问答对,通过系统化构建过程整合了视觉证据检索与推理链条,为模型提供了客观外部验证的基础。数据集主要应用于强化学习驱动的多阶段自我纠正框架训练,致力于解决传统内部闭环反思中因缺乏外部证据而导致的幻觉循环与错误修正失效问题。
This dataset comprises two subsets: Reflect-R1-CoT-90k and Reflect-R1-RL-30k, with a total of 120,000 samples. It aims to fill the gap in multimodal reflection training data for long-form video understanding. The dataset contains abundant video question-answer pairs, which integrate visual evidence retrieval and reasoning chains through a systematic construction process, providing a foundation for objective external validation of models. It is primarily applied to train reinforcement learning-driven multi-stage self-correction frameworks, addressing the issues of hallucination cycles and failed error correction in traditional internal closed-loop reflection caused by the lack of external evidence.
数据集概述
数据集名称: Reflect-R1 训练数据
发布机构: Hugging Face,由 CSDDSFSFSAFSAF 维护
访问地址: 🤗 数据集链接
数据集构成
数据集包含以下文件,用于支持 Reflect-R1 模型的冷启动监督微调(SFT)和强化学习(SD-GRPO)训练:
| 文件名 | 描述 | 用途 |
|---|---|---|
reflect_r1_cot_90k.jsonl |
Reflect-R1-CoT-90k 冷启动 SFT 数据 | 教会模型结构化反思格式 |
reflect_r1_rl_30k_short.json |
Reflect-R1-RL-30k 短视频部分 | SD-GRPO 强化学习训练 |
reflect_r1_rl_30k_long.json |
Reflect-R1-RL-30k 长视频部分 | SD-GRPO 强化学习训练 |
archives/short.tar.zst |
短视频视频文件(压缩包,解压后置于 short/ 目录) |
视频数据源 |
archives/long.tar.zst |
长视频视频文件(压缩包,解压后置于 long/ 目录) |
视频数据源 |
数据特点
- 任务场景: 长视频理解中的基于证据驱动的自我纠正。
- 训练阶段:
- 冷启动 SFT:使用
reflect_r1_cot_90k.jsonl进行监督微调,使模型学习结构化反思格式。 - 阶段一 SD-GRPO(仲裁预热):使用 RL 数据(短/长视频 JSON)进行仲裁能力热身。
- 阶段二 SD-GRPO(全链优化):在阶段一基础上进行完整推理链优化。
- 冷启动 SFT:使用
- 推理流程: 将自我纠正分解为直觉(Intuition)、验证(Verification)和仲裁(Arbitration)三个阶段,通过检索时间视觉证据来辅助纠正。
使用方式
-
下载数据集: bash hf download CSDDSFSFSAFSAF/Reflect-R1-data --repo-type dataset --local-dir /path/to/Reflect-R1-data
-
解压视频文件: bash cd /path/to/Reflect-R1-data tar -I zstd -xf archives/short.tar.zst tar -I zstd -xf archives/long.tar.zst
-
环境变量设置(例如在训练脚本中):
SHORT_VIDEO_DIR: 短视频目录路径LONG_VIDEO_DIR: 长视频目录路径SFT_DATA_JSONL: 冷启动 SFT JSONL 文件路径GRPO_SHORT_JSON: 短视频 RL JSON 文件路径GRPO_LONG_JSON: 长视频 RL JSON 文件路径
参考与说明
- 论文: 📄 arXiv 2606.27922
- 模型权重: 🤗 模型链接
- 代码仓库: 💻 GitHub 仓库
- 许可协议: Apache 2.0
更多训练细节(如奖励函数定义、本地路径准备)可参阅代码仓库中的 docs/training.md 文档。

- 1Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding清华大学; 广东人工智能与数字经济实验室(深圳); 南洋理工大学; 中国科学技术大学; 深圳大学; 加州大学; 上海交通大学 · 2026年




