LongVideo-Reason
收藏资源简介:
LongVideo-Reason是一个包含52K长视频问答对的数据集,涵盖了体育、游戏、博客等多个领域。该数据集由NVIDIA等机构创建,旨在支持长视频推理任务,如时间推理、目标与目的推理、空间推理、情节与叙事推理等。数据集的创建过程包括视频剪辑、自动标注和问答生成,并利用了NVILA-8B等模型进行推理。
LongVideo-Reason is a dataset consisting of 52K long video question-answer pairs, covering multiple domains such as sports, gaming, and vlogging. This dataset was developed by institutions including NVIDIA, with the aim of supporting long-form video reasoning tasks including temporal reasoning, goal and intent reasoning, spatial reasoning, plot and narrative reasoning, and more. The dataset construction process includes video clipping, automatic annotation, question-answer generation, and leverages models such as NVILA-8B for reasoning.
Long-RL 数据集概述
基本信息
- 项目名称: Long-RL: Scaling RL to Long Sequences
- 论文链接: arXiv Link
- 代码许可: Apache 2.0 License
- 发布日期: 2025年7月10日
数据集亮点
- 长视频RL训练: 支持单节点(8 GPUs)上对小时级别长视频(3,600帧 - 256k tokens)进行RL训练。
- 全模态模型支持: 支持文本、视频和音频输入的全模态模型RL训练。
- 图像/视频生成RL: 支持Stable Diffusion和Wan系列等图像/视频生成模型的RL训练。
支持模型
- VILA系列模型: 支持图像和视频输入,包含序列并行(SP)支持。
- Qwen-VL系列模型: 支持文本、图像、视频和音频输入,包含序列并行(SP)支持。
- 图像和视频扩散模型: 支持Stable Diffusion和Wan系列模型的RL训练。
支持算法
- GRPO: 支持GRPO算法。
- DAPO & Reinforce: 支持DAPO和Reinforce算法,包含序列并行(SP)支持。
数据集详情
- 名称: LongVideo-Reason
- 规模: 52K长视频问答对。
- 标注: 高质量推理标注,涵盖体育、游戏和vlog等多个领域。
训练基础设施
- MR-SP系统: 多模态强化序列并行(Multi-modal Reinforcement Sequence Parallelism),包含序列并行和基于vLLM的引擎。
- 效率提升: 在长视频RL训练中实现最高2.1倍加速。
安装与使用
-
安装命令: bash git clone https://github.com/NVlabs/Long-RL.git cd Long-RL pip install -e .
-
Qwen-Omni模型训练: bash bash vllm_replace.sh
训练示例
-
单节点训练: bash bash examples/new_supports/qwen2_5_vl_3b_video_grpo.sh $VIDEO_PATH
-
多节点训练: bash bash scripts/srun_multi_nodes.sh examples/new_supports/qwen2_5_vl_3b_video_grpo.sh 2
评估
- 评估指令: 位于
eval目录中。
贡献指南
- 步骤: Fork项目、克隆仓库、安装依赖、提交修改、发起Pull Request。
核心贡献者
- Yukang Chen, Wei Huang, Shuai Yang, Qinghao Hu, Baifeng Shi, Hanrong Ye, Ligeng Zhu等。
引用
bibtex @misc{long-rl, title = {Long-RL: Scaling RL to Long Sequences}, author = {Yukang Chen, Wei Huang, Shuai Yang, Qinghao Hu, Baifeng Shi, Hanrong Ye, Ligeng Zhu, Zhijian Liu, Pavlo Molchanov, Jan Kautz, Xiaojuan Qi, Sifei Liu,Hongxu Yin, Yao Lu, Song Han}, year = {2025}, publisher = {GitHub}, journal = {GitHub repository}, howpublished = {url{https://github.com/NVlabs/Long-RL}}, }
致谢
- EasyR1: 基础代码库。
- verl: RL训练框架。
- vllm: 用于rollout引擎。
- Flow-GRPO: 图像/视频生成RL参考。

- 1Scaling RL to Long VideosNVIDIA, MIT, HKU, UC Berkeley · 2025年



