SynRL
收藏资源简介:
SynRL是由浙江大学与阿里巴巴团队联合开发的视频理解合成数据集,包含程序化生成的几何运动视频及其精确标注。该数据集包含14,700条样本(7,700条思维链样本和7,000条强化学习样本),通过Python代码生成30FPS的合成视频,并附带帧级元数据标注。数据创建过程采用物理模拟引擎追踪物体运动轨迹、速度变化和状态转换,确保时空标注的绝对准确性。该数据集专注于解决视频语言模型在时序推理(如运动方向判断、速度比较、状态跟踪等)中的核心挑战,显著提升了模型在15个视频理解基准任务上的表现。
SynRL is a synthetic video understanding dataset jointly developed by the team from Zhejiang University and Alibaba. It contains programmatically generated geometric motion videos and their precise annotations. The dataset includes 14,700 samples in total, with 7,700 chain-of-thought samples and 7,000 reinforcement learning samples. 30 FPS synthetic videos are generated via Python code, and are accompanied by frame-level metadata annotations. The data creation process uses a physics simulation engine to track object motion trajectories, velocity changes and state transitions, ensuring the absolute accuracy of spatio-temporal annotations. This dataset focuses on addressing the core challenges faced by video-language models in temporal reasoning tasks such as motion direction judgment, speed comparison and state tracking, and it significantly improves the performance of models on 15 video understanding benchmark tasks.
Synthetic-Video 数据集概述
数据集基本信息
- 数据集名称: Synthetic-Video (SynRL)
- 关联论文: Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos (CVPR 2026)
- 论文地址: https://arxiv.org/abs/2603.17693
- 项目主页: https://github.com/jiangsongtao/Synthetic-Video
核心目标
该数据集是一个用于视频推理的合成视频数据集,旨在通过程序生成的、带有真实标注的合成视频,教导视觉语言模型学习时间基元。时间基元是时间理解的基本构建块,包括方向、速度、加速度和状态跟踪。
关键特点
- 无专有模型依赖: 不依赖GPT-4V/Gemini进行数据合成,所有训练数据均通过程序生成,并带有可证明正确的标注。
- 高效性: 仅使用7.7K个合成思维链样本,其性能超越了Video-R1的165K个真实世界思维链样本,实现了21倍的数据效率。
- 广泛提升: 在15个基准测试中均取得一致性能提升,例如在RexTime(时间定位)上提升+12.6%,在TOMATO(复杂推理)上提升+4.6%。
方法概述
SynRL框架包含三个阶段:
- 程序化视频生成: 通过Python代码生成涵盖短期感知基元(速度、方向、轨迹、加速度)和长期认知基元(状态跟踪、回溯推理)的合成视频,并附带帧级元数据。
- 思维链增强: 采用一个四阶段流水线(生成→验证→反思→精炼)来生成基于过程元数据的高质量时间推理链。
- 两阶段训练:
- 监督微调:在7.7K个思维链样本上进行,以教导时间推理结构。
- 强化学习:在7K个合成视频-QA对上进行GRPO强化学习,使用可验证的准确率奖励。
训练数据构成
| 类别 | 数量 | 描述 |
|---|---|---|
| 合成思维链(用于监督微调) | 6.7K | 带有帧级标注的时间推理链 |
| 真实世界问答(用于监督微调) | 1.0K | LLaVA-Video样本(仅答案,无思维链) |
| 合成强化学习数据 | 7.0K | 带有可验证奖励的视频-QA对 |
合成视频涵盖8个主要类别和18个子类别,包括碰撞计数、方向识别、轨迹识别、速度感知、基于网格的跟踪、符号操作、代码执行和容器管理。
性能结果
时间定位
- NExTGQA mIoU: Qwen3-VL-4B模型提升+4.6(从23.5到28.1)。
- RexTime mIoU: Qwen3-VL-4B模型提升+8.0(从20.9到28.9)。
- Charades mIoU: Qwen3-VL-4B模型提升+5.1(从41.9到47.0)。
复杂推理与通用理解
- TOMATO: Qwen3-VL-4B模型提升+4.6(从32.1到36.7);Qwen3-VL-8B模型提升+4.9(从33.2到38.1)。
- Video-TT: Qwen3-VL-4B模型提升+1.8(从38.9到40.7);Qwen3-VL-8B模型提升+0.9(从40.6到41.5)。
- MVBench: Qwen3-VL-4B模型提升+1.7(从65.4到67.1);Qwen3-VL-8B模型提升+1.9(从67.2到69.1)。
- VideoMME: Qwen3-VL-4B模型提升+1.1(从60.9到62.0);Qwen3-VL-8B模型提升+1.8(从63.4到65.2)。
使用要求
- 硬件: 8张NVIDIA H100 GPU(80GB)。
- 软件: Python 3.10+。
- 框架: 需使用VeRL框架进行GRPO训练。
致谢与许可
- 致谢: 本工作基于Qwen3-VL(https://github.com/QwenLM/Qwen2.5-VL)和VeRL框架(https://github.com/volcengine/verl)。
- 许可证: 本项目基于Apache 2.0许可证发布。




