Vchitect T2V DataVerse
收藏资源简介:
Vchitect T2V DataVerse是由南洋理工大学S实验室、上海人工智能实验室和香港中文大学联合开发的高质量视频数据集,包含100万条视频数据,旨在支持文本到视频生成任务。该数据集通过严格的注释和美学评估流程构建,确保文本与视频内容的高度对齐。数据集涵盖了多样化的高质量视频,增强了模型的训练和泛化能力。数据来源包括公开数据集如WebVid10M、Panda70M、Vimeo25M和InternVid,以及内部收集的100万条可控质量的视频。该数据集的应用领域主要集中在视频生成领域,旨在解决现有模型在长视频生成中的时间一致性和计算效率问题。
Vchitect T2V DataVerse is a high-quality video dataset jointly developed by S-Lab of Nanyang Technological University, Shanghai AI Laboratory, and The Chinese University of Hong Kong. Comprising 1 million video clips, it is designed to support text-to-video generation tasks. This dataset is constructed via rigorous annotation and aesthetic evaluation workflows to ensure high alignment between textual descriptions and corresponding video content. It covers a diverse range of high-quality videos, which enhances model training and generalization capabilities. Its data sources include public datasets such as WebVid10M, Panda70M, Vimeo25M, and InternVid, as well as 1 million internally collected videos with controllable quality. This dataset is primarily focused on the video generation domain, aiming to address the temporal consistency and computational efficiency issues of existing models in long video generation.
LiteGen 数据集概述
数据集简介
LiteGen 是一个轻量级且高效的训练加速框架,专门为扩散任务设计。该框架已在视频生成项目 Vchitech-2.0 中应用和验证。LiteGen 集成了多种训练优化技术,并提供了用户友好的接口,使研究人员和开发者能够轻松地从单 GPU 设置扩展到多节点、多 GPU 环境。
主要特性
- VAE 支持:
- DP VAE
- Sliced VAE
- VAE.encode 编译
- EMA 模型:
- 分片 EMA(指数移动平均)
- 文本编码器:
- 分片文本编码器
- 分布式优化:
- DDP
- ZeRO1,2,3
- 序列并行(Ulysses 实现,适用于 Vchitect-2.0 模型)
- 内存优化:
- 梯度激活检查点
- 选择性检查点
使用方法
快速开始指南
-
创建 LiteGen 实例: python from litegen import LiteGen gen = LiteGen(config)
-
初始化组件: python model, optimizer, text_encoder, dataloader, vae_encode = gen.initialize( model, # 可训练模型 optimizer, # 模型优化器 text_encoder, # 不可训练模型(如扩散任务中的编码器) dataset, # 数据集 vae.encode # 计算函数(如 VAE 编码) )
优化配置
- DDP 或 ZeRO 优化:
- 通过
zero_degree字段选择 DDP 或 ZeRO 阶段。
- 通过
- 选择性激活检查点:
- 通过
selective_ratio配置选择性应用激活检查点。
- 通过
- 激活卸载:
- 通过
ac_offload启用 CPU 卸载以节省 GPU 内存。
- 通过
- 序列并行:
- 通过
sp_size配置序列并行度。
- 通过
- 分片编码器:
- 通过
encoder.fsdp和encoder.group配置参数分片。
- 通过
- EMA 模型:
- 通过
ema.enable和ema.sharded配置 EMA 模型及其分片。
- 通过
性能
LiteGen 实现了序列并行和激活卸载技术,有效减少了内存使用,并支持在长序列上进行扩散任务的训练。在 NVIDIA A100 GPU 上进行的测试表明,LiteGen 支持在 8x NVIDIA A100 GPU 上训练长达 163 万个令牌的序列,相当于 760x460 分辨率的 150 秒视频。
许可证
LiteGen 采用 Apache-2.0 许可证,完全开放用于学术研究,并允许免费商业使用。如需申请商业许可证或有其他问题或合作,请联系 yangzhenyu@pjlab.org.cn。

- 1Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models南洋理工大学S实验室,上海人工智能实验室,香港中文大学 · 2025年



