遇见数据集

DistillAlign_1p3b_25K

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

DistillAlign-1p3b-25K 是一个用于视频扩散蒸馏的数据集,包含 25,000 个样本。每个样本由 Wan2.1-T2V-1.3B 教师模型生成的干净 VAE 潜变量及其对应的英文文本提示组成。潜变量形状为 [21, 16, 60, 104],其中 21 表示时间帧数(约 81 个视频帧),16 为 VAE 潜变量通道数,60 和 104 分别对应潜变量的高度和宽度,解码后视频分辨率为 480×832 像素。数据以 PyTorch 张量格式存储,每个 .pt 文件包含一个字典,键为文本提示字符串,值为形状为 [21, 16, 60, 104] 的 float32 张量。该数据集适用于视频扩散模型的蒸馏训练(作为回归或分布匹配目标)以及潜空间研究。此外,还提供了由 Wan2.1-T2V-14B 教师模型生成的对应版本数据集 DistillAlign_14B_25K。

DistillAlign-1p3b-25K is a dataset for video diffusion distillation, containing 25,000 samples. Each sample consists of clean VAE latents generated by the Wan2.1-T2V-1.3B teacher model and corresponding English text prompts. The latent shape is [21, 16, 60, 104], where 21 represents temporal frames (approximately 81 video frames), 16 is the VAE latent channel dimension, 60 and 104 are the latent height and width, respectively, corresponding to a decoded video resolution of 480×832 pixels. Data is stored in PyTorch tensor format; each .pt file contains a dictionary with text prompt strings as keys and float32 tensors of shape [21, 16, 60, 104] as values. This dataset is suitable for distillation training (as regression or distribution matching objectives) of video diffusion models and for latent space research. Additionally, a corresponding version generated by the Wan2.1-T2V-14B teacher model, DistillAlign_14B_25K, is also provided.

创建时间:
2026-07-18
原始信息汇总

数据集概述

DistillAlign-1p3b-25K 是一个为视频扩散模型蒸馏任务预计算的干净VAE潜变量数据集,由 Wan2.1-T2V-1.3B 教师模型生成,每个样本均包含对应的文本提示词。

基本信息

属性 内容
样本数量 25,000
教师模型 Wan2.1-T2V-1.3B
提示词来源 VidProM 文本提示词(英文)
VAE Wan2.1 VAE(8倍空间压缩,~4倍时间压缩)
潜变量形状 [21, 16, 60, 104]
数据类型 float32
文件格式 每样本一个 .pt 文件,内容为字典 {提示词字符串: 潜变量张量}
许可证 Apache-2.0

潜变量形状说明

潜在张量维度 [21, 16, 60, 104] 的含义如下:

维度 大小 含义
0 21 时间维度潜变量帧数(对应约81帧视频)
1 16 VAE潜变量通道数
2 60 潜变量高度(对应480像素)
3 104 潜变量宽度(对应832像素)

对应视频分辨率为 480 × 832,约 81帧

数据组织与加载

  • 文件按 part0/00000.ptpart0/00001.pt 等路径组织。
  • 每个 .pt 文件通过 torch.save 保存为单条目字典,键为提示词字符串,值为形状 [21, 16, 60, 104] 的干净视频潜变量。
  • 解码潜变量回像素时,需使用 Wan2.1 VAE 解码器(如解码器需 [B, T, C, H, W] 输入,需添加批次维度)。

关联资源

  • Wan2.1-T2V-14B 教师模型生成的对应数据集可在 DistillAlign_14B_25K 获取。
  • 该数据集相关工作详情见项目主页、论文及代码仓库(可通过数据集页面访问)。

设计用途

该数据集专为视频扩散蒸馏任务设计(作为回归或分布匹配目标),同时适用于潜变量空间研究。

搜集汇总
数据集介绍
DistillAlign_1p3b_25K 数据集图片
构建方式
DistillAlign_1p3b_25K数据集由Riemann Dynamics团队构建,旨在为视频扩散模型蒸馏提供高质量的回归与分布匹配目标。该数据集利用Wan2.1-T2V-1.3B教师模型,从VidProM文本提示中生成25,000个样本,每个样本包含对应的英文提示词和经Wan2.1 VAE编码的干净潜变量。潜变量形状为[21, 16, 60, 104],对应约81帧、480x832分辨率的视频。数据以PyTorch的.pt格式存储,每个文件为单一键值对字典,键为提示词,值为潜变量张量,便于直接加载用于训练。
特点
该数据集的核心特点在于其潜变量空间的简洁性与高效性。由于已预先计算并存储了干净VAE潜变量,用户无需自行运行教师模型,大幅降低了计算开销。此外,数据集的构建考虑到了视频蒸馏中模式覆盖与模式寻求的平衡,通过采用1.3B教师模型(相较于14B更轻量)生成数据,同时仍能超越使用14B教师模型精炼的基线,体现了成本效益与性能的优化。潜变量形状设计兼顾时空压缩,支持高分辨率视频生成,且每个样本独立存储,便于灵活采样。
使用方法
使用该数据集时,用户可通过torch.load直接加载.pt文件,获取提示词与对应的潜变量张量。典型应用包括作为视频扩散模型蒸馏的回归目标或分布匹配目标,也可用于潜空间研究。加载全部数据时,可遍历part*/*.pt文件,逐一提取(prompt, latent)对。若需将潜变量解码为像素视频,需配合Wan2.1 VAE解码器,注意恢复批次维度。该数据集与Wan2.1-T2V-14B生成的对应版本(DistillAlign_14B_25K)互补,可依据教师模型规模选择或结合使用。
背景与挑战
背景概述
DistillAlign-1p3b-25K数据集由Riemann Dynamics、南洋理工大学等机构的研究者于2026年创建,旨在推动自回归视频蒸馏技术的发展。该数据集提供了由Wan2.1-T2V-1.3B教师模型生成的25,000个干净VAE潜在表示及其对应的文本提示,为视频扩散模型的蒸馏研究提供了高质量的回归目标。其核心研究问题聚焦于如何协调模式覆盖与模式寻求目标,以提升视频生成的质量与效率。该数据集的发布为视频蒸馏领域的研究者提供了标准化的训练数据,促进了相关算法的验证与比较,对视频生成模型的轻量化与高效化具有重要的推动作用。
当前挑战
该数据集所应对的领域挑战主要体现在视频生成模型的蒸馏过程中,如何在保持生成多样性的同时确保训练稳定性,即协调模式覆盖与模式寻求之间的矛盾。此外,构建过程中亦面临诸多技术难题:首先,从大规模教师模型中提取高保真度的潜在表示需要高效的计算资源与精细的工程优化;其次,保证潜在表示与文本提示之间的语义对齐,需处理多模态数据的复杂关联;最后,数据集的规模与多样性需精心平衡,以防止过拟合,同时确保覆盖广泛的视频内容与场景。
常用场景
经典使用场景
DistillAlign-1p3b-25K数据集在视频扩散模型蒸馏领域扮演着核心角色。作为预计算的干净VAE潜在表示集合,它由Wan2.1-T2V-1.3B教师模型生成,每个潜在张量与对应的文本提示配对,构成回归或分布匹配目标的理想训练对。该数据集特别适用于自回归式视频蒸馏实验,研究者可直接加载这些潜在表示作为学生模型的训练目标,无需重新运行昂贵的教师模型推理。其潜在张量形状[21, 16, 60, 104]对应于约81帧、分辨率480×832的视频,覆盖了时间与空间维度的完整信息,为视频生成模型的压缩与蒸馏提供了标准化的数据基础。
衍生相关工作
该数据集的发布催生了若干相关研究脉络。一方面,围绕其潜在表示特性,衍生出针对VAE潜在空间结构分析的工作,探索如何利用这些紧凑表示提升视频扩散模型的采样效率与质量控制。另一方面,DistillAlign方法本身推动了新的蒸馏算法设计,例如如何在小规模教师基础上通过动态加权协调模式覆盖与寻求,相关论文相继出现。此外,数据集中1.3B与14B教师版本的对比研究,启发了对模型规模-性能关系的重新审视,促使研究者探索参数效率更高的蒸馏路径。后续工作还扩展至其他视频基础模型,将该数据集的构建范式应用于不同架构与采样率,逐步形成了一个多元化的视频蒸馏研究分支。
数据集最近研究
最新研究方向
DistillAlign-1p3b-25K数据集聚焦于自回归视频扩散模型蒸馏领域的前沿探索,其核心创新在于巧妙协调模式覆盖与模式寻求两大目标,仅凭1.3B参数的DMD教师模型即可超越采用14B教师模型精炼的基线,彰显了高效蒸馏的潜力。该数据集提供由Wan2.1-T2V-1.3B生成的25K个预计算干净VAE潜变量及对应文本提示,为视频扩散蒸馏和潜空间研究提供了标准化训练靶标,推动了轻量化视频生成模型的发展,对降低计算成本、加速实时视频生成应用具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务