TIP-I2V
收藏资源简介:
TIP-I2V是一个包含超过170万条用户提供的文本和图像提示的数据集,用于图像到视频生成。除了提示外,该数据集还包括由五个最先进的图像到视频生成模型生成的视频。TIP-I2V有助于开发更好和更安全的图像到视频生成模型。
TIP-I2V is a dataset containing over 1.7 million user-provided text and image prompts for image-to-video generation. In addition to the prompts, the dataset also includes videos generated by five state-of-the-art image-to-video generation models. TIP-I2V contributes to the development of better and safer image-to-video generation models.
TIP-I2V 数据集概述
数据集简介
TIP-I2V 是一个包含超过 170 万条独特用户提供的文本和图像提示的数据集,旨在支持图像到视频生成模型的开发。该数据集不仅包含提示信息,还包括由五种最先进的图像到视频生成模型(Pika, Stable Video Diffusion, Open-Sora, I2VGen-XL, 和 CogVideoX-5B)生成的视频。
数据集组成
- 文本和图像提示:包含超过 170 万条用户提供的文本和图像提示。
- 生成的视频:由五种最先进的图像到视频生成模型生成的视频。
数据集统计
- 总数据量:超过 170 万条文本和图像提示。
- 视频生成模型:Pika, Stable Video Diffusion, Open-Sora, I2VGen-XL, 和 CogVideoX-5B。
数据下载
文本和图像提示
- 全量提示:约 13.4G
- 100k 子集提示:约 0.8G
- 10k TIP-Eval 提示:约 0.08G
嵌入向量
- 全量文本嵌入:约 21G
- 全量图像嵌入:约 3.5G
- 100k 子集文本嵌入:约 1.2G
- 100k 子集图像嵌入:约 0.2G
- 10k TIP-Eval 文本嵌入:约 0.1G
- 10k TIP-Eval 图像嵌入:约 0.02G
未压缩图像提示
- 全量未压缩图像提示:约 1T
- 100k 子集未压缩图像提示:约 69.6G
- 10k TIP-Eval 未压缩图像提示:约 6.5G
生成的视频
- 全量视频(Pika 生成):约 1T
- 100k 子集视频:
- Pika 生成:约 57.6G
- Stable Video Diffusion 生成:约 38.9G
- Open-Sora 生成:约 47.2G
- I2VGen-XL 生成:约 54.4G
- CogVideoX-5B 生成:约 36.7G
- 10k TIP-Eval 视频:
- Pika 生成:约 5.8G
- Stable Video Diffusion 生成:约 3.9G
- Open-Sora 生成:约 4.7G
- I2VGen-XL 生成:约 5.4G
- CogVideoX-5B 生成:约 3.6G
许可证
TIP-I2V 数据集的提示和视频采用 CC BY-NC 4.0 许可证。
引用
@article{wang2024tipi2v, title={TIP-I2V: A Million-Scale Real Text and Image Prompt Dataset for Image-to-Video Generation}, author={Wang, Wenhao and Yang, Yi}, booktitle={arXiv preprint arXiv:2411.04709}, year={2024} }




