VPO Dataset
收藏资源简介:
VPO数据集是由清华大学知识工程组(KEG)和智谱AI共同构建的,用于训练和优化视频提示生成模型。该数据集包含了大约18000个通用查询和2000个与安全性相关的查询,旨在帮助模型生成无害、准确、有用的视频提示。数据集通过精心设计的查询和提示对,以及基于原则的批评和细化过程构建而成,用于提升文本到视频生成模型的质量和安全性。
The VPO dataset was jointly constructed by the Knowledge Engineering Group (KEG) of Tsinghua University and Zhipu AI for training and optimizing video prompt generation models. It comprises approximately 18,000 general-purpose queries and 2,000 safety-related queries, with the objective of supporting models in generating harmless, accurate, and useful video prompts. The dataset was developed through carefully designed query-prompt pairs and a principle-based critique and refinement procedure, aiming to enhance the quality and safety of text-to-video generation models.
VPO数据集概述
数据集简介
VPO(Video Prompt Optimization)是一个用于优化文本到视频生成模型提示的高质量数据集,旨在解决视频生成模型在推理阶段因输入提示不清晰导致的输出质量下降问题。
数据集内容
- 数据类型:包含视频提示优化的SFT(Supervised Fine-Tuning)数据集和为CogVideoX构建的DPO(Direct Preference Optimization)数据。
- 数据特点:
- 强调无害性:确保提示内容安全、尊重且无有害或冒犯性内容。
- 保持意图对齐:完全保留用户意图,整合原始查询中的所有相关细节。
- 高质量视频生成:提供描述性、生动的提示,适合生成高质量视频。
数据集获取
- 下载地址:Hugging Face
模型关联
- 基础模型:LLaMA3-8B-Instruct
- 优化模型下载:Hugging Face
快速开始
数据构建
-
运行提示优化脚本: bash bash multi_infer.sh
-
处理生成的数据: bash python process_data.py
-
使用GPT-4进行评价和优化: bash python gpt4o_infer.py
模型训练
-
监督微调(SFT): bash llamafactory-cli train configs/sft.yaml
-
直接偏好优化(DPO): bash llamafactory-cli train configs/dpo.yaml
相关资源
- 训练代码:LLaMA-Factory
- 奖励模型:VisionReward
- 视频生成模型:CogVideoX

- 1VPO: Aligning Text-to-Video Generation Models with Prompt Optimization清华大学 · 2025年



