遇见数据集

Awesome-Video-Generation-Post-Training

收藏
github2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

这是一个持续更新的资源集合,专注于视频生成模型的后训练和对齐领域。它收集和整理了与该领域相关的多个数据集和评估基准,旨在为研究人员和从业者提供便捷、最新的参考资源。合集覆盖了监督微调、自训练与蒸馏、基于偏好的优化以及推理时对齐等方法相关的数据资源。

This is a continuously updated resource collection focusing on post-training and alignment of video generation models. It collects and organizes multiple datasets and evaluation benchmarks related to this field, aiming to provide researchers and practitioners with convenient and up-to-date reference resources. This collection covers data resources associated with methods including supervised fine-tuning, self-training and distillation, preference-based optimization, and alignment during inference.

创建时间:
2025-12-23
原始信息汇总

数据集详情概述

该页面是 Awesome Video Generation Post Training 资源仓库,专注于视频生成模型的后训练(Post-Training)与对齐(Alignment)研究。页面内容来自一篇同名综述论文,并作为其配套资源,持续收录相关论文、数据集和评估基准。

核心目标

  • 系统梳理视频生成领域在监督微调、自训练与蒸馏、偏好优化和推理时对齐方法上的最新进展。
  • 收集与后训练和对齐相关的数据集评估基准,为研究人员提供便捷参考。

收录的数据集

该页面整理了一份数据集列表,涵盖来自不同顶级会议(如NeurIPS、CVPR、ICCV、ICML等)及预印本(arXiv)的专用数据集,用于视频生成的后训练或对齐评估。部分代表性数据集包括:

数据集名称 所属会议/期刊 发布年份 简要说明(按原文)
ChronoMagic-Pro NeurIPS 2024 时序生成相关数据集
SafeSora NeurIPS 2024 视频生成安全性数据集
TIP-I2V ICCV 2025 面向图像到视频生成的数据集
SynFMC ICCV 2025 合成视频数据集(运动控制)
CookGen CVPR 2025 烹饪动作生成数据集
HOIGen-1M CVPR 2025 人-物交互生成大规模数据集
OpenHumanVid CVPR 2025 开放域人体视频数据集
PhyWorld ICML 2025 物理世界模拟数据集
WISA-80K NeurIPS 2025 80K规模视频数据集
VideoUFO NeurIPS 2025 视频评估/微调数据集
TalkCuts NeurIPS 2025 对话式视频剪辑数据集
EgoVid-5M NeurIPS 2025 第一人称视角500万视频数据集
OpenS2V-5M NeurIPS 2025 开放域场景到视频500万数据集
GRADEO-Instruct PMLR 2025 指令微调数据集
CI-VID arXiv 2025 因果推断视频数据集
PNData arXiv 2025 正负样本配对数据
PairFS-4K arXiv 2025 舞蹈生成配对数据集
MMVideo arXiv 2025 多模态视频生成数据集
DAVID-X arXiv 2025 视频对齐/评估数据集
Dprim arXiv 2025 原始数据(特定对齐任务)
GB3DV-25k arXiv 2026 3D视频生成数据集(25k)

收录的评估基准

该页面同样列出多个评估基准(Benchmarks),用于衡量视频生成模型在后训练和对齐方面的性能:

基准名称 所属会议/期刊 发布年份 主要评测方向
FETV NeurIPS 2023 文本到视频生成评估
StoryBench NeurIPS 2023 故事连贯性视频生成
ChronoMagic-Bench NeurIPS 2024 时序与时空一致性基准
EvalCrafter CVPR 2024 多维度文本到视频生成评估
VBench CVPR 2024 视频生成综合质量评估
T2VSafetyBench NeurIPS 2024 文本到视频生成安全性
MTBench ICCV 2025 多任务视频生成基准
FiVE ICCV 2025 细粒度视频编辑评估
VEG-Bench ICCV 2025 视频编辑生成基准
VMBench ICCV 2025 视频运动理解基准
T2V-CompBench CVPR 2025 组合性文本到视频评估
StoryEval CVPR 2025 故事生成评估
MC-Bench CVPR 2025 运动控制基准
Video-Bench CVPR 2025 视频生成通用基准
MJ-BENCH-VIDEO NeurIPS 2025 基于指令的视频生成评估
OpenS2V-Eval NeurIPS 2025 开放域场景到视频评估
VideoGen-RewardBench NeurIPS 2025 视频生成奖励模型基准
AIGC-LipSync NeurIPS 2025 唇形同步生成评估
WorldModelBench NeurIPS 2025 世界模型评估
VIP-200K ACM MM 2025 个性化视频生成评估
RGCD ACM MM 2025 视频质量评估(参考图像)
RecipeGen ACM MM 2025 食谱生成评估
HVEval ACM MM 2025 异质视频评估
Doc2Present EMNLP 2025 文档到演示视频评估
VidCapBench ACL 2025 视频描述生成基准
VideoPhy ICLR 2025 物理合理性基准
PhyGenBench ICML 2025 物理生成基准
Paper2Video arXiv 2025 论文到视频生成评估
PhyWorldBench arXiv 2025 物理世界基准
SafeMVDrive arXiv 2025 安全多视角驾驶视频评估
SeqBench arXiv 2025 序列叙述生成基准
VideoVerse arXiv 2025 大规模视频理解基准
AIGVE-60K arXiv 2025 60K规模视频质量评估
MMMC arXiv 2025 多模态多任务视频理解
DynamicEval arXiv 2025 动态视频评估
V-ReasonBench arXiv 2025 视频推理基准
VIPER arXiv 2025 视频个性化生成评估
Video Reality Test arXiv 2025 视频真实性测试

相关论文

  • 综述论文Video Generation Models: A Survey of Post-Training and Alignment,发表于TechRxiv(2026年)。
  • 其他论文:页面通过链接将每个数据集和基准关联到其原始论文(arXiv链接),便于深入查阅。

参与方式

仓库欢迎社区通过提交Pull Request贡献新的论文、建议更合适的分类或更新信息。

搜集汇总
数据集介绍
Awesome-Video-Generation-Post-Training 数据集图片
构建方式
在视频生成领域,大规模预训练虽已取得显著进展,但模型在遵循人类意图、物理规律约束及部署需求方面仍面临严峻挑战。为系统应对这一困境,该数据集以综述论文《Video Generation Models: A Survey of Post-Training and Alignment》为核心,通过广泛检索与梳理近期顶级会议(如NeurIPS、CVPR、ICCV、ICLR等)及arXiv预印本中关于视频生成后训练与对齐的研究成果,构建了一个动态更新的论文资源库。其构建方式体现了严谨的学术筛选流程:不仅收录了ChronoMagic-Pro、SafeSora、TIP-I2V等专为后训练设计的数据集,还囊括了FETV、VBench、ChronoMagic-Bench等评估基准,并依据发表年份、会议等级及研究主题进行系统分类,形成层次分明的知识图谱。
使用方法
研究者可通过该数据集高效定位特定主题的文献与资源。使用方式灵活多样:若关注安全对齐,可快速检索SafeSora等专题;若需评估模型物理一致性,可直达PhyWorld、VideoPhy等基准。每个条目均以表格形式呈现,包含论文标题、发表年份、会议标签及多维链接(论文全文、GitHub仓库、项目主页、数据集下载地址),用户可直接点击跳转。对于综述论文本身,数据集提供了完整的BibTeX引用格式,便于学术写作。同时,数据集鼓励通过GitHub Issue或Pull Request提交新论文建议,形成研究者社区协同维护的开放生态,特别适合需要跟踪最新进展或进行文献综述的学者与工程师。
背景与挑战
背景概述
视频生成模型在近年来取得了显著进展,大规模预训练技术极大地提升了其生成质量与多样性。然而,将生成内容与人类意图、物理约束及部署需求对齐仍构成严峻挑战。为此,后训练与对齐技术迅速成为视频生成领域的研究焦点。由亚利桑那州立大学Chaoyu Li、Twitch Xiaoyi Gu等来自多所顶尖机构的研究者共同创建的Awesome-Video-Generation-Post-Training仓库,于2026年系统梳理了该领域的最新进展。该资源库围绕监督微调、自训练与蒸馏、偏好优化及推理时对齐方法展开,汇集了ChronoMagic-Pro、SafeSora等大量前沿数据集与评估基准,为研究者提供了全面、动态的参考框架,对推动视频生成模型的实用化与可控化具有重要影响力。
当前挑战
该数据集所聚焦的领域核心挑战在于,视频生成模型在预训练后难以精确遵循人类指令、模拟物理规律并适应多样化部署场景。具体而言,生成内容的时间一致性、动作合理性及语义对齐度常出现偏差,如物体运动轨迹违反物理定律或叙事逻辑断裂。构建过程中,研究者面临三重困境:高质量偏好数据的稀缺性,现有视频数据集缺乏细粒度的人类反馈标注;评估维度的复杂性,需同时兼顾视觉质量、运动连贯性、安全性与物理合理性;以及跨场景泛化能力的不足,单一数据集难以覆盖从日常动作到专业视频编辑的广泛需求。这些挑战催生了如PhyWorld、SafeSora等专门数据集与基准的涌现,以系统性地攻克后训练对齐难题。
常用场景
经典使用场景
在视频生成模型的演进历程中,大规模预训练虽已取得显著突破,但模型输出与人类意图、物理规律及部署需求之间的鸿沟依然亟待弥合。该数据集集合聚焦于视频生成的后训练与对齐阶段,为研究者提供了系统性的资源支撑。其最经典的使用场景在于支撑监督微调、自训练与蒸馏、基于偏好的优化以及推理时对齐方法的实验与验证。通过整合诸如ChronoMagic-Pro、SafeSora、TIP-I2V等高质量数据集,研究者能够针对时序一致性、内容安全性、物理合理性等关键维度进行精细化调优,从而推动视频生成模型从“能生成”迈向“生成得对”的质变。
解决学术问题
该数据集集合系统性地回应了视频生成领域长期悬而未决的核心学术挑战:如何使生成模型忠实遵循物理约束、时序逻辑与人类偏好。传统预训练范式在捕捉复杂场景的动态演化与因果结构方面力有不逮,而此类数据集通过提供细粒度的偏好标注、物理世界基准与多模态对齐样本,使得研究者得以探索奖励建模、人类反馈强化学习及推理时干预等前沿范式。其意义在于,为视频生成模型从“视觉逼真”向“语义合理”的跨越提供了可复现的量化评估框架与训练基准,深刻影响了生成式人工智能的可控性与可信赖度研究。
实际应用
在实际产业应用中,该数据集集合的价值体现在多个高要求场景。例如,在自动驾驶仿真领域,PhyWorld与SafeMVDrive等数据集助力生成符合物理定律的动态交通场景,用于测试决策系统的鲁棒性。在影视制作与虚拟内容创作中,StoryBench与ChronoMagic-Bench支持脚本驱动的长时序叙事生成与复杂特效的自动编排。此外,CookGen与HOIGen-1M等数据集在机器人操作与人机交互领域大放异彩,使模型能够生成精细的人-物交互动作序列,从而降低真实数据采集成本,加速从仿真到部署的闭环迭代。
数据集最近研究
最新研究方向
随着视频生成模型预训练技术的日趋成熟,如何通过后训练与对齐技术使模型精准契合人类意图、物理规律及部署需求,已成为该领域最前沿的核心议题。Awesome-Video-Generation-Post-Training 数据集系统梳理了监督微调、自训练与知识蒸馏、偏好优化以及推理时对齐等方向的最新进展,其收录的 ChronoMagic-Pro、SafeSora、PhyWorld 等代表性工作,分别从时序一致性、内容安全性及物理合理性等维度推动着视频生成质量的跃升。该资源不仅为研究者提供了动态更新的文献索引,更揭示了从粗放生成迈向可控、可信、可解释的智能视频创作这一关键转型路径,在影视制作、自动驾驶仿真及人机交互等热点场景中具有深远的应用意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务