OpenUni
收藏资源简介:
OpenUni是由快手科技Kling团队联合多所高校构建的大规模多模态视频数据集,包含130万条样本,涵盖光流、深度图、密集姿态、骨骼关键点和分割掩码五种模态。该数据集通过预训练模型从互联网视频中提取多模态标注,并经过严格的质量过滤,包含37万单人视频、9.7万双人视频以及来自Koala36M和OpenS2V的83万通用场景视频。数据集采用课程学习策略构建,支持像素对齐和非对齐模态的联合训练,旨在推动视频生成模型在物理世界理解、多任务协同和零样本泛化方面的研究。
OpenUni is a large-scale multimodal video dataset constructed by the Kling Team of Kuaishou Technology in collaboration with multiple universities. It comprises 1.3 million samples covering five modalities: optical flow, depth maps, dense pose, skeletal keypoints, and segmentation masks. Multimodal annotations are extracted from internet videos via pre-trained models for this dataset, which has undergone rigorous quality filtering. The dataset includes 370,000 single-person videos, 97,000 two-person videos, and 830,000 general-scene videos sourced from Koala36M and OpenS2V. Built using a curriculum learning strategy, the dataset supports joint training of pixel-aligned and unaligned modalities, and aims to advance research on video generation models in the domains of physical world understanding, multi-task collaboration, and zero-shot generalization.
UnityVideo数据集概述
数据集基本信息
- 数据集名称:UnityVideo
- 关联研究:用于增强世界感知视频生成的统一多模态多任务学习
- 数据集地址:https://huggingface.co/datasets/JackAILab/OpenUni
- 许可证:Apache-2.0 license
- 状态:数据待发布(TODO List中包含“Release data”项)
数据集目的与功能
该数据集旨在支持一个统一的通用框架,用于多任务多模态视频理解,具体功能包括:
- 文本到视频生成:根据文本描述创建高质量视频。
- 可控生成:通过多种模态对视频生成进行细粒度控制。
- 模态估计:从视频中估计深度、法线和其他模态。
- 零样本泛化:无需额外训练即可对新物体和风格具有强大的泛化能力。
核心特点
- 统一框架:单一模型处理多个视频理解任务。
- 多模态支持:无缝处理文本、图像和视频输入。
- 世界感知生成:增强的物理理解和一致性。
- 灵活控制:支持各种控制信号(深度、边缘、姿态等)。
- 高质量输出:具有最先进的视觉质量和时间一致性。
- 高效训练:联合多任务学习提高了数据效率。
方法架构
UnityVideo采用统一的多模态多任务学习框架,包含:
- 多模态编码器:处理不同的输入模态(文本、图像、视频)。
- 统一Transformer主干:跨任务的共享表示学习。
- 任务特定头:用于不同生成和估计任务的专用解码器。
- 联合训练策略:跨所有任务同时进行优化。
引用信息
如需在研究中引用此工作,请使用以下BibTeX条目: bibtex @article{huang2024unityvideo, title={UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation}, author={Huang, Jiehui and Zhang, Yuechen and He, Xu and Gao, Yuan and Cen, Zhi and Xia, Bin and Zhou, Yan and Tao, Xin and Wan, Pengfei and Jia, Jiaya}, journal={arXiv preprint arXiv:2512.07831}, year={2025} }

- 1UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation香港科技大学, 香港中文大学, 清华大学, 快手科技Kling团队 · 2025年



