遇见数据集

KlingTeam/UniBench

收藏
Hugging Face2026-07-12 更新2026-07-22 收录
官方服务:

资源简介:

UniBench是一个用于评估世界感知视频生成和估计的基准数据集,涵盖RGB视频、光流和深度模态。该数据集包含UEData和RealData两个子集:UEData提供30,000个案例,每个案例包括对齐的RGB视频、RAFT光流可视化和深度可视化视频,分为训练集(29,800个案例)和评估集(200个案例);RealData包含100个来自公共Koala36M数据集的RGB视频样本,用于评估。数据集主要用于UnityVideo论文的基准测试,不包含大规模训练数据。

UniBench is a benchmark dataset for evaluating world-aware video generation and estimation across RGB video, optical flow, and depth. It consists of two subsets: UEData, which includes 30,000 cases with aligned RGB videos, RAFT optical flow visualizations, and depth visualizations, split into training (29,800 cases) and evaluation (200 cases) sets; and RealData, which contains 100 public Koala36M RGB video samples for evaluation. The dataset is designed for benchmarking in the UnityVideo paper and does not include large-scale training data.

提供机构:
KlingTeam
搜集汇总
数据集介绍
KlingTeam/UniBench 数据集图片
构建方式
UniBench由UEData与RealData两大子集构成,旨在为世界感知视频生成与估计任务提供标准化评估基准。UEData包含三万个精心对齐的视频三元组,每个样本同步呈现RGB视频、光流视觉化结果与深度视觉化结果,通过100个未压缩的tar分片存储,并配备完整的元数据CSV文件、分片清单及SHA256校验文件以确保数据完整性。RealData则精选自公开的Koala36M数据集,包含100个真实视频样本,仅提供RGB模态。所有数据路径均采用相对路径设计,便于在解压后直接恢复目录结构。
特点
UniBench的核心特色在于其多模态、多任务的综合评估能力。UEData子集提供RGB、光流与深度三种对齐的视频模态,能够同步评估模型在视频生成、深度估计与光流预测等任务上的表现,充分契合世界感知视频生成的实际需求。RealData子集则专注于真实场景下的RGB视频评估,提升了基准在现实应用中的参考价值。数据集整体设计精巧,元数据涵盖视频时长、帧率、分辨率与文本描述列表,为细粒度的性能分析提供了丰富支撑。
使用方法
使用者可通过Hugging Face Datasets库便捷加载UniBench的元数据,无需下载大规模视频分片即可快速查看样本信息。如需进行评估,可利用Hugging Face Hub的下载工具仅拉取评估分片与真实视频子集,随后通过校验与解压操作恢复完整视频文件。CSV文件中列出的视频路径相对于所在分片目录,结合Python的pandas库与json解析,可逐一构建RGB、光流与深度视频的完整路径,进一步开展模型推理与指标计算。
背景与挑战
背景概述
UniBench 由 KlingTeam 与 JackAILab 等机构于 2025 年联合构建,旨在系统评估面向世界感知的视频生成与多模态估计任务。该基准以《UnityVideo》研究为核心,聚焦 RGB 视频、光流与深度图三种模态的联合推理能力。UniBench 包含 30,000 个具有对齐三元组的合成场景数据(UEData)与 100 个来自公开 Koala36M 的真实视频样本(RealData),填补了现有视频生成基准在结构化多模态评估方面的空白。作为首个一体化世界感知评估平台,UniBench 推动了视频生成、深度估计与光流预测等任务的联合验证,对多模态生成领域的发展具有里程碑意义。
当前挑战
UniBench 首要挑战在于解决视频生成中对物理世界理解不足的困境,现有模型难以同时生成语义契合且几何一致的运动与深度序列。其次,构建过程中面临合成数据与真实世界分布的巨大鸿沟,UEData 虽提供精确标注,但 RealData 仅含 RGB 视频,缺乏光流与深度真值,导致跨域评估存在偏差。此外,大规模数据(约 375 GiB)的存储与传输、不同模态视频在对齐与压缩中的质量损失,以及低帧率(15 FPS)下的时序动态捕捉难题,亦构成显著挑战。
常用场景
经典使用场景
UniBench作为视频生成领域的权威评估基准,其核心设计围绕多模态、多任务的世界感知视频生成与估计展开。该数据集通过提供高度对齐的RGB视频、光流(RAFT)与深度图三元组,为研究者提供了从二维像素到三维运动与结构感知的完整评测框架。在经典使用场景中,研究者利用UniBench评估模型是否能在生成逼真RGB画面的同时,准确捕捉物体的运动轨迹(光流)与场景的几何深度信息,从而验证模型对物理世界的理解能力。
解决学术问题
UniBench致力于解决视频生成领域长期存在的核心学术困境:现有模型多专注于视觉质量,而缺乏对视频动态与三维世界的深层理解。该数据集通过引入光流与深度作为联合评估维度,使得研究者能够定量衡量生成视频在运动一致性、时空平滑性以及几何结构合理性方面的表现。其学术意义在于将视频生成从单纯的像素级匹配推向更具可解释性的世界建模任务,有力推动了运动估计、深度感知与生成模型相融合的研究范式。
衍生相关工作
UniBench伴随其关联论文《UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation》诞生,后者提出了统一的多模态多任务学习框架,直接受益于UniBench的评测能力。此外,与之配套的大规模训练数据集OpenUni提供了丰富的多模态标注,使得研究者能够在UniBench标准下进行模型训练与性能对标。未来,UniBench有望催生一系列以世界一致性为核心的新型生成架构,并推动光流、深度估计与视频生成任务的联合优化成为领域内的重要研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务