遇见数据集

iWorldBench

收藏
github2026-05-25 更新2026-05-26 收录
官方服务:

资源简介:

iWorldBench是一个用于评估相机可控视频生成模型的基准测试,提供评估代码、打包元数据、相机轨迹资源和参考推理适配器。

iWorldBench is a benchmark for evaluating camera-controllable video generation models, which provides evaluation code, packaged metadata, camera trajectory resources, and reference inference adapters.

创建时间:
2026-05-05
原始信息汇总

iWorldBench 数据集概述

  • 全称: iWorldBench
  • 论文: 已被 ICML 2026 接收,arXiv: 2605.03941 (https://arxiv.org/abs/2605.03941)
  • 官方主页: https://iworld-bench.com/
  • Hugging Face 数据集: https://huggingface.co/datasets/EmbodiedCity/iWorld-Bench-Dataset
  • Hugging Face 排行榜: https://huggingface.co/spaces/EmbodiedCity/iWorld-Bench
  • 许可证: Apache License 2.0

数据集简介

iWorldBench是一个用于评估可控制摄像机的视频生成模型的基准测试。本发布包含评估代码、打包的元数据、摄像机轨迹资源以及运行基准测试所需的参考推理适配器。

发布时间线

  • 论文被接收: 2026年5月1日
  • 代码发布: 2026年5月18日
  • 数据集发布: 2026年5月19日

数据集内容与结构

数据集以打包的元数据第一帧图像形式提供,托管于Hugging Face。仓库结构如下:

  • dataset/all_pack/: 包含第一帧图像 (assets/) 和多个CSV元数据文件 (metadata.csv, camera_following_metadata.csv, videoxfun_diff.csv)。
  • camera_trajectories/: 包含用于推理的摄像机控制文件 (TXT/CSV) 和参考轨迹文件 (NPZ)。
  • Process/: 包含数据集预处理流程说明,数据来源包括:7-Scenes、NCLT、NuSence、Princeton365、SpatialVID、TartanAir、realestate10k。

下载方式

使用Hugging Face Hub下载数据集。下载全部数据(含图片):

bash huggingface-cli download EmbodiedCity/iWorld-Bench-Dataset --repo-type dataset --include "dataset/all_pack/**" --local-dir .

仅下载元数据CSV(不含图片):

bash huggingface-cli download EmbodiedCity/iWorld-Bench-Dataset --repo-type dataset --include "dataset/all_pack/*.csv" --local-dir .

评估指标

iWorldBench支持以下三类评估:

评估类型 指标名称 说明
动作控制 action_control 使用摄像机轨迹TXT和参考NPZ文件评估动作与摄像机控制的一致性。
记忆能力 memory_ability 评估模型对长时程场景的记忆能力。
摄像机跟随 camera_following 针对轨迹输入模型的摄像机跟随能力评估。

完整评估命令示例:

bash python3 run_iworldbench_evaluation.py /path/to/generated_videos /path/to/eval_output --metric all --camera-txt-dir camera_trajectories/inference_txt --source-npz-dir camera_trajectories/reference_npz --vbench-gpu 0

依赖项

  • 轨迹度量: 依赖 VIPe
  • 视觉质量度量: 依赖 VBench
  • 设置环境变量 VIPE_ROOTVBENCH_ROOT 指向本地仓库。
搜集汇总
数据集介绍
iWorldBench 数据集图片
构建方式
iWorldBench是一个面向可控制摄像机运动视频生成模型的基准测试数据集。其构建过程首先从7-Scenes、NCLT、NuSence、Princeton365、SpatialVID、TartanAir及realestate10k等多个具有代表性的真实与仿真场景数据集中采集原始视觉素材,并从中提取首帧图像作为生成模型的推理起点。在此基础上,系统性地整合了多种摄像机轨迹资源,包括用于扩散与记忆推理的控制文本文件、作为容差参考的NPZ文件,以及附带语义描述的轨迹动作与记忆字典CSV文件。所有元数据被规整为统一的CSV格式,与首帧图像资源共同打包,形成可直接用于基准测试的标准化数据集。
特点
该数据集的显著特色在于其多维度的控制能力评估框架。它不仅考察模型对动作指令(Diff)与记忆信息(Mem)的响应准确性,还创新性地引入了摄像机跟随(Camera-following)评估维度,专门衡量模型根据给定轨迹生成视频的能力。依托VIPe进行轨迹估计、VBench评估成像质量与运动平滑度,iWorldBench实现了从摄像机控制到视觉质量的全方位量化分析。此外,数据集配套了丰富的参考推理适配器,覆盖CogVideoX、Hunyuan、Wan等多个主流视频生成模型,为公平比较提供了标准化接口与基线结果。
使用方法
使用iWorldBench需先通过git clone获取仓库并安装依赖,随后利用Hugging Face CLI下载包含首帧图像与元数据CSV的数据包。推理阶段,用户可基于提供的元数据CSV运行自有模型,或调用VideoX-Fun等参考实现生成视频,输出至指定目录。评估时,通过run_iworldbench_evaluation.py脚本并指定生成的视频路径与待评测指标(如action_control、memory_ability或camera_following),系统会自动调用VIPe与VBench计算轨迹精度、视觉质量等分数并输出CSV报告。该流程支持一键式完整评估,也可对单一维度进行独立测试,兼顾了灵活性、可复现性与使用的便捷性。
背景与挑战
背景概述
随着视频生成技术的飞速发展,如何精准控制生成视频中的摄像机运动轨迹,已成为推动交互式世界模型与具身智能体迈向真实感渲染的核心瓶颈。iWorldBench由EmbodiedCity团队于2026年提出,主要研究人员包括Jianjie Fang、Yingshan Lei等,相关成果已被顶级机器学习会议ICML 2026收录。该基准聚焦于评估摄像机可控视频生成模型的性能,通过整合7-Scenes、TartanAir、RealEstate10K等多样化的多视角数据集,构建了涵盖动作控制、记忆能力与摄像机跟随三大维度的评价体系。其发布不仅为视频生成领域提供了标准化的评估框架,更深刻推动了从静态图像生成到动态、可交互世界模型构建的范式演进。
当前挑战
iWorldBench面临的多重挑战源于其领域问题与构建过程。首先,现有视频生成模型在摄像机轨迹的精确控制上仍显薄弱,动作控制与记忆能力维度要求模型不仅理解空间几何关系,还需在不同场景中保持长时运动一致性,这对网络架构与训练数据均构成严峻考验。其次,在基准构建过程中,从NuScence、Princeton365等异构源数据中提取并统一摄像机轨迹格式,需解决传感器类型、坐标系与时间分辨率的巨大差异;此外,Viper与VBench等第三方评估工具链的集成,以及参考推理适配器对CogVideoX、Hunyuan等多种外部模型的无缝调用,进一步加剧了系统兼容性与部署复现的复杂性。
常用场景
经典使用场景
在视频生成领域,如何让模型精准地依据用户意图控制摄像机轨迹,是迈向交互式世界模型的关键瓶颈。iWorldBench作为首个系统评估摄像机可控视频生成模型的基准,其经典使用场景在于为研究者提供一个标准化的测试平台。通过封装来自7-Scenes、TartanAir、RealEstate10K等多源数据集的起始帧图像与精确摄像机轨迹元数据,该基准要求模型接收单帧图像与动作描述或内存条件,生成严格对齐指定摄像机运动的连续视频序列。这一场景直接衡量了模型在动作控制(Diff)、记忆引导生成(Mem)以及摄像机跟随(Camera-Following)三种核心能力上的表现,从而将摄像机控制从定性展示推向可重复的定量评估。
解决学术问题
iWorldBench精准地解决了视频生成领域长期缺乏统一、透明评价标准的学术困境。以往的工作多依赖于主观视觉质量或下游任务指标,难以独立评判摄像机运动控制的保真度。该基准通过引入基于VIPe的轨迹一致性度量和基于VBench的视觉质量度量,构建了包含动作控制、记忆能力与摄像机跟随的多维度评估体系。这一设计不仅分离了运动控制与画面质量的影响,还允许研究者独立验证其模型在精确遵循运动指令方面的进步。其发布意义在于为交互式世界模型、可控视频生成等前沿方向树立了公平的比较基准,极大地推动了从静态图像生成向动态空间感知生成的范式演进。
衍生相关工作
自iWorldBench发布以来,其体系化的评估框架催生了一系列高质量的衍生工作。在模型架构层面,VideoX-Fun作为基准中的参考推理适配器,展示了基于扩散框架实现精确动作控制的有效性,启发了后续诸如Cameractrl和MotionCtrl等工作在条件注入方式上的优化。学术界围绕该基准展开的竞争性研究,促使如RealCAMI2V与HyWorldPlay等新型模型在A榜与B榜上交替刷新纪录,驱动了动作语义理解与长时记忆建模的进步。此外,iWorldBench提供的预对齐多源数据与轨迹库,已成为后续研究进行跨域泛化测试的标准资源库;多篇以‘可控视频生成综述’为题的论文亦将该基准作为核心评价工具,系统梳理了该领域的进展与挑战。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务