WebVi3D
收藏资源简介:
WebVi3D是一个多视图图像数据集,包含来自16M视频片段的320M帧图像,用于训练See3D模型。该数据集通过自动筛选多视图不一致和观察不足的视频片段来扩大训练数据,从而生成高质量、多样化的多视图图像数据集。
WebVi3D is a multi-view image dataset that contains 320 million frames from 16 million video clips, and is intended for training the See3D model. This dataset expands the training data by automatically filtering out video clips with inconsistent multi-view content and insufficient observations, thereby generating a high-quality and diverse multi-view image dataset.
See3D 数据集概述
数据集简介
See3D 是一个视觉条件的多视图扩散模型,训练于大规模互联网视频数据,用于开放世界的 3D 创作。该模型通过仅从视频数据中获取视觉内容来生成 3D 知识。
数据集特点
- WebVi3D:包含 320M 帧图像,来自 16M 个视频片段,用于训练多视图图像数据集。
- 数据筛选:通过自动过滤多视图不一致和观察不足的视频片段,生成高质量、多样化的数据集。
- 无需姿态标注:通过引入时间依赖噪声的视觉信号,消除了对姿态条件的依赖。
数据集应用
- 3D 生成:支持对象级和场景级的 3D 生成,包括稀疏视图到 3D、文本/图像到 3D 以及 3D 编辑。
- 高保真 3D 生成:通过集成 See3D 到基于扭曲的管道中,实现高保真 3D 生成。
数据集下载
- 预训练模型和测试数据:可从 Google Drive 下载。
数据集引用
如果使用 See3D 数据集,请引用以下论文:
@inproceedings{Ma2024See3D, title = {You See it, You Got it: Learning 3D Creation on Pose-Free Videos at Scale}, author = {Baorui Ma and Huachen Gao and Haoge Deng and Zhengxiong Luo and Tiejun Huang and Lulu Tang and Xinlong Wang}, journal={arXiv preprint arXiv:2412.06699}, year={2024} }




