遇见数据集

Awesome-3D-Reconstruction-and-Generation

收藏
github2026-05-19 更新2026-06-04 收录
官方服务:

资源简介:

这是一个精心整理的资源列表,专注于3D重建和生成领域,收录了相关的论文、数据集和项目。合集覆盖了前馈重建、高效3D视觉变换器、少样本生成重建、基于3D重建的SLAM与SFM、物理对象生成、关节对象生成与重建、人体运动生成(包括人-场景交互与重建)、室内场景布局生成以及任意到3D场景等多个主题领域。

This is a meticulously curated resource list focusing on the field of 3D reconstruction and generation, which compiles relevant papers, datasets, and projects. The collection covers multiple thematic areas including feed-forward reconstruction, efficient 3D visual Transformers, few-shot generative reconstruction, SLAM and SFM based on 3D reconstruction, physical object generation, articulated object generation and reconstruction, human motion generation (including human-scene interaction and reconstruction), indoor scene layout generation, and arbitrary-to-3D scene generation, etc.

创建时间:
2025-04-18
原始信息汇总

数据集/项目概览

这是一个精选论文、数据集和项目列表,专注于3D重建与生成领域。该仓库由 PolySummit 维护,持续更新来自顶级会议(如 CVPR、ICLR、ECCV、3DV 等)的相关前沿工作。

主要内容分类

仓库内容按研究主题组织,主要包含以下模块:

1. 3D 重建 (🧊 3D Reconstruction)

  • 前馈式重建 (Feedforward Recon): 包含大量直接从图像推断场景三维属性的方法,例如:
    • VGGT / DUSt3R / MASt3R 系列:视觉几何基础模型,可直接回归点云、深度、相机参数等。
    • Fast3R / MV-DUSt3R+:探索高效、大规模或多视图重建。
    • Depth Anything 3 / UniDepthV2:单目或任意视图深度估计与空间几何理解。
    • WorldMirror / π3 / AMB3R:统一架构,支持多任务、多先验或标度不变的重建。
    • PAGE-4D / CUT3R:扩展至动态场景或持续状态更新的重建。
  • 高效3D视觉Transformer少样本生成式重建基于重建的SLAM/SFM 等子类别。

2. 物理对象生成 (🧸 Physical Object Generation)

  • 聚焦于符合物理规律的三维对象生成方法。

3. 铰接物体生成与重建 (🤖 Articulated Object Generation and Reconstruction)

  • 专门处理具有关节、可动部件(如机械臂、家具铰链等)的物体。

4. 人体运动生成 (🕺 Human Motion Generation)

  • 人-场景交互 (Human-Scene Interaction)
  • 人-场景重建 (Human-Scene Reconstruction)

5. 室内场景布局生成 & 任意到3D场景 (🏠 Indoor Scene Layout Generation & 🏠 Any-to-3D Scene)

  • 室内布局生成方法,以及从多种输入(如文本、图像)生成三维场景的技术。

数据格式与特点

  • 论文条目:以表格形式列出,包含论文标题、发表日期、作者/摘要(可展开)、论文/代码/项目链接以及发表会议。
  • 来源:引自 arXiv、CVPR、ICLR、ICCV、ECCV、3DV 等主要计算机视觉和机器学习会议/期刊。
  • 更新状态:仓库活跃维护,通过 GitHub 徽章展示提交频率和最后更新时间。
搜集汇总
数据集介绍
Awesome-3D-Reconstruction-and-Generation 数据集图片
构建方式
该数据集并非传统意义上的标注数据集合,而是一个精心策展的学术资源索引库。其构建方式基于对三维重建与生成领域前沿文献的系统性追踪与筛选,通过主动收录来自顶级会议(如CVPR、ICLR、ECCV)及预印本平台(arXiv)的高质量论文,并辅以开源代码与项目主页的链接,形成结构化的知识图谱。内容按技术范式进行层级分类,涵盖前馈式重建、物理对象生成、人体运动建模及室内场景布局等核心子方向,确保覆盖领域的广度与深度。
特点
该资源库最显著的特征在于其动态更新与高度结构化。通过持续追踪GitHub提交活动与最新学术成果,保持内容的前沿性与时效性。每个条目均提供标题、日期、摘要及出处链接,便于研究者快速把握核心贡献。分类体系兼具逻辑性与可扩展性,从静态场景重建到动态人体交互,从稀疏视图输入到大规模前馈处理,系统性地反映了三维视觉领域从传统优化方法向端到端学习范式转变的演进脉络。
使用方法
使用者可通过目录索引快速定位感兴趣的子领域,例如点击“Feedforward Recon”即可浏览相关论文列表。每条记录均附带arXiv链接与项目主页,便于深入阅读原文与复现实验。列表中的代码链接(如GitHub仓库)提供了直接获取开源实现的途径,支持研究者进行算法验证与二次开发。该资源库亦接受Pull Request与Issue反馈,鼓励社区贡献以持续完善内容,形成开放协作的知识生态。
背景与挑战
背景概述
三维重建与生成是计算机视觉与图形学领域的一项核心研究课题,旨在从二维图像中恢复出物体的三维几何结构并生成逼真的新视角内容。随着深度学习技术的迅猛发展,特别是Transformer架构的引入,该领域经历了从传统优化方法到前馈式端到端学习的范式转变。该数据集由PolySummit团队于2023年底创建,汇集了来自全球顶尖研究机构(如Meta、NAVER、KAIST等)的最新成果,核心研究问题聚焦于如何实现无需相机标定、支持稀疏视图输入且具备通用泛化能力的三维重建与生成。该资源集合涵盖了从静态场景重建到动态人体运动生成、从物理对象建模到室内布局设计的广泛子任务,对推动三维视觉基础模型的发展具有重要影响力。
当前挑战
该领域面临的核心挑战包括:其一,解决从非结构化、稀疏甚至无重叠视图的图像集合中恢复一致且度量准确的三维几何结构这一根本性难题,传统方法依赖相机标定与特征匹配,而前馈模型缺乏显式的异常剔除机制,易受噪声图像干扰;其二,构建过程中需应对多模态数据融合的复杂性,例如将单目深度先验与相对位姿估计相结合时,深度预测的内在尺度模糊性与噪声会引入不确定性;其三,动态场景中人体、可变形物体的运动与刚体背景的耦合导致现有静态模型失效,亟需设计解耦姿态与几何的时空感知架构;其四,大规模训练数据的获取与标注成本高昂,且模型在自动驾驶等特定领域需适应小重叠视场与已知内外参的约束,进一步增加了泛化难度。
常用场景
经典使用场景
在三维视觉领域,该数据集广泛用于前馈式三维重建与生成的基准测试与模型训练。研究者借助其丰富的论文与项目索引,可系统性地评估从稀疏视角到密集点云的端到端重建方法,例如DUSt3R、VGGT等经典模型均依赖此类资源进行性能验证。该数据集尤其适用于多视图立体匹配、相机位姿估计以及无约束场景下的稠密三维重建任务,其收录的算法覆盖了从单张图像到百张以上图像的高效重建范式,为探索视觉几何与三维表征的深度融合提供了标准化实验平台。
解决学术问题
该数据集解决了三维重建领域中长期存在的关键学术难题,即如何在没有相机标定信息或先验几何约束的条件下实现鲁棒且可扩展的稠密三维重建。传统方法依赖繁琐的相机参数估计与迭代优化,而该数据集所收录的前馈式模型(如DUSt3R、VGGT)通过直接回归点图或深度图,突破了投影模型硬约束,显著降低了计算复杂度。其意义在于推动了从多任务专用模型向统一视觉几何基础模型的范式转变,使三维感知任务在精度与效率上取得了突破性进展。
衍生相关工作
该数据集催生了一系列具有里程碑意义的衍生工作,其中最具代表性的是DUSt3R及其变体MASt3R,它们开创了将图像匹配问题重新定义为三维点图回归任务的新范式。随后,Fast3R与MV-DUSt3R分别从计算效率与多视图协同角度进行了扩展,实现了千张图像的单次前向重建。此外,VGGT与Depth Anything系列进一步将前馈式架构推广至相机参数、深度图与点云轨道的联合预测,而PAGE-4D与DriveVGGT则分别针对动态场景与自动驾驶进行了领域适配,形成了从通用基础模型到垂直应用的技术谱系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务