遇见数据集

MegaC3

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

MegaC3是一个扩展的C3数据集,整合了MegaScenes的3D重建数据及C3与MegaScenes的对齐输出。该数据集基于C3Po(通过点图预测实现跨视图跨模态对应)研究工作,核心内容为配对的建筑平面图和互联网照片,提供像素级跨视图对应关系和相机姿态信息,并将MegaScenes的3D重建数据对齐到C3坐标系中。数据规模总计89,662个图像对,覆盖597个独特建筑场景,其中训练集65,351对、验证集4,568对、测试集19,743对,提供89,662个相机姿态文件和53,732个对应关系文件。数据组织形式清晰:图像对元数据存储在CSV文件中,包含全局ID、场景名称、平面图路径和照片路径;几何标注(对应关系和相机姿态)以NumPy文件格式存储,按ID分组;视觉资源(原始平面图和照片)按场景组织;MegaScenes对齐数据提供从MegaScenes到C3坐标系的转换点云及相关诊断信息。该数据集适用于计算机视觉领域的跨视图图像匹配、对应关系学习、相机姿态估计以及结合3D点云的多模态学习等任务。

MegaC3 is an extended C3 dataset that integrates 3D reconstruction data from MegaScenes and alignment outputs between C3 and MegaScenes. The dataset is based on the data used in the C3Po (Cross-view Cross-modal Correspondence via Point Graph Prediction) research work. Its core content consists of paired architectural floor plans and internet photos, providing pixel-level cross-view correspondences and camera pose information. Additionally, the dataset aligns MegaScenes 3D reconstruction data to the C3 coordinate system. In terms of scale, it includes a total of 89,662 image pairs, covering 597 unique architectural scenes, with 65,351 pairs in the training set, 4,568 in the validation set, and 19,743 in the test set. The dataset provides 89,662 camera pose files and 53,732 correspondence files. The data organization is clear: image pair metadata is stored in CSV files, containing global IDs, scene names, floor plan paths, and photo paths; geometric annotations (correspondences and camera poses) are stored in NumPy file format and grouped by ID; visual resources (original floor plans and photos) are organized by scene; MegaScenes alignment data provides transformed point clouds from MegaScenes to the C3 coordinate system along with related diagnostic information. This dataset is suitable for tasks in computer vision such as cross-view image matching, correspondence learning, camera pose estimation, and multimodal learning combined with 3D point clouds.

创建时间:
2026-06-25
原始信息汇总

数据集名称

MegaC3(MegaScenes-Aligned C3 Dataset)

数据集简介

MegaC3 是基于 C3 数据集的扩展版本,融合了 MegaScenes 的 3D 重建数据及 C3-to-MegaScenes 的对齐输出结果。该数据集旨在为跨视角、跨模态的对应关系预测(如 C3Po 方法)提供支撑。

数据内容

数据集包含配对的建筑平面图与互联网照片,并提供以下标注:

  • 像素级跨视角对应关系:每对图像中平面图与照片之间的像素匹配点。
  • 相机位姿:平面图到照片的旋转矩阵、平移向量及相机内参矩阵。
  • MegaScenes 对齐数据:将 MegaScenes 的 3D 重建结果对齐到 C3 坐标系中,生成变换后的点云及对齐诊断信息。

数据规模与划分

划分 图像对数量 场景数量 UID 范围 相机位姿文件数 对应关系文件数
训练集 65,351 479 0-92,336 65,351 29,421
验证集 4,568 411 23-92,330 4,568 4,568
测试集 19,743 118 92,887-120,022 19,743 19,743
总计 89,662 597(独立场景) 0-120,022 89,662 53,732

仓库目录结构

. ├── image_pairs/ # 图像对元数据(CSV文件) │ ├── train/image_pairs.csv │ ├── val/image_pairs.csv │ └── test/image_pairs.csv ├── geometric/ # 几何注释(对应关系与相机位姿) │ ├── train/ │ │ ├── correspondences/ │ │ └── camera_poses/ │ ├── val/ │ │ ├── correspondences/ │ │ └── camera_poses/ │ └── test/ │ ├── correspondences/ │ └── camera_poses/ ├── visual/ # 视觉资产(平面图与照片) │ └── {scene_name}/ │ ├── plans/ │ └── images/ ├── megascenes/ # MegaScenes 相关数据 │ ├── c3_scene_mapping.tsv │ ├── download_c3.txt │ ├── databases/ │ ├── images/ │ └── reconstruct/ ├── megascenes_alignment/ # MegaScenes 对齐输出 │ ├── transformed_points_manifest.csv │ ├── transformed_points_manifest.json │ ├── transformed_points/ │ └── diagnostics/ ├── c3_valid_point_stats/ # 有效点统计 ├── c3_negative_depth_case/ # 负深度诊断案例 └── example.png # 示例可视化图片

关键文件与格式说明

  • 图像对元数据image_pairs.csv):包含字段 uid(全局整数ID)、scene_name(场景目录名)、plan_path(平面图相对路径)、photo_path(照片相对路径)。
  • 对应关系文件.npy):NumPy 数组,形状 (2, M, 2),其中 arr[0] 为平面图像素坐标,arr[1] 为照片像素坐标。训练集仅部分图像对(29,421/65,351)包含此文件。
  • 相机位姿文件.npy):NumPy 对象数组,包含 R_plan_to_cam(旋转矩阵 3x3)、t_plan(平移向量 3,)、K(内参矩阵 3x3)。所有图像对均包含此文件。
  • MegaScenes 对齐点云transformed_points/*.npz):文件包含 xyz_c3(C3 坐标系下的3D点)、xyz_mega(原始MegaScenes点)、rgb(颜色)、error(误差)、track_length 等字段,以及 Sim(3) 变换参数。
  • 诊断文件c3_valid_point_stats/ 包含训练集有效点统计;c3_negative_depth_case/ 包含负深度案例诊断。

许可证

CC-BY-4.0

相关资源

  • 论文:C3Po: Cross-View Cross-Modality Correspondence by Pointmap Prediction(arXiv 2511.18559)
  • 项目网站:https://c3po-correspondence.github.io/
  • GitHub 仓库:https://github.com/c3po-correspondence/C3Po
搜集汇总
数据集介绍
MegaC3 数据集图片
构建方式
MegaC3数据集基于MegaScenes三维重建数据与C3数据集的对齐结果构建而成。其核心构建流程首先从MegaScenes中提取与C3场景相关的子集,通过精心设计的场景映射机制将MegaScenes坐标系下的三维点云、相机位姿等几何信息转换至C3坐标框架。该过程生成了包含328个对齐组件的变换点云清单,覆盖187个C3场景。数据集以HuggingFace仓库形式组织,视觉资产与几何标注文件直接以目录结构呈现,而非采用压缩归档,极大提升了数据访问效率。最终形成包含89,662个图像对、覆盖597个独特场景的大规模跨视角数据集。
特点
MegaC3最显著的特点在于其跨视角、跨模态的像素级对应关系标注。每个图像对均包含建筑平面图与互联网照片之间的稠密对应点,以(2, M, 2)形状的NumPy数组存储,同时提供完整的相机姿态信息(旋转矩阵、平移向量及内参矩阵)。数据集的独特之处还体现在其分层目录设计:训练集含29,421个对应文件与65,351个相机位姿文件,验证集与测试集则保证每个图像对均有对应标注。此外,数据集中包含MegaScenes对齐诊断报告、有效点统计及负深度案例分析等辅助文件,为模型鲁棒性分析提供了宝贵资源。
使用方法
使用MegaC3数据集时,研究者可借助Pandas读取图像对CSV元数据文件,通过全局唯一标识符(uid)定位对应的几何标注文件。对应关系文件按uid整除1000的商分目录存储,便于高效批量加载。相机位姿文件以NumPy对象数组形式保存,包含旋转、平移与内参矩阵。对于训练集,需特别检查对应文件是否存在后再加载。MegaScenes对齐数据可从变换点云清单中获取三维点云、颜色及对齐误差等信息。建议通过HuggingFace CLI或huggingface_hub库上传包含完整目录的仓库,并以路径库而非字符串拼接方式处理含特殊字符的图像路径。
背景与挑战
背景概述
MegaC3数据集由康奈尔大学的研究团队于2025年创建,核心人员包括Huang、Li、Hariharan和Snavely,旨在解决跨视角、跨模态图像匹配这一计算机视觉领域的核心难题。该数据集创新性地将建筑平面图与互联网照片对齐,提供像素级对应关系与相机位姿,填补了室内外场景理解中几何与语义信息融合的空白。基于MegaScenes大规模三维重建数据,MegaC3通过精心设计的对齐流程,构建了包含近9万对图像、覆盖597个独特场景的基准数据集,为跨视角点图预测等前沿研究奠定了坚实基础。其在NeurIPS 2025发表的C3Po工作中得到应用,对推动视觉定位、场景重建及智能导航等领域的发展产生了重要影响。
当前挑战
MegaC3面临的挑战首先在于跨视角、跨模态数据的内在异质性——平面图与真实照片在视角、光照、纹理和几何表示上存在显著差异,这使得建立可靠的像素级对应关系极为困难。其次,构建过程中需处理大量现实问题:互联网照片包含特殊字符路径、非ASCII字符及各种标点符号,增加了数据加载与处理的复杂性;三维重建数据与C3坐标框架的对齐涉及精确的Sim(3)变换,部分场景的对齐误差仍需优化;训练集中对应关系文件的缺失导致数据使用需动态校验。此外,大规模数据集的存储与分发也构成挑战,需借助Git LFS和专用工具链来管理海量的图像、点云及几何标注文件。
常用场景
经典使用场景
MegaC3数据集以其独特的跨视角图像与建筑平面图对齐机制,为三维重建与视觉定位领域提供了精密基准。研究者常利用其包含的像素级对应关系与相机位姿数据,训练模型在平面图与实景照片之间建立空间映射。该数据集涵盖近九万对图像样本,横跨近六百个独立场景,为跨模态特征学习与几何推理提供了丰富的训练与评估资源。通过其标准化的坐标转换框架,用户能够在一致的空间参考下系统性地开展跨视角匹配实验,评估算法在不同光照、视角和建筑风格下的泛化能力。
实际应用
在实际工程场景中,MegaC3所支撑的技术可广泛部署于建筑信息模型管理、室内导航与增强现实系统。基于平面图到实景的对齐能力,算法能够帮助运维人员将数字蓝图准确定位到实际建筑空间中,提升设施巡检与施工监控的自动化水平。同时,该项技术可赋能移动设备在未知室内环境中实现精准的视觉定位,为访客引导、应急疏散和文化遗产数字化展示提供可靠的空间锚点。其跨模态特性还使得从历史照片档案中自动恢复建筑布局成为可能,助力智慧城市建设中的数字孪生任务。
衍生相关工作
依托MegaC3这一富标注数据集,研究社区已催生出多项具有标杆意义的工作。其中最具代表性的是利用点图预测机制实现跨视角跨模态对应的C3Po方法,该方法在构建平面图与照片之间的稠密映射关系上取得了突破性进展,开创了以预测直接生成对应关系的新范式。此外,该数据集还为评估各类基于学习的三维重建、位姿估计与跨视图配准算法提供了标准化竞技场,促使研究者们围绕大规模像素级别对应的生成质量、匹配效率及鲁棒性开展深层次探索。这些衍生工作不仅丰富了跨模态几何学习的理论体系,也为后续在更广泛场景下的应用奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务