遇见数据集

OmniLife360

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

OmniLife360 是一个专为从野外捕获的 360 度全景视频进行 3D 重建而设计的基准数据集,旨在推动全景计算机视觉和三维重建方法的研究与评估。数据集包含 2,407 个全景视频序列,总时长约 66 小时,划分为 1,937 个训练序列和 470 个测试序列,覆盖 64 个场景类别和 31 个动作类别。数据来源包括 2,177 个来自网络的公开链接视频序列和 230 个由作者团队捕获的未公开链接序列。每个序列通过唯一路径标识,并提供丰富的元数据,如源视频标识符、URL、时间片段、场景/动作/区域标签、媒体属性和文字描述。数据以提取的帧图像形式组织,预处理为每秒 1 帧采样,尺寸调整为 1920x960 像素。此外,数据集提供基于 COLMAP 的稀疏 3D 重建模型,支持算法训练和基准测试,适用于 360 度全景场景下的三维重建、神经渲染和场景理解等任务。数据集经过隐私审查,不包含个人身份信息,使用受 CC BY-NC 4.0 许可证约束,仅用于学术研究。

OmniLife360 is a benchmark dataset designed for 3D reconstruction from 360-degree panoramic videos captured in the wild. It aims to advance research and evaluation in panoramic computer vision and 3D reconstruction methods. The dataset includes 2,407 panoramic video sequences, totaling approximately 66 hours, divided into 1,937 training sequences and 470 test sequences, covering 64 scene categories and 31 action categories. Data sources consist of 2,177 publicly linked video sequences from the web and 230 non-publicly linked sequences captured by the author team. Each sequence is identified by a unique path and provides rich metadata, such as source video identifiers, URLs, temporal segments, scene/action/region labels, media properties, and textual descriptions. The data is organized as extracted frame images, preprocessed by sampling at 1 frame per second and resizing to 1920x960 pixels. Additionally, the dataset offers sparse 3D reconstruction models based on COLMAP, supporting algorithm training and benchmarking for tasks like 3D reconstruction, neural rendering, and scene understanding in 360-degree panoramic scenarios. It has undergone privacy review, excludes personal identifiable information, and is licensed under CC BY-NC 4.0 for academic use only.

创建时间:
2026-06-22
搜集汇总
数据集介绍
OmniLife360 数据集图片
构建方式
OmniLife360数据集的构建依托于大规模网络公开的360度视频资源,辅以少量作者团队自主拍摄的全景序列。整个流程从2,177个公开可访问的网页视频链接出发,经过人工严格筛选,排除包含敏感、隐私或不当内容的片段,最终形成2,407个全景序列,总计约66小时时长。数据集划分为1,937个训练序列与470个测试序列,横跨64种场景类别与31种动作类别。每段序列均通过元数据文件精确定义其时间切片(start_sec至end_sec),并统一以1帧每秒的采样率、1920x960的分辨率提取全景帧,存储为JPEG图像序列。此外,基于COLMAP的非重叠透视渲染全景重建流程,系统性地输出了SfM稀疏重建结果,为后续三维重建提供基准。
特点
OmniLife360的核心特点在于其大规模、多类别、真实世界采集的全景数据体系,填补了从非受控环境360度视频进行三维重建的基准空白。数据集包含64种场景与31种动作类别的精细标注,覆盖日常生活的广泛维度,使得在复杂光照、动态物体和杂乱背景下评估重建鲁棒性成为可能。其元数据结构完整,囊括源视频标识、时间区间、场景动作标签、分辨率、帧率和语言描述,确保每段序列均可追溯与复现。特别地,数据集还提供了COLMAP全景SfM重建结果,支持直接对比与二次开发。所有数据遵循CC BY-NC 4.0许可,严格限制于学术与非商业用途,并通过隐私审查保障合规性。
使用方法
使用OmniLife360首先需获取元数据文件,根据source_url下载公开视频,并利用scripts/prepare_frames_from_metadata.py脚本自动提取指定时间段的全景帧,存储至预设路径。对于已获取的帧数据,可通过运行run_panorama_sfm_from_frames.sh脚本调用COLMAP全景SfM管线,复现或扩展基准重建结果。研究者可灵活选取训练与测试分割,基于跨场景、跨动作的标注设计特定任务,如场景重建、动态物体建模或多视角一致性评估。数据集提供的SfM结果可作为初始点云或相机位姿输入,集成至Gaussian Splatting、NeRF等现代重建框架。需注意公开视频的可用性可能随时间变化,建议及时下载并缓存。
背景与挑战
背景概述
OmniLife360是2026年由华中科技大学等机构的研究人员构建的一个面向真实世界360度全景视频的三维重建基准数据集。该数据集诞生于计算机视觉领域对沉浸式三维场景理解日益增长的需求,旨在弥合从受限环境下的三维重建向开放、动态、非受控的日常生活场景迁移的鸿沟。其核心研究问题是:如何从互联网级质量、多样化、未经标定的全景视频中鲁棒地恢复出高保真三维结构。数据集包含2407个全景序列(约66小时),覆盖64种场景和31种动作类别,为三维重建、神经渲染及动态场景分析提供了大规模、高质量的训练与评估平台,对推动沉浸式媒体、虚拟现实和机器人感知等领域的发展具有重要影响力。
当前挑战
当前OmniLife360面临的核心挑战包括:第一,所解决的领域问题——真实世界全景视频的三维重建面临剧烈光照变化、复杂运动模糊、遮挡以及全景图像的畸变与拼接伪影,传统基于针孔相机的SfM/MVS方法难以直接适配,亟需发展专门针对等距柱状投影或多视角全景渲染的几何与光度一致性建模技术。第二,数据构建过程中遇到的挑战——海量网络视频来源松散、元数据标准化困难,原始视频的下载与转码随时间推移可能因平台策略变动而失效,导致最佳努力(best-effort)的帧级复现策略成为必要;同时,隐私筛选需手动审查每一段视频的内容,排除敏感信息与个人身份标识,这在2,177条公开链接和230条自采数据中耗费大量人力,且需维持严格的安全准绳以规避潜在的伦理风险。
常用场景
经典使用场景
OmniLife360数据集专为野外360度视频的三维重建任务而构建,其经典使用场景聚焦于从全景序列中恢复场景的几何结构与外观。通过提供2,407段全景序列,覆盖64种场景类别和31种动作类别,该数据集允许研究者基于COLMAP的SfM(运动恢复结构)管线,在非重叠透视渲染的框架下进行三维重建实验。典型应用包括利用1 FPS采样的全景帧,结合高斯泼溅(Gaussian Splatting)等神经渲染技术,实现从大范围、无约束拍摄的全景视频中生成高质量的三维模型。这一场景尤其适用于评估方法在室内外动态环境下的泛化能力,例如处理光照变化、遮挡及复杂纹理等挑战。
衍生相关工作
OmniLife360衍生出多项经典工作在三维视觉领域产生深远影响。基于其提供的2,177段公开网络视频与230段自捕获序列,研究者开发了全景SfM管线优化方法,例如提出动态场景剥离算法以减少运动物体对点云融合的干扰。该数据集还催生了全景高斯泼溅(Panoramic Gaussian Splatting)的早期探索,通过将360度帧的球面映射引入3D GS的初始化与密度控制环节,显著提升了渲染质量。此外,OmniLife360被用于评估无监督深度估计方法在全景视频上的迁移能力,推动了自监督学习从透视图像向全向感知的扩展。这些工作不仅验证了数据集的基准价值,更确立了其作为桥梁连接传统三维重建与新兴全景理解范式的核心地位。
数据集最近研究
最新研究方向
OmniLife360作为首个面向真实世界360度视频的大规模三维重建基准,推动了全景高斯泼溅、神经辐射场等前沿技术从受控实验室走向复杂开放场景。该数据集包含超2400条全景序列,覆盖64种场景类别与31种动作类别,为动态环境下的全景三维理解提供了标准化评估平台。其发布恰逢三维内容生成与沉浸式体验需求爆发期,不仅支撑了基于全景观测的非重叠视角三维重建研究,更有望推动自动驾驶、虚拟现实和空间智能体等应用在无约束全景数据下的鲁棒性突破,成为连接360度视觉感知与三维重建领域的关键纽带。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务