遇见数据集

Sphere360

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

Sphere360是一个大规模数据集,包含从YouTube采集的配对一阶Ambisonic空间音频和360°等距柱状投影视频,每个配对样本通过唯一ID确保空间声场与视觉球面的严格对齐。数据集总计提供791小时的配对素材,总规模为5.66 TB,包含5,631个配对样本(其中5,469个用于训练,162个用于测试),以及额外的415个独立音频文件和110个独立视频文件(未配对)。音频采用Opus编码,采样率为48 kHz,为4通道的一阶Ambisonic格式,代表完整的空间声场;视频采用VP9编码的等距柱状投影格式,同时包含一个立体声音频轨道(非空间音频)。数据组织上,配对样本按训练/测试划分,并通过哈希函数散列到64个分片中以便管理。每个样本的详细元数据(如文件路径、字节大小、持续时间、编解码信息、分辨率、YouTube源链接等)存储在JSONL文件中。该数据集专为空间音频处理、视听感知、360度视频内容理解等研究任务而设计,尤其适用于需要对齐的视听信号进行模型训练的场景。使用前需注意:视频分辨率(56种尺寸)和时长(12秒至11.4小时)不均;extras子集为未配对数据;数据集经过了严格的验证和质量控制,剔除了不含有效Ambisonic音轨的文件。

Sphere360 is a large-scale dataset containing paired first-order Ambisonic spatial audio and 360° equirectangular projection videos, all sourced from YouTube. Each paired sample shares a unique ID, ensuring strict alignment between the spatial sound field and the visual sphere, providing a total of 791 hours of paired material. The dataset has a total size of 5.66 TB, comprising 5,631 paired samples (5,469 for training, 162 for testing), along with an additional 415 standalone audio files and 110 standalone video files (unpaired). Audio is encoded in Opus format with a 48 kHz sample rate, in 4-channel first-order Ambisonic format, representing a complete spatial sound field. Video is encoded in VP9 equirectangular projection format, including a stereo audio track (non-spatial audio). Data organization includes train/test splits, with further hashing into 64 shards for management. Detailed metadata for each sample (such as file paths, byte sizes, duration, codec information, resolution, YouTube source links, etc.) is stored in JSONL files. The dataset is designed for research tasks in spatial audio processing, audiovisual perception, and 360-degree video content understanding, particularly suitable for scenarios requiring aligned audiovisual signals for model training. Usage notes: video resolution (56 different sizes) and duration (12 seconds to 11.4 hours) are uneven; the extras subset contains unpaired data; the dataset has undergone rigorous verification and quality control, removing files without valid Ambisonic tracks.

创建时间:
2026-07-25
原始信息汇总

Sphere360 数据集概述

Sphere360 是一个专注于空间音频与360度视觉内容配对的数据集,提供了一阶高保真度立体环绕声(First-Order Ambisonics)音频360°等距柱状投影视频,所有数据均来源于YouTube。数据集的核心特点是音频与视频通过共享ID实现对齐,确保了空间声场与视觉球体在内容上的匹配。总数据量为791小时配对材料。

数据集规模与划分

划分 配对数量 音频文件数 视频文件数 大小
train 5,469 5,469 5,469 5.24 TB
test 162 162 162 0.17 TB
extras 415 110 0.25 TB
总计 5,631 6,046 5,741 5.66 TB
  • extras 分区包含未配对的音频或视频文件,仅适用于单模态使用。

数据格式与技术规格

  • 音频:Opus 编码,48 kHz 采样率,4通道,一阶高保真度立体环绕声布局(ambisonic 1)。所有音频文件均经过验证,确保布局一致。
  • 视频:VP9 编码,等距柱状投影格式。视频中可能包含立体声轨道,但不应被用作空间音频;应始终从 audio/ 目录中获取高保真立体环绕声音频。

数据集布局

audio/{train,test}/{00..63}/<id>.webm 高保真立体环绕声音频 video/{train,test}/{00..63}/<id>.webm 360° 视频 extras/audio_only/{train,test}/<id>.webm 未配对音频 extras/video_only/{train,test}/<id>.webm 未配对视频 metadata/{train,test,extras}.jsonl 每个ID一行元数据 metadata/stats.json 统计信息,包含被排除的文件及原因

  • 数据按64个shard(分片)组织,每个目录约184个文件,便于管理。分片索引通过ID的哈希值计算得出。

使用方法

  • 官方推荐通过元数据JSONL文件访问数据,而非手动构建路径。示例代码(Python): python import json from huggingface_hub import hf_hub_download R = "OmniAV/Sphere360" rows = [json.loads(l) for l in open(hf_hub_download(R, "metadata/train.jsonl", repo_type="dataset"))] r = rows[0] audio = hf_hub_download(R, r["audio"]["path"], repo_type="dataset") video = hf_hub_download(R, r["video"]["path"], repo_type="dataset")

  • 也可通过命令行下载单个分片,以避免下载完整5.66TB数据: bash hf download OmniAV/Sphere360 --repo-type dataset --include "audio/train/00/" "video/train/00/"

重要注意事项

  • 分辨率不统一:共存在56种不同分辨率。主流为3840×2160(44%)、3840×1920(28%)和3840×2048(9%),但范围可从1920×960到7680×4320。如果管道需要固定尺寸,请根据元数据中的widthheight字段进行筛选。
  • 时长不统一:单个片段时长从12秒到11.4小时不等,中位数为277秒。使用前请按需剪辑。
  • extras/ 数据未配对,仅适用于单模态任务。
  • 数据清洗:30个文件被移除,原因是低比特率视频渲染错误地写入了音频槽位,这些文件完全不含音频流。被移除的文件ID记录在metadata/stats.jsonrejected_files中,其中27个仍含有真实视频的文件被移至extras/video_only/
  • 数据来源:每个数据行都包含youtube_url字段,可追溯至原始YouTube视频。

可用性状态

  • 分片 0031 已发布。
  • 分片 3263 正在上传中。
  • metadata/ 目录始终准确描述当前已存在的数据,基于元数据的处理流程不会请求缺失文件。

引用信息

该数据集源自OmniAudio研究项目,如需引用请参阅: bibtex @inproceedings{omniaudio2025, title = {OmniAudio: Generating Spatial Audio from 360-Degree Video}, booktitle = {International Conference on Machine Learning (ICML)}, year = {2025} }

搜集汇总
数据集介绍
Sphere360 数据集图片
构建方式
Sphere360数据集通过大规模爬取YouTube平台上的内容构建而成,专注于收集成对的一阶环境声(First-Order Ambisonic)音频与360°等距柱状投影视频。每对数据共享唯一标识符,确保空间声场与视觉场景在结构上严格对齐。数据采集过程中并行进行两次抓取,当同一ID产生多个结果时,优先保留分辨率更高的副本,若分辨率相同则依据文件大小裁定。部分低比特率视频被排除后,仍可获得791小时的配对素材,总量达5.66 TB。
特点
该数据集共包含5,631个配对样本,音频均采用48 kHz采样率、4通道的环境声布局(ambisonic 1),视频分辨率跨度从1920×960至7680×4320,其中主要分布为3840×2160(44%)与3840×1920(28%)。每个样本均附带YouTube网址以实现溯源。数据按64个分片组织,每分片约184个文件,支持按标识符哈希值快速定位。另有单独的extras目录收录未配对的单模态内容。
使用方法
用户需通过JSONL元数据文件读取样本路径,而不能依赖固定扩展名构建路径。典型用法为借助huggingface_hub库下载metadata/train.jsonl,解析每一行获取音频与视频的存储路径,再调用hf_hub_download获取具体文件。为节省带宽,可指定分片编号如audio/train/00/*与video/train/00/*进行局部下载。数据预处理时需注意分辨率和时长不均一的问题,按需裁剪或过滤。
背景与挑战
背景概述
Sphere360数据集由OmniAV团队在2025年国际机器学习大会(ICML)提出的OmniAudio项目中创建,旨在为360度视频与一阶环境立体声音频的配对研究提供大规模基准资源。该数据集从YouTube采集了791小时的同步音视频素材,包含5631对对齐的音频与视频,覆盖丰富多样的真实场景,从而推动沉浸式视听感知、空间音频生成与场景理解等前沿课题的发展。作为首个开源的大规模环境音-全景视频配对数据集,Sphere360填补了该领域高质量训练数据的空白,为相关研究提供了关键支撑,并在空间音频与视觉融合领域产生了广泛影响。
当前挑战
Sphere360所解决的领域问题挑战主要在于空间音频与360度视觉信息的联合表征与生成缺乏大规模、高质量的配对数据,现有数据多受限于实验室环境或合成数据,难以支撑真实场景下的模型训练。构建过程中面临多重挑战:视频分辨率差异显著(从1920×960到7680×4320共56种尺寸),时长跨度极大(12秒至11.4小时),需设计灵活的数据过滤与预处理策略;音频与视频流需严格验证以确保一阶环境立体声格式的正确性,并处理了因低码率渲染导致的30个错误文件;并行抓取时需解决复制冲突,以高分辨率优先策略保证数据质量,最终通过哈希分片与元数据驱动方式实现大规模数据的高效管理与可复现性。
常用场景
经典使用场景
Sphere360数据集被广泛用于空间音频与360度全景视频的联合建模任务。其核心价值在于提供了一阶环境立体声与等距柱状投影视频的精确配对数据,使得研究者能够构建从视觉场景到空间声场的映射关系。在沉浸式媒体研究领域,经典使用场景包括基于视觉信息的空间音频生成、多模态场景理解以及视听信息协同感知。通过利用5,631对高质量配对样本,研究人员可以训练深度神经网络学习全景视频中视觉物体位置与声音空间分布的对应关系,为虚拟现实和增强现实环境中的真实听觉体验重建奠定数据基础。
解决学术问题
该数据集系统性地解决了空间音频研究中长期存在的多模态对齐数据匮乏问题。在学术层面,它使得三维声场重建、视听场景解析和空间听觉感知建模等关键研究方向获得了规模化训练数据支持。通过提供统一标识符关联的音频-视频对,研究者可以探索视觉引导的声源定位、基于场景理解的声场合成以及全向音频质量评估等前沿课题。Sphere360的出现填补了学界在大规模、高质量空间音频-视频配对数据集方面的空白,推动了沉浸式媒体技术从单模态分析向多模态融合方向的范式转变,对计算机视觉、音频信号处理和虚拟现实交叉领域产生了深远影响。
衍生相关工作
基于Sphere360衍生出的代表性工作包括OmniAudio框架,该工作首次实现了从360度视频到一阶环境立体声的端到端生成,在国际机器学习大会(ICML)上展示了令人瞩目的效果。受此启发,后续研究者提出了视听协同的空间音频质量评估模型、基于注意力机制的视觉引导声场合成方法以及跨模态学习框架,旨在探索全景视频与空间音频之间的深层语义关联。这些衍生工作不仅验证了Sphere360在推动空间音频生成领域的基础性作用,还拓展了其在弱监督学习、自监督表示学习等前沿方向的应用边界,形成了以数据驱动为核心的沉浸式媒体研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务