Sphere360
收藏资源简介:
Sphere360是一个大规模数据集,包含从YouTube采集的配对一阶Ambisonic空间音频和360°等距柱状投影视频,每个配对样本通过唯一ID确保空间声场与视觉球面的严格对齐。数据集总计提供791小时的配对素材,总规模为5.66 TB,包含5,631个配对样本(其中5,469个用于训练,162个用于测试),以及额外的415个独立音频文件和110个独立视频文件(未配对)。音频采用Opus编码,采样率为48 kHz,为4通道的一阶Ambisonic格式,代表完整的空间声场;视频采用VP9编码的等距柱状投影格式,同时包含一个立体声音频轨道(非空间音频)。数据组织上,配对样本按训练/测试划分,并通过哈希函数散列到64个分片中以便管理。每个样本的详细元数据(如文件路径、字节大小、持续时间、编解码信息、分辨率、YouTube源链接等)存储在JSONL文件中。该数据集专为空间音频处理、视听感知、360度视频内容理解等研究任务而设计,尤其适用于需要对齐的视听信号进行模型训练的场景。使用前需注意:视频分辨率(56种尺寸)和时长(12秒至11.4小时)不均;extras子集为未配对数据;数据集经过了严格的验证和质量控制,剔除了不含有效Ambisonic音轨的文件。
Sphere360 is a large-scale dataset containing paired first-order Ambisonic spatial audio and 360° equirectangular projection videos, all sourced from YouTube. Each paired sample shares a unique ID, ensuring strict alignment between the spatial sound field and the visual sphere, providing a total of 791 hours of paired material. The dataset has a total size of 5.66 TB, comprising 5,631 paired samples (5,469 for training, 162 for testing), along with an additional 415 standalone audio files and 110 standalone video files (unpaired). Audio is encoded in Opus format with a 48 kHz sample rate, in 4-channel first-order Ambisonic format, representing a complete spatial sound field. Video is encoded in VP9 equirectangular projection format, including a stereo audio track (non-spatial audio). Data organization includes train/test splits, with further hashing into 64 shards for management. Detailed metadata for each sample (such as file paths, byte sizes, duration, codec information, resolution, YouTube source links, etc.) is stored in JSONL files. The dataset is designed for research tasks in spatial audio processing, audiovisual perception, and 360-degree video content understanding, particularly suitable for scenarios requiring aligned audiovisual signals for model training. Usage notes: video resolution (56 different sizes) and duration (12 seconds to 11.4 hours) are uneven; the extras subset contains unpaired data; the dataset has undergone rigorous verification and quality control, removing files without valid Ambisonic tracks.
Sphere360 数据集概述
Sphere360 是一个专注于空间音频与360度视觉内容配对的数据集,提供了一阶高保真度立体环绕声(First-Order Ambisonics)音频和360°等距柱状投影视频,所有数据均来源于YouTube。数据集的核心特点是音频与视频通过共享ID实现对齐,确保了空间声场与视觉球体在内容上的匹配。总数据量为791小时配对材料。
数据集规模与划分
| 划分 | 配对数量 | 音频文件数 | 视频文件数 | 大小 |
|---|---|---|---|---|
train |
5,469 | 5,469 | 5,469 | 5.24 TB |
test |
162 | 162 | 162 | 0.17 TB |
extras |
— | 415 | 110 | 0.25 TB |
| 总计 | 5,631 | 6,046 | 5,741 | 5.66 TB |
extras分区包含未配对的音频或视频文件,仅适用于单模态使用。
数据格式与技术规格
- 音频:Opus 编码,48 kHz 采样率,4通道,一阶高保真度立体环绕声布局(
ambisonic 1)。所有音频文件均经过验证,确保布局一致。 - 视频:VP9 编码,等距柱状投影格式。视频中可能包含立体声轨道,但不应被用作空间音频;应始终从
audio/目录中获取高保真立体环绕声音频。
数据集布局
audio/{train,test}/{00..63}/<id>.webm 高保真立体环绕声音频 video/{train,test}/{00..63}/<id>.webm 360° 视频 extras/audio_only/{train,test}/<id>.webm 未配对音频 extras/video_only/{train,test}/<id>.webm 未配对视频 metadata/{train,test,extras}.jsonl 每个ID一行元数据 metadata/stats.json 统计信息,包含被排除的文件及原因
- 数据按64个
shard(分片)组织,每个目录约184个文件,便于管理。分片索引通过ID的哈希值计算得出。
使用方法
-
官方推荐通过元数据JSONL文件访问数据,而非手动构建路径。示例代码(Python): python import json from huggingface_hub import hf_hub_download R = "OmniAV/Sphere360" rows = [json.loads(l) for l in open(hf_hub_download(R, "metadata/train.jsonl", repo_type="dataset"))] r = rows[0] audio = hf_hub_download(R, r["audio"]["path"], repo_type="dataset") video = hf_hub_download(R, r["video"]["path"], repo_type="dataset")
-
也可通过命令行下载单个分片,以避免下载完整5.66TB数据: bash hf download OmniAV/Sphere360 --repo-type dataset --include "audio/train/00/" "video/train/00/"
重要注意事项
- 分辨率不统一:共存在56种不同分辨率。主流为3840×2160(44%)、3840×1920(28%)和3840×2048(9%),但范围可从1920×960到7680×4320。如果管道需要固定尺寸,请根据元数据中的
width和height字段进行筛选。 - 时长不统一:单个片段时长从12秒到11.4小时不等,中位数为277秒。使用前请按需剪辑。
extras/数据未配对,仅适用于单模态任务。- 数据清洗:30个文件被移除,原因是低比特率视频渲染错误地写入了音频槽位,这些文件完全不含音频流。被移除的文件ID记录在
metadata/stats.json的rejected_files中,其中27个仍含有真实视频的文件被移至extras/video_only/。 - 数据来源:每个数据行都包含
youtube_url字段,可追溯至原始YouTube视频。
可用性状态
- 分片
00–31已发布。 - 分片
32–63正在上传中。 metadata/目录始终准确描述当前已存在的数据,基于元数据的处理流程不会请求缺失文件。
引用信息
该数据集源自OmniAudio研究项目,如需引用请参阅: bibtex @inproceedings{omniaudio2025, title = {OmniAudio: Generating Spatial Audio from 360-Degree Video}, booktitle = {International Conference on Machine Learning (ICML)}, year = {2025} }




