遇见数据集

McAuley-Lab/OSSL-v2

收藏
Hugging Face2026-06-06 更新2026-06-14 收录
官方服务:

资源简介:

OSSL-v2(开放屏幕配乐库版本2)是一个用于视频到音乐生成任务的数据集,包含配对的电影视频片段和配乐音乐片段。数据集总计有34,343个片段,覆盖1,812部电影,分为31,011个训练片段和3,332个测试片段。每个片段都包括视频文件(MP4格式)和音频文件(WAV格式),并按照电影ID组织在子文件夹中。数据集还提供详细的元数据,包括电影标题、年份、类型、IMDb评分、YouTube视频信息等,这些信息来源于IMDb和YouTube。该数据集旨在支持音乐生成和多媒体内容创作的研究。

Open Screen Soundtrack Library Version 2 (OSSL-v2) is a dataset of paired film video and soundtrack music clips for video-to-music generation. It contains a total of 34,343 clips from 1,812 movies, split into 31,011 training clips and 3,332 test clips. Each clip includes a video file (MP4) and an audio file (WAV), organized into subfolders by movie ID. The dataset provides comprehensive metadata such as movie title, year, genres, IMDb rating, YouTube video details, sourced from IMDb and YouTube. It is designed for research in music generation and multimedia content creation.

提供机构:
McAuley-Lab
搜集汇总
数据集介绍
McAuley-Lab/OSSL-v2 数据集图片
构建方式
OSSL-v2(Open Screen Soundtrack Library Version 2)是一个专为视频到音乐生成任务设计的配对数据集,其构建过程严谨而系统。研究团队从IMDb电影数据库中筛选出1,812部影片,通过YouTube获取对应的电影片段与原始音轨,并采用精准的片段切分策略,以剪辑标识符(clip_id)编码电影索引、片段序号及起止时间戳。所有数据按电影层级组织,每个电影ID对应独立的视频与音频子文件夹,确保配对关系的明确性。最终,数据集被划分为训练集(31,011个片段)和测试集(3,332个片段),且同一电影的片段不会跨数据集拆分,有效避免了数据泄露。
特点
该数据集具有多个引人注目的特点。首先,其规模庞大,包含34,343个精标注的电影视频与配乐音频片段,覆盖1,812部不同风格与年代的影片,为模型训练提供了丰富的多样性。其次,metadata.csv文件记录了每部电影详尽的元数据,包括IMDb评分、类型、导演、年份,以及来源YouTube视频的播放量与频道信息,为多模态研究提供了丰富的上下文线索。此外,数据集采用标准化的目录结构与PKL格式的分割索引文件,用户可通过HuggingFace datasets库一行代码加载,极大降低了使用门槛。
使用方法
使用OSSL-v2进行视频到音乐生成任务时,用户可通过HuggingFace的datasets库便捷加载,例如使用load_dataset('McAuley-Lab/OSSL-v2', split='train')直接获取训练集。数据以电影子文件夹形式组织,用户可依据clip_id的编码规则(如movie_id_clip_idx_start_end)解析片段的时间边界。为复现论文结果或开展个性化研究,建议参照公开的splits/train.txt和splits/test.txt文件划分数据,并结合metadata.csv中的电影元数据辅助条件生成。引用该数据集时,请使用官方提供的BibTeX条目标注出处。
背景与挑战
背景概述
在视频生成与多模态学习蓬勃发展的当下,视频与音乐之间的语义对齐成为极具挑战的研究课题。Open Screen Soundtrack Library Version 2 (OSSL-v2) 数据集由 McAuley-Lab 研究团队于2026年前后构建,旨在推动视频到音乐生成(video-to-music generation)领域的进展。该数据集核心研究问题聚焦于如何从电影视频片段中学习与画面内容、情感氛围相匹配的配乐生成模型,并探索对话感知(dialogue-aware)的音乐合成策略。通过收集来自1812部影片的逾34000对视频-配乐剪辑,OSSL-v2为跨模态生成任务提供了大规模、高质量且具备丰富元数据的基准。其影响力不仅限于生成模型训练,更延伸到多模态表征学习、影视内容理解与创意媒体自动制作等前沿方向。
当前挑战
OSSL-v2 数据集所解决的领域挑战在于,视频配乐生成需同时兼顾视觉场景语义、情节情绪流变以及音频-视觉的时间同步,而现有数据往往缺乏精确对齐的配对样本。构建过程中面临的挑战包括:从公开领域电影中筛选出具有完整、清晰配乐且版权可用的片段,确保每个视频剪辑与其配乐在时序上精确对应;协调来自IMDb的电影元数据与来自YouTube的源视频信息,处理不同来源间不一致的标题、时长及版权许可;设计合理的训练-测试划分策略以避免同一部影片的片段出现在两个集合中,从而防止数据泄露。此外,面对1812部影片的异构音频质量,还需统一音频编码格式与采样率,保障训练数据的可用性。
常用场景
经典使用场景
OSSL-v2作为一个大规模配对电影视频与背景音乐的数据集,其最为经典的使用场景在于视频到音乐的生成任务。该数据集提供了来自1812部电影的34343个剪辑片段,每个片段均包含同步的视频与音频配乐,为模型学习视觉内容与音乐情绪、节奏、风格的对应关系提供了高质量的训练素材。研究者常利用这些配对数据训练条件生成模型,例如根据无声视频片段自动合成与之匹配的背景音乐,或实现视频风格导向的音乐风格迁移,从而推动多模态生成技术的边界。
解决学术问题
该数据集的构建直击了视频配乐自动生成领域的关键痛点:缺乏大规模、高质量且版权清晰的配对训练数据。OSSL-v2解决了因数据稀缺导致模型难以学习视频与音乐复杂关联的学术困境,使得研究者能够系统性地探索视觉特征(如动态、场景、情感)与音乐参数(如节奏、音色、调性)之间的映射规律。其标准化的划分策略和丰富的电影元数据(如类型、年份、IMDb评分)还为多模态表征学习、跨模态检索以及音乐与叙事结构的对齐研究提供了基准,显著推动了自动配乐领域的实验复现与成果可比性。
衍生相关工作
OSSL-v2催生了一系列开创性学术工作,尤其在对话感知的视频配乐生成、多模态音乐生成框架以及情感驱动的视听对应学习等方向。基于该数据集,研究者提出了融合对话语音与视觉线索的细粒度音乐生成模型,使配乐能够贴合人物对话的情绪起伏;也有工作利用预训练视觉编码器与潜在扩散模型,构建了从视频语义直接映射到音乐声学特征的高效管线。更进一步,该数据集被用作评估跨模态检索与生成一致性的标准平台,衍生了诸如视频与背景音乐的情感对齐度量、电影场景与音乐主题的语义匹配分析等基准研究,为自动配乐领域的理论深化与方法创新奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务