遇见数据集

suno-various-94k

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集名为 Suno Various 94k,包含 94,174 对精确的原始音频与封面音频,专为参考条件、偏好、滑块和音乐风格迁移研究而设计。数据集分为两个独立子集:original(原始音频)和 covers(封面音频),每个子集均包含 85 个 tar 包和对应的 JSON 索引文件(WebShart 格式)。原始音频来自 Suno 生成的音乐,涵盖 53,082 位不同创作者,总时长约 5,429 小时,每条样本包含持续时间、风格描述、歌词、创作者标识、源片段 ID、搜索词和模型版本等字段。封面音频由 ACE-Step 1.5 XL Turbo 生成,保留源音频的作曲和歌词,但目标风格描述由 Qwen3.8-27B 模型重写,生成使用 8 步扩散和封面强度 0.50。数据集还提供了可恢复的生成管道代码、进度文件及原始数据集卡片。注意:所有源音频的版权归原始创作者所有,封面为衍生研究制品。封面音频为研究级输出,可能包含生成伪影、风格条件失败或低质量结果,未经过全面人工审计。数据集存在以下限制:源音频为合成音频,存在 Suno 模型伪影;收集存在流行度偏差;创作者描述词汇和特异性各异;搜索词仅为发现来源,非验证的流派标签;未过滤显式内容;封面继承源限制并增加 ACE-Step 伪影。该数据集适用于音乐风格迁移、参考条件控制、偏好学习等研究任务。

This dataset is named Suno Various 94k, containing 94,174 precise pairs of original audio and cover audio, designed for research on reference conditioning, preference, slider, and music style transfer. It is divided into two independent subsets: original and covers, each containing 85 tar packages and corresponding JSON index files (WebShart format). The original audio comes from Suno-generated music, covering 53,082 different creators, with a total duration of approximately 5,429 hours. Each sample includes fields such as duration, style description, lyrics, creator ID, source segment ID, search term, and model version. The cover audio is generated by ACE-Step 1.5 XL Turbo, retaining the composition and lyrics of the source audio, but the target style description is rewritten by the Qwen3.8-27B model, using 8-step diffusion and cover strength 0.50. The dataset also provides resumable generation pipeline code, progress files, and the original dataset card. Note: The copyright of all source audio belongs to the original creators, and the covers are derivative research artifacts. The cover audio is research-grade output, may contain generation artifacts, style condition failures, or low-quality results, and has not been fully manually audited. The dataset has the following limitations: source audio is synthetic and contains Suno model artifacts; collection has popularity bias; creator description vocabulary and specificity vary; search terms are only discovery sources, not verified genre labels; explicit content is not filtered; covers inherit source limitations and add ACE-Step artifacts. This dataset is suitable for research tasks such as music style transfer, reference conditioning, and preference learning.

创建时间:
2026-08-15
原始信息汇总

Suno Various 94k 数据集概述

基本信息

  • 数据集名称:Suno Various 94k Original and ACE-Step Covers
  • 规模:包含 94,174 对原始音频/翻唱音频对(100K < n < 1M)
  • 任务类型:文本转音频(text-to-audio)
  • 标签:音乐、音频、歌词、风格迁移、偏好、WebDataset
  • 许可协议:source-rights-retained(非标准许可证,链接至 Suno 服务条款)

数据内容

  • 原始数据:94,174 首 Suno 生成的音乐曲目,附带创作者风格描述、结构化歌词和来源信息;涵盖 53,082 位独立创作者,约 5,429 小时音频;包含时长、描述、歌词、创作者昵称、来源片段 ID、发现词和模型版本字段。
  • 翻唱数据:使用 ACE-Step 1.5 XL Turbo 生成的翻唱版本,保留原始作曲和歌词,但目标风格描述由 Qwen3.8-27B 重写;生成使用 8 步扩散和 0.50 的翻唱强度。
  • 配对信息:翻唱 JSON 中记录了 pair_sourcesource_captiontarget_stylepair_generation 字段,使配对关系明确可审计。

数据组织

  • 数据集分为 original/covers/ 两个子文件夹,各包含 85 个 tar 文件及对应的 WebShart 随机访问索引(JSON 文件)。
  • 每个 tar 文件中的成员以片段 ID 为键,包含 <clip_id>.mp3<clip_id>.json
  • 两个子文件夹的片段 ID 完全一致(94,174 个),可通过文件名主干/片段 ID 进行配对。

加载方式

  • 支持通过 webshart.discover_dataset 分别加载任一子数据集,或通过片段 ID 进行配对任务。

权利与来源

  • 所有原始音频和歌词的权利归第三方 Suno 用户(创作者)所有,数据集不授予底层内容的任何权利。
  • 翻唱输出为派生的研究产物,每条记录的 JSON 中包含创作者身份和来源片段 ID,支持单样本定位和移除。
  • 创作者可通过讨论区请求移除其作品。

质量声明与局限性

  • 翻唱质量为研究级,并非精修语料:可能存在生成伪影、作曲或歌词保留不完美、风格条件失败或低质量结果;未经全面人工审计。
  • 作者承认该数据集并不完美,但认为“不完美但可检查的大规模配对数据集比完全没有更有用”。
  • 局限性
    • 所有源音频均为合成,继承 Suno 模型伪影。
    • 收集受 Suno 搜索相关性影响,存在流行度偏差。
    • 创作者撰写的描述词汇和具体程度各异。
    • 搜索词是发现来源,而非经过验证的流派标签。
    • 包含未过滤的露骨内容。
    • 翻唱继承源限制并增加 ACE-Step 生成伪影。
搜集汇总
数据集介绍
suno-various-94k 数据集图片
构建方式
该数据集由两部分构成,原始音频部分收集了由Suno平台用户生成的94,174首音乐曲目,附带创作者风格描述、结构化歌词与样本来源信息;翻唱音频部分则通过ACE-Step 1.5 XL Turbo模型对原始音频进行风格迁移生成,源曲目与歌词保持不变,而目标风格描述由Qwen3.8-27B模型重写。数据以WebDataset格式存储于85个分片对中,每个分片内包含匹配的MP3音频与JSON元数据,支持按原始曲目或翻唱版本独立加载,或通过共享的剪辑ID进行成对关联。
特点
该数据集的显著特点在于其精准的成对结构:每个原始音频与对应的翻唱版本共享同一剪辑ID,构成94,174对完全匹配的样本,为风格迁移、参考条件生成和偏好研究提供了大规模可控数据基础。元数据中不仅记录了源音频的创作者、时长、歌词与生成模型,还完整保留了翻唱版本的目标风格、源配对信息和生成参数(如扩散步数与强度),确保了数据关系的透明性与可追溯性。此外,数据集的规模(约5,429小时音频)与多样性(覆盖53,082位创作者)使其在同类开放数据集中具有独特优势,尽管存在质量不均的局限性,但其结构设计仍为研究者提供了灵活且可审计的数据利用途径。
使用方法
研究者可通过Python的webshart库按原始或翻唱子集独立加载数据,每个子集分别包含85个WebShart随机访问索引,便于进行大规模音频分类、生成或特征提取实验。对于需要配对数据的任务(如风格迁移评估),只需通过文件名茎或剪辑ID将两个子集中的样本进行联结,翻唱JSON中已预先记录pair_source、source_caption等字段,可直接用于有监督学习。数据加载采用WebDataset格式,支持流式读取,适合在分布式计算环境中高效处理。该数据集还提供了生成管线的代码与进度文件,便于复现或扩展覆盖生成流程,同时通过稳定的剪辑ID机制支持样本级别的移除或更新,保障了数据使用的规范性。
背景与挑战
背景概述
随着音乐生成技术的飞速发展,风格迁移与参考条件生成成为音频领域的研究热点。2023年,Suno公司推出的音乐生成模型引领了创作范式变革,而其产生的海量用户生成内容则为研究提供了独特素材。在此背景下,WebDataset团队构建了“suno-various-94k”数据集,旨在打造一个包含94,174对原始歌曲与ACE-Step封面歌曲的大规模配对语料库。该数据集由Suno用户生成原始音频,并借助ACE-Step 1.5 XL Turbo模型生成风格迁移版本,同时利用Qwen3.8-27B重写风格描述,为音乐风格迁移、偏好学习及多模态研究提供了基座资源。其创建填补了该规模下开源配对数据集的空白,对推动可控音乐生成与音频理解研究具有里程碑意义。
当前挑战
该数据集面临多重挑战。领域层面,音乐风格迁移需在保留源歌曲内容与歌词的同时实现风格变换,而现有模型在保证音频质量与风格一致性上仍存在瓶颈,导致部分封面样本含有生成伪影、歌词保留不完整或风格条件失效。构建过程中,团队需要从Suno平台采集海量用户生成内容,面临版权归属模糊与内容多样性难题,且原始数据存在搜索流行度偏差、创作者描述风格不一、标签不准确等局限。此外,数据集含未过滤的露骨内容,对安全使用构成挑战。尽管基于不完美数据构建的大规模配对资源具研究价值,但其质量未经人工全面审核,不能作为基准真值。
常用场景
经典使用场景
该数据集的核心应用场景在于音乐风格迁移与参考条件生成研究。它提供了94,174对精确的原始音频与经过ACE-Step模型生成的翻唱版本,使得研究者能够利用配对数据训练条件生成模型,实现从源歌曲到目标风格的转换。此外,该数据集也适用于文本到音频生成任务,其中原始侧包含丰富的歌词、风格描述和创作元数据,为多模态音乐生成提供有力的训练资源。其独特的配对结构还支持基于参考的音频生成研究,即通过指定风格或内容参考,生成与之匹配的新音频,从而推动个性化音乐创作和自动编曲技术的发展。
实际应用
在实际应用中,该数据集可服务于音乐创作辅助工具,如自动生成翻唱版本、风格变换、音乐混搭等创意内容生产。对于内容平台,可用于基于用户偏好的个性化音乐推荐和定制化音频生成,通过参考现有歌曲生成具有特定风格的新版本。此外,该数据集还可用于音频质量评估和版权管理研究,通过配对数据检测和追踪AI生成音频的来源和变化,为内容审核和版权保护提供技术支持。在教育和娱乐领域,它能够支持音乐教学中的风格模仿练习和交互式音乐体验,丰富用户的参与感和创造力。
衍生相关工作
基于此数据集,衍生了一系列相关研究工作。例如,利用配对数据训练风格编码器和解码器,实现更精确的音乐风格迁移模型,提高生成音频的保真度和风格一致性。此外,该数据集还可用于开发音乐偏好预测模型,通过分析源歌曲和翻唱版本的差异,学习用户对风格变化的偏好,进而优化推荐系统。在安全性研究方面,研究者可基于此数据集探索AI生成音频的溯源和鉴别技术,提高对深度伪造音频的防御能力。同时,该数据集也促进了文本到音乐生成领域的发展,通过利用详细的歌词和风格描述,推动多模态生成模型的进步,为个性化音乐创作提供新的可能性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务