遇见数据集

TTS-AGI/LAION-DISCO-12M

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

LAION-DISCO-12M数据集包含1200万条指向YouTube音乐的链接,灵感来源于DISCO-10M的方法论。该数据集包含歌曲元数据(如歌曲ID、标题、艺术家名称、艺术家ID、专辑名称、专辑ID、是否包含明确内容、观看次数、时长)和YouTube URL,指向公共网络上的原始歌曲。它不包含任何原始音频样本,因此是一个索引数据集。从初始的艺术家种子列表开始,通过递归探索“粉丝可能也喜欢”部分,可以发现新艺术家。我们尽可能长时间地探索相关艺术家图谱,以找到新艺术家。对于给定艺术家,可以提取其元数据,如名称和订阅者数量,以及所有歌曲和音乐视频列表。重要的是,每首歌曲或音乐视频都与一个YouTube URL(从其ID获得)相关联。收集的元数据字段包括:song_id、title、artist_names、artist_ids、album_name、album_id、isExplicit、views、duration。DISCO-10M的作者使用了18位艺术家的种子列表,以代表多种流派。但我们发现这对于探索YouTube音乐的艺术家图谱不够充分。从这个种子列表开始,我们仅发现了90,007位艺术家和5,399,389首歌曲。因此,我们通过考虑出现在YouTube音乐国家热门歌曲排行榜和流派播放列表中的艺术家,编制了一个更大的种子列表。这产生了45,218位艺术家的初始列表。从这个种子列表开始的艺术家图谱探索,最终得到了250,516位艺术家和12,648,485首歌曲。这项工作受到DISCO-10M的启发,如果您使用此数据集,请考虑引用他们。

The LAION-DISCO-12M dataset contains 12 million links to YouTube Music, inspired by the methodology of DISCO-10M. This dataset includes song metadata (such as song ID, title, artist name, artist ID, album name, album ID, explicit content indicator, view count, duration) and YouTube URLs pointing to the original songs on the public web. It does not contain any raw audio samples, thus functioning as an indexing dataset. Starting from an initial list of artist seeds, new artists can be discovered by recursively exploring the "Fans also like" section. We explore the associated artist graph for as long as possible to identify new artists. For a given artist, their metadata such as name and subscriber count can be extracted, alongside a full list of their songs and music videos. Importantly, each song or music video is associated with a YouTube URL derived from its unique ID. The collected metadata fields include: song_id, title, artist_names, artist_ids, album_name, album_id, isExplicit, views, duration. The authors of DISCO-10M utilized a seed list of 18 artists to represent a diverse range of music genres. However, we found this list insufficient for exploring the artist graph of YouTube Music. Starting from this seed list, we only discovered 90,007 artists and 5,399,389 songs. Therefore, we compiled a larger seed list by incorporating artists featured on YouTube Music's national top song charts and genre playlists. This resulted in an initial list of 45,218 artists. Artist graph exploration initiated from this expanded seed list ultimately yielded 250,516 artists and 12,648,485 songs. This work was inspired by DISCO-10M; if you use this dataset, please consider citing their work.

提供机构:
TTS-AGI
搜集汇总
数据集介绍
TTS-AGI/LAION-DISCO-12M 数据集图片
构建方式
LAION-DISCO-12M数据集参考了DISCO-10M的方法论,旨在为音乐信息检索领域提供一个大规模的音乐索引资源。其构建从初始艺术家种子列表出发,通过递归探索YouTube Music中“粉丝可能也喜欢”的板块来发现新艺术家,不断扩展艺术家关联图谱。初始种子列表仅包含18位跨流派的艺术家,但扩展效果有限,仅挖掘出约9万位艺术家和540万首歌曲。为此,研究团队重新编制了更全面的种子列表,整合了YouTube Music按国家和流派排行的热门歌曲榜单中的艺术家,最终得到45,218位艺术家作为起点。通过这一扩展的种子列表,图谱探索最终涵盖了250,516位艺术家和12,648,485首歌曲,从而形成了包含约1200万个YouTube音乐视频链接的数据集。
特点
该数据集的核心特点在于其作为索引数据集的定位,不包含任何原始音频样本,而是提供12M条指向YouTube上音乐视频的链接以及丰富的元数据。每条记录均包含song_id、标题、艺术家名称与ID、专辑名称与ID、是否露骨内容、播放次数和时长等信息,并通过YouTube视频ID确保可回溯至原始内容。数据集的构建遵循了从艺术家图谱递归探索的机制,显著扩大了种子列表的规模和多样性,使其覆盖了更多流派和地域的音乐作品。此外,数据集采用Apache-2.0许可证开放,方便学术与工业界使用,并明确标注受DISCO-10M启发的引用要求。
使用方法
用户可直接通过HuggingFace Datasets库加载该数据集,指定配置名为'default'并选择训练集切分,即可获取包含约1232万条记录的数据表。每条记录以字典形式组织,字段包括字符串类型的song_id、标题、艺术家名称列表和ID列表、专辑名称与ID、布尔型露骨标识、字符串型播放次数以及整型时长(单位秒)。在此基础上,研究者可根据YouTube URL链接获取原始音视频进行下游任务,如音乐分类、相似性检索或艺术家推荐。若需处理子集,可通过分片路径(data/train-*)按需读取,并利用元数据字段进行过滤或统计分析。
背景与挑战
背景概述
LAION-DISCO-12M是一个大规模音乐索引数据集,由LAION社区于近期创建,其构建灵感源自DISCO-10M的数据收集方法论。该数据集旨在通过YouTube平台,建立涵盖丰富音乐元数据的索引体系,包括歌曲标识、标题、艺术家信息、专辑详情、播放量及时长等关键字段,不包含原始音频样本。核心研究问题聚焦于如何基于艺术家关联图谱,实现音乐数据的规模化发现与扩展。通过从精心挑选的初始艺术家种子列表出发,递归探索“粉丝可能也喜欢”的推荐关系,研究者成功将艺术家发现范围从最初的4.5万余名扩展至超过25万名,收录近1265万首歌曲,显著提升了音乐数据的覆盖广度与多样性,对音乐信息检索、推荐系统及多模态学习等领域具有重要推动作用。
当前挑战
数据集面临的挑战主要涵盖两方面。首先,在领域问题层面,音乐数据的稀疏性与长尾分布使得基于艺术家图谱的挖掘效率受限,仅依赖小规模种子列表难以突破发现瓶颈,需借助区域与流派音乐排行榜构建更全面的初始集合。其次,在构建过程中,如何高效爬取并验证YouTube音乐元数据的完整性与时效性构成技术难点,需应对平台接口限制、数据一致性维护及大规模去重等问题。此外,数据集仅提供元数据索引,原始音频的版权与获取问题成为下游任务应用的潜在障碍,用户需自行处理音频数据的合法获取与对齐,这增加了实际使用的复杂度。
常用场景
经典使用场景
LAION-DISCO-12M数据集作为音乐信息检索领域的里程碑式资源,其最经典的使用场景在于构建和训练大规模音乐理解模型。研究者可利用其中包含的1200万首歌曲的元数据(如标题、艺术家、专辑、播放量、时长等)与对应的YouTube链接,开展多模态音乐表征学习。该数据集尤其适用于音乐分类任务,例如流派分类、情绪识别或乐器检测,同时也为音乐推荐系统提供训练基础,通过分析艺术家图谱和用户观看行为,实现对音乐品味和传播规律的深层挖掘。
衍生相关工作
LAION-DISCO-12M的前身是DISCO-10M数据集,后者通过从18个初始艺术家展开图谱探索,开创了基于YouTube Music的艺术家递归发现方法。LAION-DISCO-12M在此基础上增大种子列表至45,218个,使艺术家和歌曲数量分别提升约1.8倍和2.3倍,验证了大规模种子列表对图谱探索效率的关键影响。该数据集衍生出诸如音乐表征学习(如CLAP模型训练)、跨模态检索及音乐生成等研究方向,后续工作可借鉴其元数据字段和构建范式,推动音乐AI领域的持续创新。
数据集最近研究
最新研究方向
LAION-DISCO-12M数据集的最新研究聚焦于大规模音乐信息检索与多模态学习的前沿探索。该数据集通过递归遍历YouTube Music艺术家关联图谱,从初始种子列表扩展至逾25万艺术家与1260万条歌曲元数据,构建了迄今规模最大的开源音乐索引资源。这一突破性方法有效弥合了传统音乐数据集在文化多样性与地域覆盖上的局限,为跨语言音乐表征学习、多模态对齐分析及音乐推荐系统优化提供了关键基准。尤其在当前生成式AI与版权治理的热点议题下,该数据集通过非侵入式元数据采集策略,为平衡数据规模与伦理合规树立了新范式,有望推动音乐智能体在鲁棒性、泛化性及公平性评估上的实质性跃进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务