iamd_v0
收藏资源简介:
Internet Archive 音乐数据集(IAMD v0)是一个大规模、多用途的音乐数据集,包含约420万个30秒音乐片段,总时长约34,469小时。所有音频片段均来自 Internet Archive 上的 Creative Commons 授权音频,并配有机器生成的自然语言描述(caption)以及原始项目元数据。音频以 MP3 格式(320 kbps 恒定比特率,保持原始通道和采样率)存储,并嵌入在 Parquet 文件中,每个片段包含音频、描述和丰富的元数据字段(如艺术家、许可证类型、URL、标签、流派、乐器等,覆盖率各异)。数据集适用于音频分类、文本到音频生成、音频到文本翻译等任务。加载方式简单,使用 Hugging Face Datasets 库即可流式加载。注意:由于音频经过有损重新编码(87%来源为低比特率MP3),对于追求最高保真度的应用,建议使用源库。许可证方面,73%的片段使用非商业(NC)许可,商业使用需过滤掉包含 NC 的条目。此外,无反导数(-ND)的片段已被排除。
The Internet Archive Music Dataset (IAMD v0) is a large-scale, multi-purpose music dataset containing approximately 4.2 million 30-second music clips, totaling about 34,469 hours. All audio clips are sourced from Creative Commons-licensed audio on the Internet Archive, accompanied by machine-generated natural language captions and original project metadata. Audio is stored in MP3 format (320 kbps constant bitrate, preserving original channels and sample rate), embedded in Parquet files, with each clip containing audio, captions, and rich metadata fields (such as artist, license type, URL, tags, genre, instruments, etc., with varying coverage). The dataset is suitable for tasks such as audio classification, text-to-audio generation, and audio-to-text translation. It can be loaded easily via streaming using the Hugging Face Datasets library. Note: Due to lossy re-encoding (87% of sources are low-bitrate MP3), for applications requiring highest fidelity, the source library is recommended. Regarding licensing, 73% of clips use non-commercial (NC) licenses, and commercial use requires filtering out entries containing NC. Additionally, clips with the no-derivatives (-ND) restriction have been excluded.
Internet Archive Music Dataset (IAMD v0) 数据集详情
数据集概述
IAMD v0 是一个大规模音乐数据集,包含约 420万个 三十秒音乐片段(总计 34,469小时 音频),所有音频均来源于 Internet Archive 上的 Creative Commons 授权音频。每个片段都配有机器生成的自然语言描述文本以及原始条目的元数据信息。
基本规格
| 属性 | 数值 |
|---|---|
| 片段数量 | 4.2M |
| 音频总时长 | 34k 小时 |
| 片段长度 | 标称30秒(平均29.22秒) |
| 音频格式 | MP3, 320 kbps CBR,保留原始声道和采样率 |
| 数据分片 | 2,320 个 Parquet 文件 |
| 下载大小 | 4.53 TB |
数据结构
数据集采用标准 Parquet 格式,音频以 Audio 特征嵌入,每行包含:
- 音频数据:MP3 编码的音频字节和路径
- 描述文本:机器生成的音乐描述(
caption_tinymu) - 元数据:原始 Internet Archive 条目信息(如艺术家、许可证类型等)
每条记录的键为合成键(格式:iamd_<8位数字>),原始相对路径保存在 segment_path 字段中。
元数据字段覆盖情况
覆盖率为100%的字段(共22个):包括 identifier、tags、license_type、license_version、license_url、license_source、collection、mediatype、uploader、publicdate、review_count,以及 MTG 和 OpenMIC 的自动标注结果(如曲风、乐器、情绪等)。
部分覆盖的关键字段:
description:80.2%artist:75.9%creator:75.6%year_clean/date:61.1%year:19.5%language:9.6%album、genre、composer等其他字段覆盖率极低(<2%)
音频来源与编码说明
原始音频来源格式分布:
| 源格式 | 片段数 | 占比 |
|---|---|---|
| MP3 | 3.6M | 86.94% |
| WAV | 269k | 6.33% |
| FLAC | 233k | 5.48% |
| OGG | 38k | 0.89% |
| AIFF | 15k | 0.35% |
重要说明:本数据集所有片段均重编码为 320 kbps CBR MP3。其中 87% 的源文件本身已是低码率 MP3(平均约 224 kbps),经过两代有损编码;仅 12%(WAV/FLAC/AIFF)为从无损源单次编码。如需最高保真度,建议使用原始源语料库。
许可证信息
每个片段都带有自己的 Creative Commons 许可证,记录在 license_type 和 license_url 字段中:
| 许可证类型 | 片段数 | 占比 |
|---|---|---|
| CC BY-NC-SA | 2.7M | 63.87% |
| CC BY | 565k | 13.32% |
| CC BY-SA | 547k | 12.88% |
| CC BY-NC | 407k | 9.59% |
| CC0 1.0 | 14k | 0.33% |
使用限制:约 73% 的片段带有非商业(NC)限制,整个数据集不直接适用于商业用途,需要过滤后使用。NoDerivatives(*-ND)类别的条目已被排除。几乎所有片段都有署名(BY)要求,使用时需根据 artist、title 和 identifier 字段标注来源。




