遇见数据集

iamd_v0

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

Internet Archive 音乐数据集(IAMD v0)是一个大规模、多用途的音乐数据集,包含约420万个30秒音乐片段,总时长约34,469小时。所有音频片段均来自 Internet Archive 上的 Creative Commons 授权音频,并配有机器生成的自然语言描述(caption)以及原始项目元数据。音频以 MP3 格式(320 kbps 恒定比特率,保持原始通道和采样率)存储,并嵌入在 Parquet 文件中,每个片段包含音频、描述和丰富的元数据字段(如艺术家、许可证类型、URL、标签、流派、乐器等,覆盖率各异)。数据集适用于音频分类、文本到音频生成、音频到文本翻译等任务。加载方式简单,使用 Hugging Face Datasets 库即可流式加载。注意:由于音频经过有损重新编码(87%来源为低比特率MP3),对于追求最高保真度的应用,建议使用源库。许可证方面,73%的片段使用非商业(NC)许可,商业使用需过滤掉包含 NC 的条目。此外,无反导数(-ND)的片段已被排除。

The Internet Archive Music Dataset (IAMD v0) is a large-scale, multi-purpose music dataset containing approximately 4.2 million 30-second music clips, totaling about 34,469 hours. All audio clips are sourced from Creative Commons-licensed audio on the Internet Archive, accompanied by machine-generated natural language captions and original project metadata. Audio is stored in MP3 format (320 kbps constant bitrate, preserving original channels and sample rate), embedded in Parquet files, with each clip containing audio, captions, and rich metadata fields (such as artist, license type, URL, tags, genre, instruments, etc., with varying coverage). The dataset is suitable for tasks such as audio classification, text-to-audio generation, and audio-to-text translation. It can be loaded easily via streaming using the Hugging Face Datasets library. Note: Due to lossy re-encoding (87% of sources are low-bitrate MP3), for applications requiring highest fidelity, the source library is recommended. Regarding licensing, 73% of clips use non-commercial (NC) licenses, and commercial use requires filtering out entries containing NC. Additionally, clips with the no-derivatives (-ND) restriction have been excluded.

创建时间:
2026-07-28
原始信息汇总

Internet Archive Music Dataset (IAMD v0) 数据集详情

数据集概述

IAMD v0 是一个大规模音乐数据集,包含约 420万个 三十秒音乐片段(总计 34,469小时 音频),所有音频均来源于 Internet Archive 上的 Creative Commons 授权音频。每个片段都配有机器生成的自然语言描述文本以及原始条目的元数据信息。

基本规格

属性 数值
片段数量 4.2M
音频总时长 34k 小时
片段长度 标称30秒(平均29.22秒)
音频格式 MP3, 320 kbps CBR,保留原始声道和采样率
数据分片 2,320 个 Parquet 文件
下载大小 4.53 TB

数据结构

数据集采用标准 Parquet 格式,音频以 Audio 特征嵌入,每行包含:

  • 音频数据:MP3 编码的音频字节和路径
  • 描述文本:机器生成的音乐描述(caption_tinymu
  • 元数据:原始 Internet Archive 条目信息(如艺术家、许可证类型等)

每条记录的键为合成键(格式:iamd_<8位数字>),原始相对路径保存在 segment_path 字段中。

元数据字段覆盖情况

覆盖率为100%的字段(共22个):包括 identifiertagslicense_typelicense_versionlicense_urllicense_sourcecollectionmediatypeuploaderpublicdatereview_count,以及 MTG 和 OpenMIC 的自动标注结果(如曲风、乐器、情绪等)。

部分覆盖的关键字段

  • description:80.2%
  • artist:75.9%
  • creator:75.6%
  • year_clean / date:61.1%
  • year:19.5%
  • language:9.6%
  • albumgenrecomposer 等其他字段覆盖率极低(<2%)

音频来源与编码说明

原始音频来源格式分布:

源格式 片段数 占比
MP3 3.6M 86.94%
WAV 269k 6.33%
FLAC 233k 5.48%
OGG 38k 0.89%
AIFF 15k 0.35%

重要说明:本数据集所有片段均重编码为 320 kbps CBR MP3。其中 87% 的源文件本身已是低码率 MP3(平均约 224 kbps),经过两代有损编码;仅 12%(WAV/FLAC/AIFF)为从无损源单次编码。如需最高保真度,建议使用原始源语料库。

许可证信息

每个片段都带有自己的 Creative Commons 许可证,记录在 license_typelicense_url 字段中:

许可证类型 片段数 占比
CC BY-NC-SA 2.7M 63.87%
CC BY 565k 13.32%
CC BY-SA 547k 12.88%
CC BY-NC 407k 9.59%
CC0 1.0 14k 0.33%

使用限制:约 73% 的片段带有非商业(NC)限制,整个数据集不直接适用于商业用途,需要过滤后使用。NoDerivatives(*-ND)类别的条目已被排除。几乎所有片段都有署名(BY)要求,使用时需根据 artisttitleidentifier 字段标注来源。

搜集汇总
数据集介绍
iamd_v0 数据集图片
构建方式
互联网档案馆音乐数据集(IAMD v0)是基于互联网档案馆(Internet Archive)海量知识库中遵循知识共享许可的音频资源构建而成。构建流程涉及从多种音频格式(如MP3、WAV、FLAC、OGG及AIFF)中切取三十秒的音频片段,并统一重编码为320kbps恒定比特率的MP3格式,总计约420万条样本,对应34,469小时的音频内容。每个片段不仅保留了原始的音频数据,还附带了由机器自动生成的文本描述以及来自原始条目的元数据信息。数据集以Parquet文件格式存储,按分片组织,并将音频内容作为内嵌的Audio特征列,实现了无需额外处理即可直接加载的便捷性。
特点
该数据集的显著特点在于其规模庞大且来源多样,涵盖了约420万段三十秒的音频片段,总时长超3.4万小时,音频格式以MP3为主,占比近87%。数据集中的元数据极为丰富,包含音频标签、流派、乐器、情绪等自动标注信息,以及版权类型、上传者、发布日期等原始来源信息,覆盖率达到100%的字段有二十余项。尤为重要的是,所有音频均遵循知识共享许可协议,其中约73%的片段为非商业性使用许可,同时排除了禁止演绎的ND条款项目,确保了数据集的合法可再用性。此外,数据集的音频片段均配有自动生成的文本说明,为跨模态学习任务提供了天然的数据基础。
使用方法
使用该数据集极为便捷,其采用标准Parquet格式存储,音频以Audio特征内嵌于数据表中,无需特殊加载器或外部关联文件。用户可通过HuggingFace的datasets库直接加载,支持流式读取以节省内存。每条记录包含音频数组、采样率、文本描述及全部元数据,便于直接用于音频分类、文本到音频生成、音频字幕生成等任务。鉴于数据集中包含大量非商业许可的音频,研究者在使用时需根据license_type字段进行过滤,如筛选出允许商业使用的子集,并遵守相应的署名要求。数据集的这一结构设计,使得其能够灵活地适配多种机器学习工作流与科研场景。
背景与挑战
背景概述
Internet Archive Music Dataset (IAMD v0) 由 Telecom Paris 研究团队于近期构建,旨在应对大规模音乐理解与生成任务中高质量、多模态数据稀缺的挑战。该数据集从互联网档案馆(Internet Archive)的海量创作共用音频中提取了约420万个三十秒音乐片段,总时长超过34,000小时,每个片段均配有机器生成的自然语言描述及原始元数据。其核心研究问题在于如何利用自动化流程构建一个规模空前、覆盖多样音乐风格与场景的数据集,以支持音频分类、音乐描述生成及音频-文本跨模态任务。IAMD v0 的发布为音乐信息检索、多模态学习及生成式音频模型等领域提供了宝贵的基础资源,其规模与丰富性有望推动相关研究的范式革新。
当前挑战
该数据集面临多重挑战。领域层面,音乐理解需处理音频信号的复杂性、风格多样性及语义抽象性,而现有模型常受限于数据规模与标注质量;IAMD v0 通过海量数据与自动描述缓解了此瓶颈,但机器生成的描述可能缺乏细腻语义,影响模型泛化。构建层面,其面临显著技术难题:从互联网档案馆提取音频需处理格式多样(MP3、WAV、FLAC等)及编码质量差异,并因二次压缩引入信息损失;元数据覆盖不均衡(如艺术家覆盖仅75.9%,语言仅9.6%),且需严格遵循各片段独立的创作共用许可,尤其73%的片段为非商业性(NC)许可,限制了数据集的商业用途;此外,数据清洗与去重、键值合成及大规模存储(4.53TB)亦构成工程挑战。
常用场景
经典使用场景
Internet Archive Music Dataset (IAMD v0) 作为大规模音乐与自然语言配对语料库,其经典使用场景聚焦于音乐音频与文本描述之间的跨模态关联建模。该数据集提供约420万个30秒音乐片段,每段均附有机器生成的文本描述及原始元数据,为音频-文本检索、音乐字幕生成及多模态表示学习提供了丰富的数据基础。研究者可基于此开展音频与语义空间的映射研究,探索音乐信息与自然语言之间的深层对齐机制,推动音乐理解领域的发展。
实际应用
在实际应用层面,IAMD v0 可支撑音乐推荐系统的个性化内容理解,通过解析音频与文本关联提升用户交互体验;亦可赋能版权管理平台,借助元数据中的许可类型实现合规筛选,辅助自动化的版权审计与授权流程。此外,该数据集可用于开发音乐辅助创作工具,如根据文本描述生成或推荐音乐片段,助力内容创作者高效获取灵感,降低音乐制作门槛,推动创意产业的智能化转型。
衍生相关工作
IAMD v0 的出现催生了多项衍生研究,涵盖基于对比学习的音频-文本联合嵌入模型、时序注意力机制的音乐字幕生成网络,以及多任务学习框架的同时完成音频分类与字幕生成任务。后续工作亦探索了利用该数据集训练生成式模型,实现从文本描述到音乐片段的合成,并引入元数据辅助的细粒度音乐解析。这些衍生工作不仅验证了数据集的有效性,还推动了跨模态生成与理解技术的边界拓展,为音乐AI领域贡献了丰富的实证基础与创新思路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务