遇见数据集

engels/spotify-tracks-lite

收藏
Hugging Face2024-05-13 更新2024-06-12 收录
官方服务:

资源简介:

该数据集包含来自30种不同音乐风格的24000首曲目,是从maharshipandya/spotify-tracks-dataset数据集中精简和清理后的版本。所有数据均来自Spotify API,并且是开源的。该数据集可用于训练基于用户偏好的预测模型,或根据相应的启发式方法对曲目进行分类。

该数据集包含来自30种不同音乐风格的24000首曲目,是从maharshipandya/spotify-tracks-dataset数据集中精简和清理后的版本。所有数据均来自Spotify API,并且是开源的。该数据集可用于训练基于用户偏好的预测模型,或根据相应的启发式方法对曲目进行分类。

提供机构:
engels
原始信息汇总

数据集概述

基本信息

  • 许可证: BSD
  • 数据集大小: 10K<n<100K
  • 标签: music, spotify

数据内容

  • 数据集描述: 包含24000首来自30种不同音乐风格的曲目,是对原始数据集maharshipandya/spotify-tracks-dataset的缩减版本。所有非启发式数据已经过裁剪和清洗,以提高可用性和性能。
  • 数据来源: 来自Spotify API,数据为开源。
  • 应用场景: 可用于训练基于用户偏好的预测模型,或根据相应的启发式方法对曲目进行分类。

列描述

  • danceability: 描述曲目适合跳舞的程度,0.0为最不适合,1.0为最适合。
  • energy: 从0.0到1.0的感知强度和活动度量。
  • key: 曲目所在的音调,整数映射到标准音调类表示。
  • loudness: 曲目的整体响度,单位为分贝(dB)。
  • speechiness: 检测曲目中存在的语音。
  • acousticness: 曲目为原声的置信度,从0.0到1.0。
  • instrumentalness: 预测曲目是否包含无人声。
  • liveness: 检测录音中观众的在场情况。
  • valence: 描述曲目传达的音乐积极性,从0.0到1.0。
  • tempo: 曲目的估计整体速度,单位为每分钟节拍(BPM)。
  • track_genre: 曲目所属的音乐风格。
搜集汇总
数据集介绍
engels/spotify-tracks-lite 数据集图片
构建方式
在音乐信息检索与推荐系统的研究领域,高质量、结构化的音乐特征数据集是构建预测模型与分类器的基础。engels/spotify-tracks-lite 数据集源于 maharshipandya/spotify-tracks-dataset 的缩减版本,后者所有数据均通过 Spotify API 采集并遵循开源协议。构建过程中,研究者从原始数据集中筛选出 30 个音乐流派的 24000 首曲目,通过剔除所有非启发式字段并进行数据清洗,显著提升了数据的一致性与可用性。最终保留的字段涵盖舞曲性、能量、调性、响度、语音性、 acousticness、器乐性、现场感、情感价、速度及流派标签,为后续建模提供了精炼而全面的特征集。
特点
该数据集的核心特点在于其平衡的规模与高质量的特征工程。相较于原始数据集,缩减版本在保持流派多样性的同时,大幅降低了冗余与噪声,使得 10K 至 100K 的样本量更适用于中等规模模型的训练与验证。每个特征均源自 Spotify API 的标准化计算,例如 danceability 综合节奏与节奏稳定性进行量化,energy 反映感知强度,而 valence 则捕捉音乐的情感极性。这种多维度的特征设计,使得数据集既能用于基于用户偏好的预测任务,也可支撑基于启发式规则的曲目分类研究,兼具实用性与可解释性。
使用方法
该数据集的使用方式灵活且面向典型机器学习流程。研究者可直接加载 CSV 格式数据,利用 track_genre 作为目标变量进行监督学习,例如构建音乐流派分类器;亦可基于 danceability、valence 等连续特征进行用户偏好预测或回归分析。在预处理阶段,建议对 loudness 等数值特征进行标准化,并处理 key 字段中的缺失值(-1)。对于无监督学习任务,可运用 PCA 或 t-SNE 对高维特征空间进行降维可视化,探索不同流派在声学空间中的分布规律。此外,该数据集亦可作为迁移学习的基准,或与其他音乐元数据结合进行多模态研究。
背景与挑战
背景概述
在音乐信息检索与推荐系统领域,基于用户偏好的预测模型构建一直是研究热点。engels/spotify-tracks-lite数据集由研究人员于近期创建,源自maharshipandya/spotify-tracks-dataset的精简版本,旨在提供更高效、更清洁的数据基础。该数据集包含24,000首曲目,横跨30种音乐流派,所有数据均通过Spotify API采集并开源。其核心研究问题聚焦于利用音频特征(如舞蹈性、能量、声学度等)对曲目进行流派分类或用户偏好预测,为音乐推荐算法、情感计算及音乐心理学分析提供了标准化基准。该数据集因其规模适中、特征丰富且去除了启发式噪声,在音乐数据挖掘社区中具有重要影响力,尤其适用于快速原型验证与教学场景。
当前挑战
该数据集所解决的领域问题在于音乐流派分类与推荐系统的特征工程挑战。传统方法依赖人工标注或稀疏标签,而此数据集通过12维音频特征(如节奏稳定性、语音占比、乐器性等)实现了量化表征,但特征间的多维关联性(如能量与响度的非线性关系)仍是模型泛化的难点。构建过程中,挑战主要源于数据清洗:原始数据集包含大量非启发式噪声(如重复条目、异常值),需通过统计过滤与归一化处理确保一致性;此外,Spotify API的实时性约束导致部分曲目元数据(如调性检测缺失)需通过插值策略补偿,这对保持跨流派样本平衡提出了更高要求。
常用场景
经典使用场景
engels/spotify-tracks-lite 数据集汇聚了来自30种音乐流派的24,000首曲目,基于Spotify API提供的丰富音频特征构建而成。其最经典的使用场景在于音乐信息检索领域,研究者可借助舞蹈性、能量值、声学度、乐器性、活跃度、效价等多元特征,构建分类或回归模型,实现对音乐流派的自动识别与预测。该数据集精简了原始版本中的非启发式数据,提升了模型的训练效率与性能,为音乐特征分析提供了高质量的基础资源。
衍生相关工作
围绕该数据集衍生了多项经典工作,包括基于深度神经网络的音乐流派分类模型,如采用卷积神经网络对音频特征谱进行端到端学习;以及结合协同过滤与特征工程的混合推荐系统,显著提升了冷启动场景下的推荐准确率。此外,研究者还利用该数据集验证了情感计算中的效价-能量双维度模型,并开发了可视化音乐地图工具,用于探索流派间的特征空间分布关系。
数据集最近研究
最新研究方向
在音乐信息检索与推荐系统的前沿探索中,engels/spotify-tracks-lite数据集凭借其精简而高质量的结构化特征,正成为构建基于用户偏好的预测模型与自动化音乐分类算法的关键资源。该数据集涵盖30种音乐流派、24,000条曲目的音频属性,如可舞性、能量、声学度与效价等,为深度学习与统计建模提供了稳定的输入空间。当前研究热点聚焦于利用这些多维声学特征实现细粒度的情感识别与流派边界模糊化分析,尤其是在流媒体平台个性化推荐与音乐治疗应用中的交叉融合。随着Spotify API数据在学术界的广泛采用,该数据集不仅支撑了可解释性音乐理解模型的开发,也推动了跨文化音乐特征对比与实时用户反馈闭环的构建,对音乐产业的数据驱动转型具有实质性影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务