osu2beat2025
收藏资源简介:
osu2beat2025数据集是由卡内基梅隆大学研究者从Osu!社区节拍图提取的高质量节拍和重拍注释数据集。该数据集包含708首不同音频的741个注释,涵盖动画、Vocaloid和电子游戏音乐等不受传统数据集关注的类型。数据集通过社区驱动的方式不断更新,减少了个人偏见,并通过共识机制提高了注释质量,适用于音乐信息检索研究,特别是在节拍跟踪方面。
The osu2beat2025 dataset is a high-quality dataset of beat and downbeat annotations extracted from the beatmaps of the Osu! community by researchers at Carnegie Mellon University. It contains 741 annotations across 708 distinct audio tracks, covering genres such as anime, Vocaloid, and video game music, which are often overlooked by traditional datasets. The dataset is continuously updated in a community-driven manner, reducing individual biases and improving annotation quality through consensus mechanisms. It is suitable for music information retrieval (MIR) research, especially for beat tracking tasks.
Osu2MIR 数据集概述
数据集基本信息
- 数据集名称:Osu2MIR
- 研究背景:Beat Tracking Dataset Derived From Osu! Data (ISMIR2025 LBD)
- 论文链接:https://arxiv.org/abs/2509.12667
数据集内容
- 独立数据集:osu2beat2025_metered_beats.zip 包含计量节拍数据,涵盖 708 首独特音频的 741 个用户标注,命名格式为 MD5_BeatmapSetID_beats_metered.txt。
数据集构建步骤
- 下载谱面:使用 https://github.com/nzbasic/batch-beatmap-downloader 下载 .osz 文件(原始谱面文件),需筛选已排名谱面以确保质量。
- 数据分区:使用 data_partition.py 将 .osz 文件分组为:
- 单一非继承时间点
- 多个非继承时间点(间隔≥5秒)
- 多个非继承时间点(间隔<5秒)
- 子集1和子集2质量较高,子集3需谨慎使用。
- 转换为计量节拍:使用 data_conversion.py 将 .osz 文件转换为音频及对应的计量节拍标注(.txt 格式),用作节拍和强拍跟踪研究中的真实数据。
附加工具
- extract_uninherited_timing_points.py:提取非继承时间点(.json 格式)及对应音频。
- song_info_csv.py:提取谱面信息(标题、艺术家、创作者、标签、非继承时间点数量、MP3 时长)并汇总为 .csv 文件。
- self_track_madmom.py:用于运行 madmom 推理的管道(建议使用 GPU)。
- madmom_evaluation.py:用于比较 madmom 结果与用户标注的脚本。
数据表格
- .csv 文件为论文分析使用的原始表格:
- single:单一非继承时间点的歌曲
- geq5:多个非继承时间点(间隔≥5秒)的歌曲
- le5:多个非继承时间点(间隔<5秒)的歌曲
社区贡献
- 鼓励谱面创作者与 MIR 研究者共同开发工具以满足多样化需求。
- Discord:https://discord.gg/hYM3NkTzAW




