遇见数据集

lekdan/osu-everything-tools

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

osu-everything数据集包含用于维护紧凑v1 osu!数据集的源工具和运行手册。数据集存储了原始.osz存档和紧凑的Parquet格式元数据,不发布提取的blob、清单、训练/测试分割或全局blob注册表。数据集还包含用于机器学习的派生特征存储。数据加载可以通过PyArrow进行,更新流程包括克隆或更新源代码、构建工具、配置本地osu!凭证以及运行更新脚本。数据集中的beatmaps经常包含受版权保护的歌曲、背景、视频和故事板资源,因此在没有适当权利的情况下不应公开分享。

The `osu-everything` dataset contains the source tools and runbooks for maintaining the compact v1 osu! dataset. It stores raw `.osz` archives and compact Parquet metadata, and does not publish extracted blobs, manifests, train/test splits, or a global blob registry. The dataset also includes a derived ML feature store. Data can be loaded using PyArrow, and the update process involves cloning or updating the source code, building tools, configuring local osu! credentials, and running update scripts. Beatmaps in the dataset frequently include copyrighted songs, backgrounds, videos, and storyboard assets, so the dataset should not be shared publicly without the appropriate rights.

提供机构:
lekdan
搜集汇总
数据集介绍
lekdan/osu-everything-tools 数据集图片
构建方式
该数据集基于osu!社区的海量谱面资源构建,通过一套完整且高度自动化的工具链实现数据的高效整合与维护。其设计遵循数据与代码解耦的哲学,数据集主体存储于分布式存储桶中,而源代码则独立于Git仓库管理。工作目录划分为源码、数据集状态与衍生特征存储三部分,运行时通过环境变量灵活配置路径。构建过程包含元数据抓取、压缩归档、Parquet格式的紧凑元数据生成及增量更新,所有操作通过脚本封装,支持并发下载与自动发布。
特点
数据集最显著的特点在于其分层结构与多模态特性。原始音频、图像、视频及谱面文本保留在原始.osz压缩包内,而元数据则以列式Parquet格式独立存储于'data/v1/'前缀下,兼顾了访问效率与存储紧凑性。'latest'视图基于全量更新历史快照生成,专为机器学习工作流优化。此外,数据集还包含独立的特征存储区(features/v1/),用于存放衍生特征,其模式与文档内嵌于特征子目录,支持独立同步。
使用方法
使用者可通过hf sync命令按需同步指定前缀的数据,例如仅同步最新谱面元数据,从而避免不必要的带宽消耗。加载时使用PyArrow的dataset接口直接读取本地Parquet文件,支持将数据高效转换为表格以供分析或模型训练。对于原始媒体资源,需通过元数据行中记录的归档路径与成员路径从.osz文件中提取。衍生特征的加载方式与元数据一致,均基于Parquet格式与相同的API调用,确保使用体验的统一与便捷。
背景与挑战
背景概述
osu-everything-tools数据集由研究者lekdan主导开发,创建于2024年,旨在为osu!节奏游戏社区构建一个结构化的多模态数据集。该数据集整合了游戏中丰富的谱面元数据、故事版、音频及图像资源,解决了长期以来该领域缺乏标准化、可复现的数据存储与访问方案的问题。通过采用紧凑的Parquet格式与分层工作空间设计,osu-everything为音乐游戏领域的机器学习研究、内容分析及工具开发提供了重要基础设施,其影响力延伸至多模态学习与游戏用户体验优化等前沿方向。
当前挑战
数据集面临的核心挑战包括:领域问题层面,节奏游戏谱面包含复杂的时序与多模态交互特征,现有模型难以高效学习音乐与视觉元素的动态关联;构建过程层面,原始.osz归档内部结构异构且包含大量版权音乐素材,必须在提取元数据时严格遵循osu!谱面许可协议,避免法律风险。此外,千万级谱面的增量更新需要处理并发下载、数据去重及版本一致性维护,而基于特征的ML特征存储与元数据规约的分离设计,进一步增加了数据管线的维护复杂度。
常用场景
经典使用场景
在节奏游戏与多模态学习交叉的研究领域中,osu-everything数据集凭借其精良的结构化设计,成为分析游戏谱面(beatmaps)与用户交互行为之间关联的经典资源。研究者可借助其紧凑的Parquet元数据表格,高效加载谱面特征、音效索引及视觉组件路径,从而构建预测玩家表现或谱面难度的模型。该数据集尤其适用于需要整合音频、图像、文本(.osu文件)与用户反馈的跨模态学习任务,为理解游戏内的实时决策过程提供了标准化基准。其分层的bucket布局允许按需同步数据子集,极大降低了大规模多模态实验的存储与计算开销。
实际应用
在实际应用中,osu-everything为游戏辅助工具与个性化推荐系统提供了坚实的数据基础。开发者可基于谱面元数据和玩家历史表现,构建智能难度调节引擎,动态优化游戏体验。教育培训领域可将其用于认知反应训练方案的设计,利用真实谱面数据生成定制化挑战。此外,音乐产业可利用该数据集的音频索引特性,研究节奏与视觉元素结合对用户沉浸感的影响,辅助多媒体内容创作。其特征存储区(features/v1)还支持实时计算流水线,适配游戏内A/B测试或内容审核系统的部署需求。
衍生相关工作
基于osu-everything数据架构的衍生工作已催生多项创新性工具与基准。例如,谱面特征提取管线(osu_feature_pipeline)衍生出了针对节奏游戏的时间序列分析库,用于检测模式规律与玩家适应策略。研究者利用其音频-元数据对齐能力,开发了面向弱监督学习的谱面段落分割方法。此外,该数据集的分层索引模式启发了针对其他资源密集型游戏(如《吉他英雄》或《太鼓达人》)的多模态数据集构建方法论,推动了游戏AI与内容生成领域的交叉验证,并成为评估谱面生成模型质量的标准测试平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务