遇见数据集

jianpu-db

收藏
github2026-07-23 更新2026-07-23 收录
官方服务:

资源简介:

基于jianpu-ly语法和MusicBrainz唯一标识符构建的、面向大语言模型训练及严谨学术研究的高度规范化可读数字音乐简谱旋律数据集,旨在解决大语言模型面对简谱束手无措的痛点、填补网络上以简谱记载的旋律信息量不足、规范度不够的缺口。

Built upon the jianpu-ly syntax and MusicBrainz unique identifiers, this is a highly standardized, human-readable digital musical Jianpu melody dataset tailored for large language model (LLM) training and rigorous academic research. It aims to address the pain point that LLMs struggle with Jianpu notation, and fill the gap of insufficient information and inadequate standardization for melodies documented in Jianpu notation available on the internet.

创建时间:
2026-07-22
原始信息汇总

数据集概述:jianpu-db

简介

jianpu-db 是一个面向大语言模型训练及严谨学术研究的高度规范化可读数字音乐简谱旋律数据集。它基于 jianpu-ly 语法和 MusicBrainz 唯一标识符构建,旨在解决大语言模型处理简谱的痛点,并填补网络上以简谱记载的旋律信息量不足、规范度不够的缺口。

仓库结构

  • scores/:存放曲谱及其元数据的文件夹。
  • data.json:存储歌曲元数据的文件,由脚本将 score 文件夹中的元数据自动拼接生成。
  • tag_implication.json:标签间的蕴涵关系,如“东方星莲船”蕴涵“东方原曲”。
  • tag_equality.json:标签间的等同关系,如“东方星莲船”等同“th12”。
  • by_xxx:按不同属性(如曲名、标签等)寻找曲谱的文件夹(通过软链接)。
  • score.py:定义 Score 类的程序。
  • parse_score.py:自动规范化处理曲谱文件的脚本。

目前进度

数据集尚在基础架构开发中,以“东方原曲”系列为主要收录对象。进度显示大部分曲谱文件仍为空白(⬛),仅东方灵异传(th01)有少量文件标记为自动生成状态(☯️)。具体包含的东方系列作品如下:

  • 东方灵异传(th01)
  • 东方封魔录(th02)
  • 东方梦时空(th03)
  • 东方幻想乡(th04)
  • 东方怪绮谈(th05)
  • 东方红魔乡(th06)
  • 东方妖妖梦(th07)
  • 东方萃梦想(th075)
  • 东方永夜抄(th08)
  • 东方花映塚(th09)
  • 东方文花帖(th095)
  • 东方风神录(th10)
  • 东方绯想天(th105)
  • 东方地灵殿(th11)
  • 东方星莲船(th12)
  • 东方非想天则(th123)
  • 东方文花帖DS(th125)
  • 妖精大战争(th128)
  • 东方神灵庙(th13)
  • 东方心绮楼(th135)
  • 东方辉针城(th14)

目标与用途

该数据集旨在为大语言模型训练和学术研究提供规范化、可读的数字音乐简谱旋律数据,填补当前网络简谱数据在信息量和规范度上的不足。项目目前处于初期阶段,欢迎开发者与旋律转写者参与贡献。

搜集汇总
数据集介绍
jianpu-db 数据集图片
构建方式
jianpu-db是基于jianpu-ly语法与MusicBrainz唯一标识符构建的高度规范化数字音乐简谱旋律数据集。其构建流程包括曲谱文件的转写与元数据关联,曲谱以文本文件形式存储在scores文件夹中,每个文件对应一首旋律,文件名通过编码关联作品与曲目编号。元数据由脚本自动从各曲谱文件提取并拼接生成data.json,同时通过tag_implication.json和tag_equality.json定义标签间的蕴涵与等同关系,如“东方星莲船”蕴涵“东方原曲”或等同“th12”,从而形成层次化的组织体系。
特点
该数据集面向大语言模型训练与严谨学术研究,核心特点在于高度规范化的简谱表示与丰富的元数据关联。每一首旋律均采用jianpu-ly语法编码,确保机器可读性与可解析性。借助MusicBrainz标识符,数据集实现了与全球音乐数据库的互通,增强了曲目的可追溯性。标签系统通过蕴涵与等同关系构建语义网络,支持灵活的检索与分类。当前以东方Project原曲为主要内容,体现了数据集在特定音乐领域的深耕与系统化整理。
使用方法
用户可通过多种方式访问数据集。直接浏览scores文件夹获取曲谱原文,或通过by_title、by_tag等软链接目录按曲名或标签快速定位。data.json提供了完整的元数据索引,便于程序化查询。官方提供的score.py和parse_score.py脚本可用于解析与规范化处理曲谱。研究人员可将数据集成入大语言模型训练管道,利用jianpu-ly语法进行简谱旋律的生成与理解任务。当前项目仍在开发中,鼓励社区贡献曲谱转写与代码开发。
背景与挑战
背景概述
随着大语言模型在自然语言处理领域的突飞猛进,将其应用于音乐符号理解成为颇具潜力的探索方向。然而,简谱这一在东亚地区广泛使用的数字音乐记谱法,却因缺乏大规模、规范化的数据集而长期被模型研究忽视。jianpu-db数据集应运而生,由开发者基于jianpu-ly语法和MusicBrainz唯一标识符构建,旨在为简谱旋律的深度学习与严谨学术研究提供坚实的数据基石。该数据集聚焦于东方Project系列原曲,通过高度规范化的文本格式记录旋律,致力于填补网络上简谱旋律信息匮乏、格式杂乱的空白。自项目启动以来,其开放的架构与协作模式吸引了众多音乐信息检索与人工智能交叉领域研究者的关注。
当前挑战
jianpu-db数据集面临的核心挑战在于简谱数字表示的统一性与完整性问题。现有网络上简谱转录多存在节奏标记模糊、音高标注歧义等缺陷,难以直接用于大语言模型的预训练与微调。为此,数据集需依赖人工专家对自动生成的旋律进行逐条审核,过程费时费力,项目当前大部分曲谱仍处于待完善状态。此外,简谱在表达多声部、装饰音及复杂节奏型时天然受限,如何在不引入非简谱符号的前提下保留音乐表现力,是对数据规范设计的重要考验。构建过程中还需应对版权归属与元数据对齐的复杂性,确保每首曲谱与MusicBrainz标识符准确关联,这一系列障碍共同制约着数据集的规模化扩展与广泛应用。
常用场景
经典使用场景
在音乐信息检索(MIR)领域,jianpu-db作为首个面向大语言模型训练的高质量简谱旋律数据集,其最经典的使用场景是作为基准语料库,用于训练和评估大语言模型在简谱理解与生成任务上的性能。研究者可以将数据集中的简谱文本输入至各类语言模型架构中,促使模型学习简谱特有的符号系统、节奏模式与旋律走向,从而突破传统模型对五线谱或MIDI数据的依赖,为数字音乐简谱的自动解析、转写与创作提供标准化范本。
解决学术问题
该数据集解决了学术研究中两大痛点:一是网络上以简谱记载的旋律信息量不足且规范度欠缺,致使大规模简谱语料极度匮乏;二是大语言模型面对简谱符号系统时束手无措,缺乏可训练的高质量结构化数据。通过结合jianpu-ly语法与MusicBrainz唯一标识符,jianpu-db构建了一套高度规范化、可读性强的旋律编码体系,填补了简谱在自然语言处理与音乐智能交叉领域的空白,推动了符号音乐理解理论的纵深发展。
衍生相关工作
该数据集衍生了一批富有启发性的前沿工作。基于其语法规范,研究者探索了简谱到其他音乐表示形式的跨模态转换算法,如简谱至MIDI、简谱至音频的端到端生成模型;亦催生了面向简谱的情感标签分类器,用以分析旋律调式与情感之间的映射关系。此外,包含东方Project等海量二次创作曲谱的独特配置,还激发了针对亚文化音乐语料的专项风格迁移与自动编曲研究,拓展了计算音乐学的研究版图。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务