遇见数据集

JVS-nonpara-kana dataset

收藏
github2026-06-17 更新2026-06-24 收录
官方服务:

资源简介:

JVS-nonpara-kana数据集为JVS语料库的nonpara100子集提供片假名读音标注,用于G2P(字形到音素转换)评估。该数据集包含3,000个话语的手动标注片假名读音,以CSV文件格式提供,并附带CER(字符错误率)评估脚本。数据集基于JVS语料库衍生,采用CC BY-SA 4.0许可。

The JVS-nonpara-kana dataset provides katakana phonetic annotations for the nonpara100 subset of the JVS corpus, tailored for G2P (grapheme-to-phoneme conversion) evaluation. This dataset includes manually annotated katakana pronunciations of 3,000 utterances, distributed in CSV file format together with a CER (Character Error Rate) evaluation script. Derived from the JVS corpus, the dataset is released under the CC BY-SA 4.0 license.

创建时间:
2026-06-17
原始信息汇总

数据集概述

名称:JVS-nonpara-kana dataset

来源:基于 JVS corpus 中 nonpara100 子集构建。

关联论文:Tomoki Koriyama, "Benchmarking Large Language Models for Grapheme-to-Phoneme Conversion: A Japanese Case Study," Proc. Interspeech 2026 (已接收)。

数据规模:包含 nonpara100 子集中全部 3000 条语音对应的文本。

注释内容

注释文件为 jvs_nonpara_kana.csv,包含人工标注的片假名读音。字段说明如下:

字段名 说明
1 base 文件名基名(例如 jvs001_BASIC5000_0025
2 text 原始日语文本
3 kana 片假名读音标注

示例:

base,text,kana jvs001_BASIC5000_0025,テニスにもあるけど、4大大会って何。,テニスニモアルケド、ヨンダイタイカイッテナニ

评估工具

eval_cer.py 用于计算预测片假名读音相对于 jvs_nonpara_kana.csv 的字符错误率(CER)。评分前会将长音符号(ー)展开为对应元音,以避免因正字法变体带来的惩罚。

  • 运行要求:Python 3.12 或更高版本。

  • 安装依赖: bash pip install -r requirements.txt

  • 输入格式:每个语音的预测结果存放为一个 .txt 文件,文件名为对应的基名(如 jvs001_BASIC5000_0025.txt),第一行为预测的片假名读音。所有文件放在同一目录下。

  • 使用方式: bash python eval_cer.py --label_dir /path/to/label --out_file /path/to/cer.json

  • 输出示例(同时输出到标准输出和指定文件): json { "cer": 0.0123, "num_chars": 45678 }

许可协议

  • jvs_nonpara_kana.csv:衍生自 JVS 语料库,采用 CC BY-SA 4.0 许可证。详见 LICENSE 文件。
  • eval_cer.py:采用 MIT 许可证。
搜集汇总
数据集介绍
JVS-nonpara-kana dataset 数据集图片
构建方式
JVS-nonpara-kana数据集聚焦于日语语音识别与转换任务,源自JVS语料库中的nonpara100子集。该数据集的构建核心在于对nonpara100中全部3000条语句进行了人工标注,为每条原始日文文本提供了对应的片假名读音标注。标注结果以CSV格式存储,包含文件基名、原始文本和片假名读音三列,确保数据结构的简洁与清晰。此外,数据集还配套提供了一个字符错误率评估脚本,用于验证和对比模型生成的片假名读音与人工标注的一致性。
特点
该数据集最显著的特点是其高质量的人工标注,所有3000条语句的片假名注释均经过严格校准,为日文文本到音素转换任务提供了可靠的基准。同时,数据集在CER评估中引入了长音符号预处理机制,将长音符号展开为对应元音后再进行评分,有效避免了因拼写变体导致的误差偏移。数据集与CSV文件一同发布,易于直接加载和解析,而评估脚本则支持批量处理预测结果,极大便利了研究者的评测流程。
使用方法
使用该数据集时,研究者可首先加载jvs_nonpara_kana.csv文件,通过base、text和kana三列获取对应的片假名读音标注。对于模型预测结果,需按每条语句一个独立txt文件的形式组织,每个文件首行存放预测的片假名字符串。随后运行eval_cer.py脚本,通过--label_dir参数指定预测文件目录,--out_file参数指定输出JSON结果路径,脚本将自动计算并输出全局CER与总字符数。该流程简化了从数据加载到性能评估的完整链路,便于快速迭代模型。
背景与挑战
背景概述
在日语的语音合成与自然语言处理研究中,字形到音素(G2P)转换是构建高质量语音系统的关键环节。然而,日语文本中复杂的汉字、假名混写以及长音、促音等特殊标记常使自动读音预测充满歧义。为攻克这一难题,研究者Tomoki Koriyama于2026年基于JVS语料库中nonpara100子集构建了JVS-nonpara-kana数据集,该数据集共包含3000条语音对应的日语文本及其人工标注的片假名读音,旨在为大规模语言模型在日语G2P转换任务上的性能评估提供标准化基准。该数据集不仅填补了日语读音标注资源的稀缺,还通过提供字符错误率(CER)评估脚本,简化了不同模型的对比流程,对推动日语G2P领域的研究具有里程碑意义。
当前挑战
该数据集面临的核心挑战源于日语G2P转换本身的高度复杂性。领域层面,日语中多音字、连浊、促音、长音等音变现象使字形到音素的映射并非一一对应,例如长音符号“—”在读音中常需扩展为对应元音,而现有模型往往难以精准处理此类细微差异,导致发音预测错误频发。构建过程中,人工标注3000条语音的片假名读音需耗费大量语言学专业知识,逐字确认汉字读音、避免长音标记歧义等细节对标注者提出了极高要求,且需严格遵循标注规范以保证数据一致性。此外,评估阶段长音展开策略的设计亦构成挑战,需在避免惩罚正确变体与维持评分公平性之间取得平衡,这一权衡直接影响了基准测试的可靠性。
常用场景
经典使用场景
在现代语音合成与日语自然语言处理研究中,字符级与音素级表示的精准对齐是提升系统自然度的关键。JVS-nonpara-kana数据集聚焦于日语非并行语音语料库nonpara100子集,提供了3000条语音对应的片假名读音标注。最经典的使用场景在于作为字素到音素(G2P)转换任务的基准评估集,研究者可基于此数据集训练和评价从日文文本到标准片假名读音的映射模型,从而有效检验模型在日语长音、促音、拗音等复杂音韵现象上的转换精度。
解决学术问题
日语G2P转换长期以来面临长音符号处理歧义、多音字消歧以及外来语读音标准化等学术难题。该数据集通过人工精细标注的片假名读音,为系统化评估提供了可靠的真值参照。其核心贡献在于提供了一个统一、公开的评估框架,借助配套的CER计算脚本(扩展长音符号后评分)来消除拼写变体对评测结果的影响,从而客观比较不同模型在日语读音预测上的表现,推动了G2P任务在日语领域的标准化与可比性研究。
衍生相关工作
基于该数据集,衍生了一系列围绕日语G2P任务的经典研究工作。其首次被用于Koriyama等人在Interspeech 2026上发表的基准研究中,系统评估了多种大型语言模型在日语字素到音素转换上的表现,揭示了模型在处理长音、促音等日语特有音韵规则时的优劣。后续研究进一步将此数据集与序列到序列模型、基于Transformer的预训练语言模型结合,探索端到端的读音预测方法,并衍生出针对低资源语音合成场景的跨说话人读音迁移任务及联合训练范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务