JVS-nonpara-kana dataset
收藏资源简介:
JVS-nonpara-kana数据集为JVS语料库的nonpara100子集提供片假名读音标注,用于G2P(字形到音素转换)评估。该数据集包含3,000个话语的手动标注片假名读音,以CSV文件格式提供,并附带CER(字符错误率)评估脚本。数据集基于JVS语料库衍生,采用CC BY-SA 4.0许可。
The JVS-nonpara-kana dataset provides katakana phonetic annotations for the nonpara100 subset of the JVS corpus, tailored for G2P (grapheme-to-phoneme conversion) evaluation. This dataset includes manually annotated katakana pronunciations of 3,000 utterances, distributed in CSV file format together with a CER (Character Error Rate) evaluation script. Derived from the JVS corpus, the dataset is released under the CC BY-SA 4.0 license.
数据集概述
名称:JVS-nonpara-kana dataset
来源:基于 JVS corpus 中 nonpara100 子集构建。
关联论文:Tomoki Koriyama, "Benchmarking Large Language Models for Grapheme-to-Phoneme Conversion: A Japanese Case Study," Proc. Interspeech 2026 (已接收)。
数据规模:包含 nonpara100 子集中全部 3000 条语音对应的文本。
注释内容
注释文件为 jvs_nonpara_kana.csv,包含人工标注的片假名读音。字段说明如下:
| 列 | 字段名 | 说明 |
|---|---|---|
| 1 | base |
文件名基名(例如 jvs001_BASIC5000_0025) |
| 2 | text |
原始日语文本 |
| 3 | kana |
片假名读音标注 |
示例:
base,text,kana jvs001_BASIC5000_0025,テニスにもあるけど、4大大会って何。,テニスニモアルケド、ヨンダイタイカイッテナニ
评估工具
eval_cer.py 用于计算预测片假名读音相对于 jvs_nonpara_kana.csv 的字符错误率(CER)。评分前会将长音符号(ー)展开为对应元音,以避免因正字法变体带来的惩罚。
-
运行要求:Python 3.12 或更高版本。
-
安装依赖: bash pip install -r requirements.txt
-
输入格式:每个语音的预测结果存放为一个
.txt文件,文件名为对应的基名(如jvs001_BASIC5000_0025.txt),第一行为预测的片假名读音。所有文件放在同一目录下。 -
使用方式: bash python eval_cer.py --label_dir /path/to/label --out_file /path/to/cer.json
-
输出示例(同时输出到标准输出和指定文件): json { "cer": 0.0123, "num_chars": 45678 }
许可协议
jvs_nonpara_kana.csv:衍生自 JVS 语料库,采用 CC BY-SA 4.0 许可证。详见LICENSE文件。eval_cer.py:采用 MIT 许可证。




