遇见数据集

joyo-kanji-yomi-benchmark-parakeet

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

Joyo Kanji Yomi Benchmark: Parakeet Edition(JKYB-Parakeet)是一个用于评估日语汉字读音正确性的基准数据集,专注于G2P(字形到音素)模型、形态分析器和TTS(文本到语音)系统在日语句子中正确读取汉字的能力。该数据集基于SB Intuitions的原始JKYB数据集,由Parakeet Inc.独立审查、修正错误、统一标注并新增数据。数据内容涵盖日本文化厅常用汉字表本表中所有汉字-读音对,以及付表中所有词-读音对,每个读音提供3个例句。每个句子包含详细的标注:目标汉字及其读音(片假名表示)、读音分类(音读、训读或付表读音)、其他自然读音(若存在)以及可接受的边缘读音(字典上无误但通常不自然)。目标汉字在句子中用尖括号<>标记,便于精确评估。数据集规模:汉字-读音对4,512个,总句子数13,536个(4,512×3)。其中音读句子7,056个,训读句子6,108个,付表读音句子372个,具有多个自然读音的句子75个,具有边缘读音的句子55个。数据文件格式为JSONL,包含key、text、tagged_text、yomi、tagged_yomi、reading_category、readings(natural和marginal列表)以及source字段。该数据集适用于以下任务:1) G2P、形态分析或读音预测(将输入文本转换为片假名读音序列);2) TTS(从文本生成语音)。推荐使用官方提供的评估工具包进行评测。相较于原始JKYB,本数据集进行了多项修正和增强:修正了原始数据中的不自然例句、错误读音、汉字使用不当和重复;对目标读音存在歧义的句子进行LLM重构或手动标注自然/边缘读音;对非目标读音的歧义性进行了标准化处理(如“私”统一读作“ワタシ”);新增了原始JKYB中缺失的常用汉字表本表读音和所有付表条目。读音标注策略从原始JKYB的“发音形”(如“キョー”表示“今日”)改为“假名形”(如“キョウ”),但助词“は”和“へ”使用发音形“ワ”和“エ”。汉字字形进行了异体字统一(如“剝→剥”、“頰→頬”)。目标汉字标注范围统一为最小对应范围(如“固める”标注为“<固>める”)。所有修改和新增的条目均由日语母语者人工验证。数据集以MIT许可证发布。

Joyo Kanji Yomi Benchmark: Parakeet Edition (JKYB-Parakeet) is a benchmark dataset for evaluating the correctness of Japanese kanji readings in sentences, focusing on G2P (grapheme-to-phoneme) models, morphological analyzers, and TTS (text-to-speech) systems. It is based on the original JKYB dataset by SB Intuitions, independently reviewed, corrected, and augmented by Parakeet Inc. The dataset covers all kanji-reading pairs from the Joyo Kanji table and all word-reading pairs from the supplementary table, with 3 example sentences per reading. Each sentence includes detailed annotations: target kanji and its reading (in katakana), reading category (onyomi, kunyomi, or supplementary), other natural readings (if any), and acceptable marginal readings. The dataset contains 4,512 kanji-reading pairs and 13,536 sentences, with JSONL format including fields like key, text, tagged_text, yomi, tagged_yomi, reading_category, readings (natural and marginal), and source. It is suitable for G2P/morphological analysis/reading prediction and TTS tasks. The dataset is released under the MIT license.

创建时间:
2026-08-12
原始信息汇总

Joyo Kanji Yomi Benchmark: Parakeet Edition (JKYB-Parakeet)

数据集概述

JKYB-Parakeet 是一个用于评估日语 G2P(字形到音素)模型、形态素解析器及 TTS 系统在日语句子中正确读取汉字能力的基准数据集。该数据集由 Parakeet 公司在 SB Intuitions 的原始数据集 sbintuitions/joyo-kanji-yomi-benchmark 基础上,经内容验证、错误修正、表记统一和数据追加后形成。

数据规模

项目 数量
汉字与读音配对 4,512
总句子数 13,536
音读句子 7,056
训读句子 6,108
常用汉字表付表词汇句子 372
含多个自然读音的句子 75
含可接受读音的句子 55
源自 JKYB 的修改行 3,440
修正 JKYB 缺陷数 1,284
新增行数 441

数据来源与覆盖范围

  • 覆盖日本文化厅常用汉字表本表全部汉字与读音付表全部词汇与读音(如熟字训:今日→キョウ、田舎→イナカ、風邪→カゼ)。
  • 每个汉字读音配对包含 3 个例句,并为每个例句提供汉字和读音在上下文中的精确标注(以 <> 标记),同时记录文脉上可接受的其他自然读音(natural)和边缘读音(marginal)。

适用任务

  1. G2P / 形态素解析 / 读音推定:将输入文本转换为片假名读音序列。
  2. TTS(文本到语音):从输入文本生成对应的语音。

与原始 JKYB 的主要差异

缺陷修正

  • 对不自然或汉字使用不当的例句,使用 LLM 重新生成。
  • 修正明确错误的读音。
  • 对具有目标读音歧义的例句进行改写或手动标注。

新增数据

  • 补全原始 JKYB 中因文脉无法消除歧义而被排除的本表读音条目。
  • 新增常用汉字表付表(熟字训)的全部词汇与读音。

表记统一

  • 对高频且文脉难以判别读音的词汇进行规则化统一(如:私→ワタシ、明日→アシタ、日本→ニホン 等)。
  • 规范汉字异体字:剝→剥、塡→填、頰→頬、龍→竜、𠮟→叱。

读音表记方针

  • 采用假名形表记(如:小学校→ショウガッコウ),而非原始数据的使用发音形(如:ショーガッコー)。
  • 助词「は」「へ」采用发音形「ワ」「エ」。

标注方针

  • 统一将标签范围设为对应目标汉字的最小范围(如:<固>める: <カタ>メル)。

质量保证

所有从 JKYB 修改或新增的行均已由日语母语者逐行人工审查,确认修改合理性、读音正确性及歧义注释的准确性。完整的变更明细可在 Google 工作表 中查看。

使用方式

建议使用 GitHub 提供的评估工具包 进行评测,因数据集的读音表记与原始 JKYB 所假设的 ASR 模型输出(如 sbintuitions/kana-whisper)不完全兼容,需参考工具包内的读音归一化处理。

实际数据文件位于 data/common_kanji_source.jsonl(相对路径请基于 Hugging Face 数据集页面解析)。

许可协议

数据集采用 MIT 许可证,原始版权声明与归属详见数据集页面中的 LICENSE 和 NOTICE 文件。

搜集汇总
数据集介绍
joyo-kanji-yomi-benchmark-parakeet 数据集图片
构建方式
本数据集基于SB Intuitions发布的joyo-kanji-yomi-benchmark,由Parakeet株式会社经过严格的内容审核与修订而成。构建过程涵盖全面覆盖日本文化厅常用汉字表本表及付表的所有汉字与读音,每个读音对应三个例句。在原有数据基础上,修正了1,284处错误,统一了3,440行的表述,并新增了441条数据,最终构成包含4,512个汉字-读音对及13,536个句子的评测语料。
特点
该数据集具有高度精细的标注特征,每条样本不仅包含汉字与读音的对应关系,还以尖括号标注目标汉字及读音的精确位置,有效隔离了其他汉字对评测结果的干扰。尤为突出的是,数据集详细记录了语境中可能出现的其他自然读音及边缘读音,为多音字处理提供了丰富的信息维度。此外,数据涵盖音读、训读及常用汉字表附录中的特殊读音,并统一了异体字及读音标注规范,确保评测的严谨性与一致性。
使用方法
该数据集适用于评估G2P模型、形态分析器及TTS系统对日语汉字读音的把握能力。使用时,可借助Parakeet提供的评估工具包,该工具包能够处理本数据集特有的标注格式及读音规范化逻辑。用户输入文本及对应的标注读音后,工具可基于尖括号标签精确计算目标读音的正确率,同时允许将其他自然读音视为正确,从而提供灵活且合理的评估结果。数据集按照JSONL格式组织,每条记录包含完整的元信息,便于集成至各类评测流程。
背景与挑战
背景概述
随着日语文本转语音(TTS)与字素到音素(G2P)技术的快速发展,汉字多音字(同形异音词)的准确读音预测成为制约系统自然度与可靠性的核心难题。在此背景下,Parakeet Inc.于2025年发布了“常用汉字读音基准 Parakeet Edition”(JKYB-Parakeet),旨在构建一个覆盖日本文化厅常用汉字表全量条目及其付表词条的评测框架。该数据集基于SB Intuitions的原始JKYB进行深度校验与扩充,共收录4,512组汉字-读音对及13,536条例句,由日本母语者逐条人工审核,修正了原有数据的标注不一致、读音表记混乱及遗漏问题,显著提升了基准的准确性与覆盖度。其发布为G2P、形态素解析及TTS领域提供了高信度的评估工具,推动了对汉字多音性处理技术的量化研究。
当前挑战
在领域层面,核心挑战源于日语汉字的多音性:同形汉字在不同语境下具有多种读音,且部分读音仅在特定词或成语中成立,导致基于规则或统计的G2P系统难以从上下文捕捉正确的读音意图。这一问题在TTS系统中尤为突出,因为错误的读音直接损害语音输出的自然度与可理解性。在数据集构建过程中,挑战则体现在三方面:首先,原JKYB中大量例文存在语境不足或读音歧义,需通过LLM重写或人工标注来消除歧义,同时确保标注的准确性;其次,读音表记规范不统一(如发音形与假名形混用)及汉字异体字呈现变动,要求制定并执行一致的标注策略;最后,为了纳入原始基准遗漏的常用汉字表条目及付表熟字训,需系统性地扩充数据,并对所有变更行进行严格的人工复核,这在一定程度上增加了数据生产的复杂性与成本。
常用场景
经典使用场景
该数据集作为日语文本处理领域的专项评测基准,聚焦于汉字读音预测这一核心任务。其经典使用场景涵盖G2P(字素到音素)转换、形态学分析及文本读音推定等自然语言处理任务,旨在检验系统能否依据上下文准确输出给定文本中汉字的读音标注。凭借对常用汉字表本表及附表条目的全面覆盖,以及针对每个汉字读音精心设计的三条例句与细粒度标注,该数据集为评估模型在标准日语语境下的汉字读音能力提供了严格而公正的测试平台。
解决学术问题
此数据集直面日语汉字多音字(二字同形异读)造成的读音歧义问题,这一长期困扰自然语言处理与语音合成领域的学术难题。相较于传统语料库,它通过人工校验与注释,明确了在特定语境下自然且可接受的读音变体,并统一了书写形式及标注范围,从而为量化G2P及TTS系统的汉字读音准确率提供了可靠依据。其详尽的设计促进了读音预测模型的评估基准统一,推动了针对汉字读音复杂性研究的深入,对提升日语音声合成的自然度与准确性具有里程碑式的意义。
衍生相关工作
该数据集的衍生工作已初步显现于语音合成与自然语言处理的交叉领域,最直接的成果即为伴随其发布的评测工具包,为社区提供了可复现的标准化评估流程。作为原始基准(JKYB)的修正与扩展版本,它启发了后续研究对汉字读音语料库构建方式的再思考,尤其是关于读音标注的规范化与歧义处理策略。数据集本身亦有望支撑语音识别后处理、韵律预测模型以及多模态日语理解系统等更多下游任务的研究,其详尽标注为探索上下文感知的读音预测模型提供了宝贵的训练与测试资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务