遇见数据集

VoiceGarden Pronunciation Lexicons

收藏
github2026-09-01 更新2026-09-02 收录
官方服务:

资源简介:

一组采用宽松许可证(MIT/BSD)的发音词典,用于文本转语音,包含按语言和语音字母表索引的词典以及WFST OOV模型,旨在替代espeak-ng。每个语言包包含词典文件、音素映射、发音猜测模型和纯文本格式的词典,覆盖14种语言,部分语言还通过神经网络扩展了缺失词汇。

A collection of permissively licensed (MIT/BSD) pronunciation dictionaries for text-to-speech (TTS). This resource includes dictionaries indexed by language and phonetic alphabet, as well as WFST OOV models, and is intended to serve as a replacement for espeak-ng. Each language pack contains dictionary files, phoneme mappings, pronunciation guessing models, and plain-text formatted dictionaries, covering 14 languages. For a subset of these languages, missing vocabulary is further expanded via neural networks.

创建时间:
2026-08-20
原始信息汇总

voicegarden-lexicons 数据集概述

voicegarden-lexicons 是一个面向文本转语音(TTS)系统的发音词典数据集集合,以宽松许可证(MIT 和 BSD)发布,隶属于 VoiceGarden 项目组。其核心目的是为 Apache-2.0 或 MIT 许可的项目提供可替代 GPL 许可 espeak-ng 的发音查询方案。

数据集结构与格式

每个语言包为 <lang>.tar.gz 压缩包,包含五个文件:

  • 词典文件.fst.pho):单词到音素的映射,采用 floravox 快速查找格式
  • 预测模型phonetisaurus.fst):用于推测词典未收录单词的发音
  • 纯文本词典lexicon.txt):word<TAB>phonemes 格式,兼容 sherpa-onnx 直接读取
  • 说明文件NOTICE):数据来源及许可证信息

语言覆盖:共发布 14 种语言包,包括德语(de, 277,912 条)、英语(en, 124,384 条)、英语 CMUDict 版本(en-cmudict, 135,166 条)、法语(fr, 90,114 条)、俄语(ru, 545,315 条)、西班牙语(es, 595,857 条)、葡萄牙语(pt, 81,219 条),以及加泰罗尼亚语、捷克语、波斯语、意大利语、荷兰语、瑞典语和斯瓦希里语。所有包的详细信息(下载链接、SHA-256、条目数、许可证等)记录在 lexicons.json 中。

扩充词典

对 11 种语言进行了预先扩充,流程包括:从频率列表中选取缺失词、使用两个独立训练的 ByT5 神经网络(小和微小版本)预测发音(仅保留两者结果一致的词)、对未见词进行准确率测试。

扩充效果

  • 新增条目数从 9,253(英语)到 57,954(波兰语)不等
  • 测量准确率:82% 至 100%(部分语言采用双重校验,如英语、希腊语、瑞典语)
  • 文本覆盖率(对 50,000 常用词的查找率)显著提升,例如西班牙语从 75% 升至 98%,土耳其语从 12% 升至 87%

扩充包位于 dist/expanded/,使用与基础包相同的文件布局,expanded.json 记录各语言词典与生成条目的数量。挑战在于候选词来自频率列表,覆盖率的提升部分反映了选择性偏差。

质量与性能

与 espeak-ng 对比:

层级 冷启动 每词耗时 常驻内存
espeak-ng 规则 10-65 ms 9 ms ~5 MB
扩充词典(内存映射) <5 ms <0.1 ms ~0
Phonetisaurus 猜测器 ~650 ms ~1 ms ~70 MB
ByT5 tiny 神经网络(int8 ONNX) 410 ms 64 ms ~122 MB
ByT5 small 神经网络 2.1 s 150 ms 1.2 GB

优势:在真实文本(如维基百科文章)上,词典层可覆盖 38% 至 87% 的单词(英语 85%,西班牙语 87%),且新增条目的准确率为 92% 至 100%。数据采用 MIT/BSD 许可证,音素符号与 gruut 系语音(如 piper 训练的声音)兼容,并支持音素到拼写的反向转换。

不足:espeak-ng 在未知单词流上的原始速度更快(每词 9 ms 且无需查找),且从不拒绝单词。尚未与 espeak-ng 在同一测试集上进行公平的准确率对比(两者符号系统不同)。

数据来源

  • gruut(MIT):覆盖 ca, cs, de, en, es, fa, fr, it, nl, pt, ru, sv, sw
  • CMUDict(BSD 风格):英语(替代包 en-cmudict)

每个包的猜测模型基于该包自身词典训练,确保符号一致。德语词典经检验 236,000 个符号与 piper 的 de_DE-thorsten 声音全部匹配。单独发布的 CMUDict 猜测模型因输出 ARPABET 而非 IPA 未包含在包中。

使用方式

  1. Rust:通过 cargo add voicegarden-lexicons 引入,支持自动下载缓存
  2. 任意语言(FFI):floravox 提供 C API(vg_phonemizer_open_lang 等),可通过 ctypes 调用
  3. 纯文件:从 releases 下载,或将 lexicon.txt 直接用于 sherpa-onnx 的 lexicon 设置

语言代码采用 BCP-47 格式,支持精确匹配和语言前缀匹配。可通过环境变量 VOICEGARDEN_LEXICON_DIRVOICEGARDEN_LEXICON_URL 自定义缓存目录和镜像地址。

构建与文档

本地构建需 python3、curl 和 floravox-g2p,支持 make allmake build-lang LANG=de 命令。文档涵盖构建流程、扩充词典测试方法及 ByT5 模型训练细节。

许可证

构建代码为 Apache-2.0 OR MIT;每个语言包携带其数据源的许可证(记录在 lexicons.json 和包内 NOTICE 中),不包含任何 GPL 数据。

搜集汇总
数据集介绍
VoiceGarden Pronunciation Lexicons 数据集图片
构建方式
该数据集以多语言发音词典为核心,通过整合MIT与BSD许可的开源资源(如gruut与CMUDict)构建而成,并针对十一语言进行了扩展。扩展流程历经三重工序:从高频词表中甄别缺失词汇;依靠两个独立训练的ByT5神经模型(小型与微型)协同预测发音,仅保留双模型一致的结果,同时辅以Phonetisaurus模型进行二次校验(如英语等语言);最终通过留出测试集验证新增条目的准确率。此外,每套词典包还包含FST格式的快速查找索引、纯文本词典、以及用于未知词猜音的模型,确保数据以统一的IPA符号体系存储。
特点
该数据集兼具许可宽松与符号兼容的双重优势,规避了espeak-ng的GPL限制,且发音符号与gruut/piper系列语音模型完全匹配,并支持音素到拼写的反向转换。质量层面尤为瞩目,扩展后的词典覆盖率大幅提升(如西班牙语自75%升至98%),新增条目的实测准确率普遍介于92%-100%,部分语言经双重校验后高达98%;性能上,内存映射的词典查询速度较espeak-ng快逾千倍,且冷启动延时与内存占用显著降低。此外,数据集提供十四语言版本,包含CMUDict备用词典,并以JSON清单详尽记录每包条的哈希、许可与条目数,保障了可追溯性与透明度。
使用方法
数据集的调用途径灵活多样,支持Rust、C API及纯文本三种方式。Rust用户可通过cargo添加voicegarden-lexicons库,便捷地获取并缓存词典包,调用phonemizer接口实现词典加猜音的级联处理;任意语言可借助floravox的C接口(如Python ctypes)实现底层调用,示例代码直观明了;若使用sherpa-onnx,则直接下载发布包并指向lexicon.txt即可集成。所有语言包支持BCP-47代码前缀匹配,便于多语言环境自适应,同时允许通过环境变量自定义缓存路径与镜像源。本地构建可通过make命令复现全部流程,官方文档详尽说明了构建、测试与模型训练细节,为社区二次开发提供了坚实支撑。
背景与挑战
背景概述
VoiceGarden Pronunciation Lexicons数据集诞生于2026年,由AACTools团队推出,旨在为文本转语音(TTS)系统提供高质量、许可宽松的发音词典。该数据集的核心研究问题是解决TTS引擎在发音查找上的效率与兼容性问题,特别是在Apache-2.0或MIT许可的项目中,无法使用GPL许可的espeak-ng规则引擎。通过整合gruut和CMUDict等多源数据,覆盖14种语言,并采用MIT和BSD许可,VoiceGarden为TTS领域提供了可自由分发的替代方案,显著提升了发音查询的速度与准确性,对开源语音合成社区产生了深远影响。
当前挑战
该数据集面临的挑战包括:1) 发音词典的构建需处理多语言音素符号不一致的问题,通过统一IPA约定和双神经网络验证来确保准确性;2) 词典覆盖不全,需通过频率统计和生成模型填补缺失词汇,但生成词条需经双重验证以保证质量;3) 在性能与资源消耗间权衡,如神经网络模型虽准确但速度慢、内存大,需优化查找策略;4) 数据许可兼容性问题,确保所有词条均可在宽松许可下分发;5) 词典与TTS训练数据的音素体系匹配,需验证与piper等模型的一致性。
常用场景
经典使用场景
VoiceGarden Pronunciation Lexicons 作为多语言语音合成(Text-to-Speech, TTS)系统的核心发音词典资源,其经典使用场景在于为语音引擎提供高效、精准的字素到音素(Grapheme-to-Phoneme, G2P)映射。在TTS流水线中,词典查找是发音生成的首选路径,它确保高频词汇的发音准确无误,避免了运行时规则推算带来的延迟与误差。该数据集以MIT和BSD等宽松许可证发布,打破了GPL许可证对商业和开源项目的限制,使得Apache-2.0或MIT协议的项目能够无缝集成。其内存映射访问机制支持亚毫秒级单词查询,冷启动时间低于5毫秒,显著优于传统规则引擎,为实时语音交互系统提供了关键性能支撑。
解决学术问题
该数据集解决了语音合成领域中若干核心学术问题。首要问题是发音词典的覆盖缺口:传统词典常遗漏大量常用词汇,导致TTS系统需依赖运行时猜测,既降低速度又引入错误。动态采用频率列表与双神经网络共识机制,为11种语言扩充了数千至数万个词条,将常用文本覆盖率提升至87%至99%不等,且经独立测试验证,新增词条的准确率高达92%至100%。其次,它回应了跨许可证兼容性难题,提供了无GPL污染的替代方案,促进了开源生态的互操作性。此外,数据集的音素符号与gruut(Piper语音模型所依赖的)约定一致,解决了符号系统不匹配导致的质量损失问题,从而为可复现的语音合成研究奠定了数据基础。
衍生相关工作
该数据集催生了若干相关经典工作。首先,完善的词典依据派生出了基于Phonetisaurus的生成式猜测模型,该模型能在词典未覆盖词条时提供高质量发音预测,拓展了系统的词汇覆盖边界。其次,配套训练的ByT5 G2P神经网络模型(小型和微型版本)及逆向P2G模型,为端到端发音预测研究提供了基准资源,其训练方法(基于4.12M对语料和M2M对齐的IPA统一)成为后续多语言音素转换研究的参考范式。此外,扩增词典的评估流程(含双重检查过滤和保留测试)确立了发音词典质量评估的严谨标准,而`lexicons.json`清单的标准化结构(含SHA-256校验和许可证记录)则为数据集的可追溯性与可复用性树立了范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务