CN-NewsTTS Bench
收藏资源简介:
CN-NewsTTS Bench是一个面向中文新闻raw-input TTS的target-level自动读法准确率基准,包含公开、可复现的新闻式测试集和自动评估协议,用于评估TTS系统在不使用外部规则前端、LLM改写、SSML或人工修正的条件下,对关键读法目标(如比分、型号、单位、连字符、百分号、英文缩写和中英数混排名称)的准确发音能力。数据集包括开发集和公开测试集的文本、target标注、音频文件(如WAV格式)以及ASR转录结果。
CN-NewsTTS Bench is a target-level automatic pronunciation accuracy benchmark for Chinese news raw-input TTS. It includes a public and reproducible news-style test set and an automatic evaluation protocol, which is used to evaluate the ability of TTS systems to accurately pronounce key pronunciation targets such as scores, model numbers, units, hyphens, percentage signs, English abbreviations and Chinese-English-number mixed names, without using external rule-based frontends, LLM rewriting, SSML or manual corrections. The dataset contains text, target annotations, audio files (e.g., in WAV format) and ASR transcriptions for both the development set and the public test set.
CN-NewsTTS Bench 数据集概述
CN-NewsTTS Bench 是一个面向中文新闻原始文本输入(raw-input)的文本转语音(TTS)系统的目标级(target-level)自动读法准确率基准。它专注于评估 TTS 产品能否准确读出中文新闻中的关键读法目标,而不使用外部规则、大语言模型(LLM)改写、SSML 或人工修正。
核心目标
- 解决中文新闻播报中常见的错读问题,如比分(
117-116被读成“一百一十七负一百一十六”)、型号(苏-27被读成“苏负二十七”)、单位(620N·m被读成“六百二十恩点米”)等。 - 提供一个公开、可复现的测试集和自动评估协议,用于衡量 TTS 系统在关键读法目标上的表现。
数据集规模
| 数据集划分 | 记录数 | 目标数 | 可自动评估目标数 | 可选目标数 |
|---|---|---|---|---|
| 开发集 (dev) | 200 | 252 | 248 | 4 |
| 公开测试集 (test_public) | 800 | 1008 | 992 | 16 |
| 总计 | 1000 | 1260 | 1240 | 20 |
- 记录 (record):一段中文新闻风格的短句。
- 目标 (target):每条记录中包含的一个或多个读法风险点(如数字、单位、缩写等)。
- 可自动评估目标:可通过评分器自动判断读法正确与否的目标。
任务定义
每条样本包含一个或多个读法风险目标,每个目标都标注了可接受读法(positive readings)和已知错误读法(negative readings)。评分器仅在目标级别判断读法是否正确,不计算整句的 WER/CER。
例如:
- 目标
117-116:可接受读法为“一百一十七比一百一十六”,错误读法为“一百一十七到一百一十六”、“一百一十七负一百一十六”。 - 目标
AI:可接受读法为“A I”,错误读法为“人工智能”。
评分协议
v0.1 版本使用三路固定的自动语音识别(ASR)系统进行评分:
- MiMo API ASR
- SenseVoiceSmall
- Paraformer-zh
评分流程:
- 对每个目标、每条 ASR 转写结果,评分器匹配可接受和错误读法。
- 三路 ASR 结果进行投票,至少两路正确判定为“正确”,至少两路错误判定为“错误”,否则判定为“未知”。
- 计算主指标:
- 严谨准确率 (Strict Auto Accuracy):正确目标数 / 所有可自动评估目标数
- 解析准确率 (Resolved Accuracy):正确目标数 / (正确目标数 + 错误目标数)
- 覆盖率 (Coverage):(正确目标数 + 错误目标数) / 所有可自动评估目标数
- 未知率 (Unknown Rate):未知目标数 / 所有可自动评估目标数
发布内容与资源
| 资源 | 位置 | 用途 |
|---|---|---|
| 数据集与数据模式 | data/ | 开发集/公开测试集文本、目标标注和数据模式 |
| 评分器与验证器 | scripts/ | 数据校验、目标级评分、榜单聚合 |
| 公开 ASR 转写结果 | results/asr_transcripts/public_test/ | 三路固定 ASR 转写文本 |
| 公开 ASR 评分结果 | results/asr_results/public_test/ | 七家 TTS 的合并 ASR 结果 |
| 榜单数据 | results/leaderboard.csv, results/leaderboard.json | 机器可读的榜单结果 |
| 在线榜单 | GitHub Pages | 在线公开榜单 |
| 完整归档 | Zenodo DOI | 音频包、完整 ASR 转写、核心复现包 |
| 论文 | arXiv:2606.24714 | 方法、实验和局限性说明 |
v0.1 公开测试榜单(节选)
| 排名 | TTS 系统 | 严谨准确率 | 覆盖率 | 解析准确率 |
|---|---|---|---|---|
| 1 | 火山 / 豆包 TTS | 0.879 | 0.913 | 0.962 |
| 2 | Azure Speech TTS | 0.756 | 0.756 | 1.000 |
| 3 | Google Cloud TTS | 0.604 | 0.861 | 0.701 |
| 4 | MiniMax TTS | 0.548 | 0.850 | 0.645 |
| 5 | 阿里云 CosyVoice | 0.472 | 0.533 | 0.885 |
评测新 TTS 系统流程
- 从
data/dev.jsonl或data/test_public.jsonl读取原始文本。 - 为每条样本生成一个音频文件,不做外部文本归一化、LLM 改写、SSML 或手工修正。
- 准备
system_card.json、manifest.json和音频目录。 - 使用三路 ASR 生成转写,或提供等价 ASR 结果。
- 运行评分脚本获取目标级分数。
许可证
- 代码:MIT
- 数据集、固定 ASR 转写、基准测试结果、文档和元数据:CC BY 4.0
- 生成 TTS 音频:以评估产物形式发布于 Zenodo,复用可能受各提供商/API 条款约束,不应视为无限制语音训练语料。





