遇见数据集

CN-NewsTTS Bench

收藏
github2026-06-25 更新2026-06-29 收录
官方服务:

资源简介:

CN-NewsTTS Bench是一个面向中文新闻raw-input TTS的target-level自动读法准确率基准,包含公开、可复现的新闻式测试集和自动评估协议,用于评估TTS系统在不使用外部规则前端、LLM改写、SSML或人工修正的条件下,对关键读法目标(如比分、型号、单位、连字符、百分号、英文缩写和中英数混排名称)的准确发音能力。数据集包括开发集和公开测试集的文本、target标注、音频文件(如WAV格式)以及ASR转录结果。

CN-NewsTTS Bench is a target-level automatic pronunciation accuracy benchmark for Chinese news raw-input TTS. It includes a public and reproducible news-style test set and an automatic evaluation protocol, which is used to evaluate the ability of TTS systems to accurately pronounce key pronunciation targets such as scores, model numbers, units, hyphens, percentage signs, English abbreviations and Chinese-English-number mixed names, without using external rule-based frontends, LLM rewriting, SSML or manual corrections. The dataset contains text, target annotations, audio files (e.g., in WAV format) and ASR transcriptions for both the development set and the public test set.

创建时间:
2026-06-23
原始信息汇总

CN-NewsTTS Bench 数据集概述

CN-NewsTTS Bench 是一个面向中文新闻原始文本输入(raw-input)的文本转语音(TTS)系统的目标级(target-level)自动读法准确率基准。它专注于评估 TTS 产品能否准确读出中文新闻中的关键读法目标,而不使用外部规则、大语言模型(LLM)改写、SSML 或人工修正。

核心目标

  • 解决中文新闻播报中常见的错读问题,如比分(117-116 被读成“一百一十七负一百一十六”)、型号(苏-27 被读成“苏负二十七”)、单位(620N·m 被读成“六百二十恩点米”)等。
  • 提供一个公开、可复现的测试集和自动评估协议,用于衡量 TTS 系统在关键读法目标上的表现。

数据集规模

数据集划分 记录数 目标数 可自动评估目标数 可选目标数
开发集 (dev) 200 252 248 4
公开测试集 (test_public) 800 1008 992 16
总计 1000 1260 1240 20
  • 记录 (record):一段中文新闻风格的短句。
  • 目标 (target):每条记录中包含的一个或多个读法风险点(如数字、单位、缩写等)。
  • 可自动评估目标:可通过评分器自动判断读法正确与否的目标。

任务定义

每条样本包含一个或多个读法风险目标,每个目标都标注了可接受读法(positive readings)和已知错误读法(negative readings)。评分器仅在目标级别判断读法是否正确,不计算整句的 WER/CER。

例如

  • 目标 117-116:可接受读法为“一百一十七比一百一十六”,错误读法为“一百一十七到一百一十六”、“一百一十七负一百一十六”。
  • 目标 AI:可接受读法为“A I”,错误读法为“人工智能”。

评分协议

v0.1 版本使用三路固定的自动语音识别(ASR)系统进行评分:

  • MiMo API ASR
  • SenseVoiceSmall
  • Paraformer-zh

评分流程

  1. 对每个目标、每条 ASR 转写结果,评分器匹配可接受和错误读法。
  2. 三路 ASR 结果进行投票,至少两路正确判定为“正确”,至少两路错误判定为“错误”,否则判定为“未知”。
  3. 计算主指标:
    • 严谨准确率 (Strict Auto Accuracy):正确目标数 / 所有可自动评估目标数
    • 解析准确率 (Resolved Accuracy):正确目标数 / (正确目标数 + 错误目标数)
    • 覆盖率 (Coverage):(正确目标数 + 错误目标数) / 所有可自动评估目标数
    • 未知率 (Unknown Rate):未知目标数 / 所有可自动评估目标数

发布内容与资源

资源 位置 用途
数据集与数据模式 data/ 开发集/公开测试集文本、目标标注和数据模式
评分器与验证器 scripts/ 数据校验、目标级评分、榜单聚合
公开 ASR 转写结果 results/asr_transcripts/public_test/ 三路固定 ASR 转写文本
公开 ASR 评分结果 results/asr_results/public_test/ 七家 TTS 的合并 ASR 结果
榜单数据 results/leaderboard.csv, results/leaderboard.json 机器可读的榜单结果
在线榜单 GitHub Pages 在线公开榜单
完整归档 Zenodo DOI 音频包、完整 ASR 转写、核心复现包
论文 arXiv:2606.24714 方法、实验和局限性说明

v0.1 公开测试榜单(节选)

排名 TTS 系统 严谨准确率 覆盖率 解析准确率
1 火山 / 豆包 TTS 0.879 0.913 0.962
2 Azure Speech TTS 0.756 0.756 1.000
3 Google Cloud TTS 0.604 0.861 0.701
4 MiniMax TTS 0.548 0.850 0.645
5 阿里云 CosyVoice 0.472 0.533 0.885

评测新 TTS 系统流程

  1. data/dev.jsonldata/test_public.jsonl 读取原始文本。
  2. 为每条样本生成一个音频文件,不做外部文本归一化、LLM 改写、SSML 或手工修正。
  3. 准备 system_card.jsonmanifest.json 和音频目录。
  4. 使用三路 ASR 生成转写,或提供等价 ASR 结果。
  5. 运行评分脚本获取目标级分数。

许可证

  • 代码:MIT
  • 数据集、固定 ASR 转写、基准测试结果、文档和元数据:CC BY 4.0
  • 生成 TTS 音频:以评估产物形式发布于 Zenodo,复用可能受各提供商/API 条款约束,不应视为无限制语音训练语料。
搜集汇总
数据集介绍
CN-NewsTTS Bench 数据集图片
构建方式
CN-NewsTTS Bench针对中文新闻播报场景中易错读的核心要素精心构建。研究团队系统梳理了比赛中比分、设备型号、物理单位、百分比、英文缩写及中英数混排等高风险读法目标,从真实新闻语料中筛选出1000条短句样本,涵盖dev与public_test两个子集,共计1260个标注目标。每个目标均明确标记了可接受的正向读法与常见的错误读法形态,并采用JSON Lines格式存储,确保数据高度结构化与可复现。
特点
该数据集最显著的特点是采用了target-level自动评估协议,可在不依赖外部文本规范前端、大语言模型改写或人工修正的前提下,精准定位每个关键读法目标是否被正确合成。其基于三路固定自动语音识别系统(MiMoAPIASR、SenseVoiceSmall、Paraformer-zh)的投票机制,保证了评分结果的中立性与稳定鲁棒性。StrictAcc、Coverage与ResolvedAcc等多元指标提供了从可靠度到解决率的全面性能画像。
使用方法
使用者可直接从GitHub仓库获取dev.jsonl与test_public.jsonl原始文本,完成无需任何外部预处理的端到端TTS合成。随后运行scripts/score_submission.py脚本,传入数据集文件、ASR结果路径与模型标识符,即可获得目标级的详细评分报告。若需复现公开榜单,可使用提供的自动化聚合脚本aggregate_leaderboard.py,通过精简命令行操作完成全流程评测,极大降低了系统迭代与对比的门槛。
背景与挑战
背景概述
中文新闻文本转语音(Text-to-Speech, TTS)技术在多媒体内容分发与语音交互领域占据重要地位,然而现有多数评测体系聚焦于音质与整句流畅度,对新闻场景中频繁出现的高风险特殊表达(如比分、型号、单位、百分比、英文缩写等)的读法正确性关注不足。CN-NewsTTS Bench 由网易云音乐 AI 资讯播客团队的研究者 Shijun Luo 在 2026 年创建,核心研究问题聚焦于:在不依赖外部规则前端、大语言模型改写、SSML 或人工修正的条件下,评估 TTS 系统对中文新闻 raw-input 中关键读法目标的自动读法准确率。该基准通过发布 1000 条包含 1260 个精细标注目标的高质量测试集以及三路固定 ASR 投票评分协议,为领域提供了一个可复现的 target-level 评测框架,其公开榜单上线后迅速引起工业界与学术界关注,有效推动了面向中文新闻叙事的 TTS 系统读法鲁棒性研究。
当前挑战
CN-NewsTTS Bench 所面对的领域挑战在于,中文新闻中大量存在的特殊文本格式(如“117-116”“苏-27”“620N·m”)在通用文本归一化过程中极易产生语义漂移,将比分误读为范围或减法运算、将型号误读为数学表达式、将物理单位误读为字母串,从而彻底改变信息含义。构建过程中的挑战尤为突出:如何科学定义“读法正确”的边界,需要为每个目标显式列出多种可接受正例与已知错误反例;如何设计稳定且跨系统一致的自动评分协议,采用三路 ASR 投票机制以缓解单模型识别偏差;如何保障评测公平性,严格规定 raw-input product track 不允许外部预处理干预;以及如何在数据集规模有限的情况下确保覆盖高频高风险读法场景,使基准兼具区分度与实用性。
常用场景
经典使用场景
在中文新闻语音合成(TTS)领域,CN-NewsTTS Bench 被广泛用作衡量系统在未经过外部规则前端、大语言模型改写或人工修正的前提下,直接处理原始输入文本时对关键语义单元(如比分、型号、单位、百分比、英文缩写及中英混排名称)读音准确性的标准化基准。该数据集通过精确定义每个高风险目标的预期读法(positive readings)与常见错误读法(negative readings),并以 target-level 自动评分协议替代传统的整句词错误率或主观听感评测,从而实现对 TTS 产品在信息保真度层面的细粒度、可复现评估。研究者利用该基准可快速定位具体读法错误的来源,推动系统在新闻播报场景中的语义无损合成能力提升。
解决学术问题
该基准直面中文新闻 TTS 中因文本归一化机制缺陷而导致的语义漂移这一核心学术难题。传统评估指标如 MOS 或整句 WER/CER 无法区分“不好听”与“读错含义”的本质差异,而 CN-NewsTTS Bench 通过 target-level 的显式标注与三路 ASR 投票机制,首次实现了对特定高风险读法目标的自动化、高置信度判定。它解决了中文新闻 TTS 领域缺少针对原始输入(raw-input)条件下可复现、无偏见的读法准确率评估协议的问题,为从理论上区分文本归一化错误与声学模型缺陷提供了系统性的分析框架,其公开的测试集、评分脚本与榜单机制极大促进了领域内研究结果的透明化与公平对比。
衍生相关工作
基于 CN-NewsTTS Bench 的目标定义与评估范式,学界和工业界已衍生出多项相关研究工作,包括针对特定读法错误类型的文本归一化优化算法、融合上下文语义的 TTS 前端模块改进,以及面向中文新闻场景的端到端 TTS 系统鲁棒性增强方案。该基准的公开榜单机制亦催生了多家 TTS 服务提供商针对其系统在比分、单位、缩写等高风险类别上的专项优化迭代,推动了诸如火山引擎豆包 TTS、Azure Speech TTS 等产品在原始输入准确率上的显著提升。此外,其提出的 target-level 自动评估协议为后续其他语种或领域(如金融、医疗)的 TTS 信息保真度评测提供了可借鉴的方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务