遇见数据集

arnum-tts

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

ArNum-TTS 是一个专门用于评估阿拉伯语文本转语音(TTS)系统在数字处理方面性能的小型基准测试集。该数据集由 15 个句子构成,每个句子以三种数字形式(西方数字、阿拉伯-印度数字、拼写数字)呈现,共 45 个语音样本。所有句子除了数字形式外完全相同,重点关注年份、百分比、小数、货币、时间、日期、电话号码、序数、范围和大数等实际应用场景。数据集提供原始测试句子(sentences.jsonl,包含句子文本、数字形式标识、类别等信息)以及三个 TTS 引擎(fish、Apple、ArTST)的合成结果(results_*.jsonl,包含每话语的转录和评分)。该数据集的目的是揭示 TTS 系统在处理不同数字形式时的表现差异,特别是阿拉伯-印度数字可能被错误处理的问题。数据规模为 45 个样本,适用于阿拉伯语 TTS 系统的评估和基准测试,可帮助开发者识别和修复数字发音缺陷。

ArNum-TTS is a small benchmark dataset specifically designed to evaluate the performance of Arabic text-to-speech (TTS) systems in processing numbers. The dataset consists of 15 sentences, each presented in three numeral forms (Western digits, Arabic-Indic digits, and spelled-out numbers), resulting in 45 speech samples. All sentences are identical except for the numeral forms, focusing on practical scenarios such as years, percentages, decimals, currencies, times, dates, phone numbers, ordinals, ranges, and large numbers. The dataset provides raw test sentences (sentences.jsonl, containing sentence text, numeral form identifier, category, etc.) and synthesis results from three TTS engines (fish, Apple, ArTST) (results_*.jsonl, containing transcription and scoring for each utterance). The goal of this dataset is to reveal performance differences of TTS systems when handling different numeral forms, particularly the potential misprocessing of Arabic-Indic digits. With a scale of 45 samples, it is suitable for evaluation and benchmarking of Arabic TTS systems, helping developers identify and fix numeral pronunciation issues.

创建时间:
2026-08-19
原始信息汇总

ArNum-TTS 数据集概述

基本信息

  • 数据集名称:ArNum-TTS(阿拉伯语文本转语音数字评估集)
  • 作者:Syamjith NK
  • 许可证:数据采用 CC BY 4.0,代码采用 MIT 许可证
  • 语言:阿拉伯语(ar)
  • 任务类型:文本转语音(text-to-speech)
  • 数据集规模:少于 1K 条样本(n<1K)
  • 数据集地址:https://huggingface.co/datasets/syamjithnk/arnum-tts

数据集目的

该数据集评估一个具体问题:当阿拉伯语 TTS 系统朗读包含数字的句子时,听者能否还原该数字。这针对日期、价格、百分比等实际应用场景。

设计结构

  • 总计:15 个句子 × 3 种数字形式 = 45 条语音样本
  • 三种数字形式
形式 示例
西方数字(western) في عام 2026
阿拉伯-印度数字(arabic_indic) في عام ٢٠٢٦
拼写形式(spelled) في عام ألفين وستة وعشرين
  • 测试类别:年份、百分比、小数、货币、时间、日期、电话号码、序数、范围、大数计数

基准测试结果(三种引擎)

数字形式 fish s2.1-pro-free Apple Majed (ar_001) ArTST speecht5_tts_clartts_ar
西方数字 2026 11/15 (73%) 13/15 (87%) 0/15 (0%)
阿拉伯-印度数字 ٢٠٢٦ 1/15 (7%) 13/15 (87%) 0/15 (0%)
拼写形式 ألفين وستة وعشرين 13/15 (87%) 9/15 (60%) 4/15 (27%)
总体 25/45 (56%) 33/45 (73%) 4/45 (9%)

关键发现

  1. Apple:在朗读前对数字进行归一化,因此不受数字形式影响,两种数字形式均取得 87% 的正确率。
  2. fish:能处理西方数字,但在阿拉伯-印度数字上表现崩溃(从 73% 降至 7%),失败表现为噪声而非发音错误。
  3. ArTST:两种数字形式均无法处理(0/30),原因在于其 87-token 词汇表中缺少阿拉伯-印度数字 ٠-٩,导致数字在合成前被删除。

数据集文件

文件 功能
build_set.py 生成 data/sentences.jsonl
run_bench.py 合成 → 转录 → 评分流程
arnum.py 阿拉伯语数字词 → 数值归一化器
test_arnum.py 归一化器的 34 项测试
rescore.py 从存储的转录中重新推导所有结果
results_{fish,apple,artst}.jsonl 每个引擎的逐条结果
data/artst_tokens.json ArTST 分词器实际接收的内容

数据配置

数据集包含 4 个配置:

  • sentences:测试句子数据(data/sentences.jsonl
  • results_fish:fish 引擎结果
  • results_apple:Apple 引擎结果
  • results_artst:ArTST 引擎结果

实用性建议

将数字在输入阿拉伯语 TTS 引擎前进行归一化处理:对 fish 使用西方数字,对 ArTST 则完全转换为阿拉伯语单词。

相关说明

  • 该数据集是“阿拉伯语能否在流程中存活”系列基准之一,另有 ArShape(渲染)和 ArPDF(PDF 往返)两个数据集。
  • 测量链为 TTS → Whisper → 数字解析器,任何环节的误差都会归咎于 TTS。
  • 尚未进行人工听力验证,绝对数字在引用前需人工确认。
搜集汇总
数据集介绍
arnum-tts 数据集图片
构建方式
阿语数字文本转语音评测集ArNum-TTS,旨在弥合阿拉伯语TTS系统在数字处理能力上的评估空白。该数据集由15个句子构成,每个句子以三种数字形态(西方阿拉伯数字、阿拉伯-印度数字及拼写形式)呈现,总计45条语音样本。通过控制句子的其他成分不变,仅改变数字的书写方式,确保评分差异完全归因于数字形态。评测类别涵盖年份、百分比、小数、货币、时间、日期等真实应用场景。构建流程包括脚本生成句子、多引擎合成语音、Whisper转写及数字解析评分,并附带详尽的记录文件与复现工具。
特点
该数据集的鲜明特色在于其对数字形态的严格对照设计,能够精准揭示TTS引擎在数字处理上的根本差异。评测结果具有高度可解释性:例如,Apple引擎通过内部归一化实现形态无关的高准确率,fish引擎对西方数字表现良好但对阿拉伯-印度数字崩溃,而ArTST因词汇表缺失数字token导致完全失败。数据集附带严格校准的评分器,历经两轮修正以消除误判,确保分数守恒与公正性。此外,所有结果均可通过存储的转录文件重算,无需重新合成音频,保障了实验的可复现性与透明度。
使用方法
使用者可依据README指引轻松复现评测流程:首先运行build_set.py生成句子集,随后通过run_bench.py指定引擎(fish、Apple或ArTST)进行合成、转写与评分。对于ArTST等需不同运行环境的引擎,支持拆分合成与评分步骤。数据集提供四个配置子集,分别存储句子、各引擎的逐条结果及tokenizer输入,便于深入分析。用户还可利用rescore.py从既有转录中重新推导分数,或运行test_arnum.py验证数字归一化器的正确性。完整的代码与文档已开源,确保评测的透明性与可扩展性。
背景与挑战
背景概述
ArNum-TTS数据集由Syamjith NK于2026年创建,聚焦于阿拉伯语文本转语音(TTS)系统中数字的合成准确性这一核心研究问题。阿拉伯语采用西方数字与阿拉伯-印度数字两套书写体系,同一数字如“2026”可写作“2026”或“٢٠٢٦”,而现有文献未明确TTS系统是否能同等处理这两种形式。该基准通过精心设计的45条语句(15句×3种数字书写形式),在保持句子其余部分恒定的前提下,系统评测了不同TTS引擎对年份、百分比、小数等实用类别的数字再现能力。数据集在Hugging Face平台发布,采用CC BY 4.0许可,配套开源评分工具,为阿拉伯语语音合成领域提供了首个专注于数字可恢复性的可复现评估基准。其发现深刻揭示了多款主流引擎在数字处理上的显著缺陷,直接影响了工业界阿拉伯语TTS系统的设计规范。
当前挑战
ArNum-TTS所解决的领域挑战在于阿拉伯语TTS系统对数字的语音合成准确性,尤其是双数字体系(西方数字与阿拉伯-印度数字)的兼容性问题,以及拼写数字(如“ألفين وستة وعشرين”)的正确发音。构建过程中面临多项方法论挑战:其一,测量链为TTS→Whisper→数字解析器,任何环节的误差均可能被错误归因于TTS,需通过多轮解析器修正来确保评分公平;其二,评分器需具备阿拉伯语复杂数字词法(含序数、钟点分数、变音符等)的完善解析能力,否则会将正确发音误判为失败;其三,需严格控制句子变量,确保分数差异完全源于数字形式;其四,跨引擎的评测需保证可复现性,且需明确标注使用场景的偏差(如ArTST模型的域外评估);其五,绝对分数受人工听辨缺失的限制,在引用数据时需谨慎说明测量链的局限性。
常用场景
经典使用场景
ArNum-TTS作为一项专为阿拉伯语文本转语音系统设计的微型评估基准,其核心用途在于精准度量不同数字表示形式在语音合成过程中的存活率。该基准精心构建了15个日常语句,分别以西方数字、阿拉伯-印度数字及拼写数字三种形态呈现,总共形成45条测试样本,旨在控制变量,使任何性能差异均可归因于数字形式本身。这一设计为研究阿拉伯语数字规范化对TTS系统输出可懂性的影响提供了严谨的实验范式,尤其适用于检验诸如年份、百分比、小数、货币、时间等高频数字场景的合成质量。
衍生相关工作
ArNum-TTS的出现催生了系列相关探索,其测量链(TTS→Whisper→数词解析器)的稳健性促使研究者重新审视评估基线的可靠性,并开发出如rescore.py等无需重新合成即可重推演分数的工具。此外,该基准所揭示的词汇表缺失问题(如ArTST的阿拉伯-印度数字缺席)直接启迪了对开放权重TTS模型内部词表构建的研究,而Apple引擎的归一化成功案例则推动了数字预归一化策略在工业界的广泛应用。作为系列基准(含ArShape、ArPDF)的一环,它激发了针对阿拉伯语处理流水线各阶段(语音合成、文本渲染、PDF转换)的全面质量评估体系的构建,形成了相互呼应的研究生态。
数据集最近研究
最新研究方向
ArNum-TTS数据集聚焦于阿拉伯语语音合成中数字处理的鲁棒性评估,这一前沿方向直击文本转语音系统在真实场景中的关键痛点——日期、价格、百分比等数字信息的可理解性。该基准通过严格控制的45个语句,对比西方数字、阿拉伯-印度数字及拼写形式在三种主流引擎(fish、Apple、ArTST)下的表现,揭示了数字形式对合成质量的深远影响。研究发现,不同引擎对数字形式的处理差异显著,甚至出现阿拉伯-印度数字完全无法识别的极端情况,为阿拉伯语语音合成的数字归一化研究提供了实证基础。该数据集的发布填补了阿拉伯语TTS评估在数字维度上的空白,推动领域关注从自然度、韵律转向功能性信息传递的可靠性,其开源的评分工具链和可复现流程也为后续研究树立了方法论标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务