遇见数据集

serena-synthetic-it-27h

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

这是一个用于文本转语音(TTS)训练的意大利语合成语音数据集,名为“serena-synthetic-it-27h”。数据集由Qwen3-TTS-1.7B-Base模型通过语音克隆模式生成,包含约29,500个音频片段,总时长约27.3小时(98,099秒)。所有音频均为22.05 kHz单声道16位WAV格式,经过-23 LUFS响度归一化和静音修剪。数据集中只有一个固定的合成说话人声音,以保持跨片段一致性。元数据采用Piper兼容的格式,路径和文本以竖线分隔。训练集包含26,523个片段,验证集包含2,947个片段。语料库由两部分组成:约90%来自Tatoeba意大利语句子(经改编,包括替换英文名为意大利名、编辑更正和重音修复),约10%由多个LLM(Claude Sonnet、GPT-4o、Qwen、Gemini、DeepSeek)原创生成,涵盖对话、技术和文学风格。每个片段都经过两阶段自动验证:ASR词错误率≤0.25,音素错误率≤0.30,最终平均音素错误率为0.168。数据集文件结构包括README、LICENSE(CC-BY-4.0)、report.json、两个元数据CSV文件及按子目录组织的WAV文件。该数据集可直接用于Piper TTS训练,也可通过Python/datasets库加载。所有音频均为合成生成,不涉及真实人物声音,适用于TTS模型训练和研究。

A synthetic Italian speech dataset for text-to-speech (TTS) training, named serena-synthetic-it-27h. The dataset was generated by the Qwen3-TTS-1.7B-Base model in voice cloning mode, containing approximately 29,500 audio clips totaling about 27.3 hours (98,099 seconds). All audio is in 22.05 kHz mono 16-bit WAV format, normalized to -23 LUFS loudness and trimmed for silence. The dataset features a single fixed synthetic speaker voice for consistency across clips. Metadata is in Piper-compatible format with pipe-separated paths and text. The training set has 26,523 clips, and the validation set has 2,947 clips. The corpus consists of about 90% from Tatoeba Italian sentences (adapted with English names replaced by Italian names, editorial corrections, and accent fixes) and about 10% originally generated by multiple LLMs (Claude Sonnet, GPT-4o, Qwen, Gemini, DeepSeek) covering conversational, technical, and literary styles. Each clip underwent two-stage automatic validation: ASR word error rate ≤ 0.25 and phoneme error rate ≤ 0.30, with a final average phoneme error rate of 0.168. The dataset file structure includes README, LICENSE (CC-BY-4.0), report.json, two metadata CSV files, and WAV files organized in subdirectories. The dataset can be used directly for Piper TTS training or loaded via the Python/datasets library. All audio is synthetically generated, involving no real human voices, suitable for TTS model training and research.

创建时间:
2026-08-01
原始信息汇总

数据集概述:serena-synthetic-it-27h

这是一个用于文本转语音(TTS)训练的人工合成意大利语单说话人语音数据集,采用 CC-BY-4.0 许可协议发布。数据集由 Qwen3-TTS-1.7B-Base 模型通过声音克隆模式生成,格式为 Piper 兼容,适合直接用于 Piper 等 TTS 模型的训练。

基本信息

属性
音频片段数 训练集 26,523 条 / 验证集 2,947 条,共约 29.5k 条
总时长 约 27.3 小时(98,099 秒)
采样率 22,050 Hz 单声道,16-bit WAV
响度 归一化至 -23 LUFS,已做静音修剪
语言 意大利语
说话人 1 个(单一固定合成参考音色,保证跨片段一致性)
元数据格式 `wavs/000000-008999/NNNNNN.wav

生成方式与来源

  • 生成工具:使用 qwen3-tts-dataset-generator 端到端流水线(生成→验证→发音检查→归一化→发布)。
  • 生成模型:Qwen3-TTS-1.7B-Base(Qwen/Qwen3-TTS-12Hz-1.7b-Base),bfloat16 精度,通过 ICL(上下文学习)从固定参考片段进行声音克隆,禁用了 x-vector-only。
  • 指令:"Read in a calm, neutral tone."
  • 采样参数temperature=0.4top_k=50top_p=1.0repetition_penalty=1.05max_new_tokens=512seed=42do_sample=true

语料构成与来源标注

句子语料共 29,475 句,由两部分混合而成:

  • 约 90% 改编自 Tatoeba 句子(意大利语,CC-BY 2.0 FR,源自官方导出文件),进行了改编处理:将英语/美国常见人名替换为意大利语人名,并进行了编辑性修正和重音修复。属于衍生/改编作品,并非逐字复制。
  • 约 10% 为 LLM 原创句子,涵盖会话、技术和文学等语域,专门为语料库撰写(使用的模型:Claude Sonnet、GPT-4o、Qwen、Gemini、DeepSeek;有一个生产批次在质量审查后被排除)。

语料库使用确定性 seed=42 洗牌组装;人名替换和 LLM 批次验证报告包含在 qwen3-tts-dataset-generator 项目中。

质量控制与验证

每个音频片段均通过两阶段自动化验证:

  1. 单词级:ASR(faster-whisper large-v3)词错误率必须 ≤ 0.25。
  2. 音素级:使用 espeak-ng 音素识别(facebook/wav2vec2-xlsr-53-espeak-cv-ft)与音素化参考文本进行比对,音素错误率(PER)必须 ≤ 0.30。

最终语料库的音素 PER 分布统计(n = 29,475):

统计量 PER
平均值 0.168
中位数 0.167
p75 0.208
p90 0.247

文件结构

README.md LICENSE CC-BY-4.0(见上方来源标注部分) report.json 生成/报告元数据(模型、采样、统计) metadata_train.csv | path|transcript(26,523 行) metadata_val.csv | path|transcript(2,947 行) wavs/000000-008999/ | 8,996 个片段 wavs/009000-017999/ | 9,000 个片段 wavs/018000-026999/ | 8,999 个片段 wavs/027000-029474/ | 2,475 个片段

音频文件分布在最多 9,000 个文件的子目录中,以满足 Hugging Face Hub 对单目录提交文件数不超过 10,000 的限制。

metadata_*.csv 中的路径相对于仓库根目录,因此该文件夹可直接作为 Piper 数据集目录使用。

使用方法

  • Piper 训练:元数据格式为 Piper 原生格式(wavs/NNNNNN.wav|transcript)。训练时将拆分文件合并为单个 metadata.csv,并将仓库根目录作为 --dataset-dir 传入。详见 Piper 文档
  • Python / datasets 库加载:布局为纯文件而非 AudioFolder,需手动加载,示例代码如下:

python import pandas as pd from datasets import Dataset, Audio

df = pd.read_csv("hf://datasets/committa/serena-synthetic-it-27h/metadata_train.csv", sep="|", names=["audio", "text"]) ds = Dataset.from_pandas(df).cast_column("audio", Audio(sampling_rate=22050))

音频样本

  • 样本 1https://huggingface.co/datasets/committa/serena-synthetic-it-27h/resolve/main/wavs/000000-008999/000000.wav
  • 样本 2https://huggingface.co/datasets/committa/serena-synthetic-it-27h/resolve/main/wavs/009000-017999/012345.wav
  • 样本 3https://huggingface.co/datasets/committa/serena-synthetic-it-27h/resolve/main/wavs/018000-026999/021234.wav

伦理考虑

所有音频均为合成内容:由文本转语音模型输出,不复制任何真实人物的声音。不存在同意问题,但需注意录音可能被用于构建声音克隆工具,应妥善对待该数据集。

许可证

数据集以 CC-BY-4.0 发布(见 LICENSE 文件)。来源标注:

  • 音频:由流水线生成,版权归数据集作者所有。
  • 约 90% 的文本:改编自 Tatoeba 句子(CC-BY 2.0 FR,https://tatoeba.org),经过修改(人名替换、修正、重音)。
  • 约 10% 的文本:LLM 原创句子,版权归数据集作者所有。
搜集汇总
数据集介绍
serena-synthetic-it-27h 数据集图片
构建方式
在语音合成技术持续演进的背景下,高质量单说话人语料库对声学模型训练具有基础性支撑作用。该数据集以Qwen3-TTS-1.7B-Base模型为生成引擎,采用语音克隆模式进行合成,并通过qwen3-tts-dataset-generator构建端到端流水线,依次完成生成、验证、发音校验、响度归一化与发布等环节。文本语料由约九成经改编的Tatoeba意大利语句子与约一成原创大语言模型生成句子混合构成,所有音频均以固定合成参考音色、统一指令和采样参数生成,最终产出约2.95万条片段、总时长约27.3小时的22.05 kHz单声道WAV数据。
特点
该数据集在声学一致性与文本多样性之间取得平衡,其核心特征体现为单一合成音色贯穿全部片段,有效保障跨样本音色稳定性。音频统一归一化至-23 LUFS并完成静音修剪,采样率为22.05 kHz、位深16 bit,元数据采用管道符分隔的Piper兼容格式。语料覆盖会话、技术与文学等多种语域,且每条片段均经过词级与音素级双重自动校验,词错误率不超过0.25、音素错误率不超过0.30,最终语料的音素错误率中位数为0.167,整体质量分布集中可控。
使用方法
该数据集主要面向Piper等文本到语音系统的训练场景。使用时可将训练集与验证集元数据文件合并为单一metadata.csv,并将仓库根目录作为--dataset-dir参数传入Piper训练流程。在Python环境中,由于数据布局为普通文件而非AudioFolder结构,需借助pandas读取元数据文件,再通过datasets库构建数据集并将音频列转换为22.05 kHz采样率。音频文件按每子目录不超过九千条的方式组织,便于在Hugging Face Hub上直接克隆与部署,同时也适配本地训练与推理流程。
背景与挑战
背景概述
语音合成技术对高质量、大规模、领域适配的语音数据依赖甚深,意大利语等中低资源语种长期面临公开语音语料匮乏的困境。serena-synthetic-it-27h数据集由数据集作者依托qwen3-tts-dataset-generator管线构建,以Qwen3-TTS-1.7B-Base模型在声音克隆模式下生成约2.95万条、总时长近27.3小时的意大利语单说话人合成语音,采样率22.05kHz,响度归一至-23 LUFS,并提供Piper原生格式的元数据。该数据集以合成替代采集的思路,为Piper等轻量级TTS系统的训练与评测提供可复现、可追溯的资源,对缓解意大利语语音数据稀缺、推动合成数据在语音领域的规范化应用具有积极意义。
当前挑战
文本到语音合成所面对的核心问题,在于如何在有限且分布不均的语料条件下生成自然度、韵律与发音准确性俱佳的语音,而现有意大利语公开语料在规模、说话人一致性与标注规范上均难以充分支撑模型训练。构建本数据集时,合成语音需在约2.95万条样本间维持统一音色,同时经受词级与音素级双重自动校验的筛选,对生成管线的稳定性与一致性控制提出较高要求;转写文本约九成源自Tatoeba并经过人名替换、校正与重音修订,属于改编作品,其版权归属与衍生使用边界需审慎厘清;合成语音亦可能被用于构建声音克隆工具,数据发布方须在开放共享与滥用防范之间取得平衡。
常用场景
经典使用场景
在语音合成技术的演进脉络中,单说话人定制化语音系统的构建始终依赖于高质量、声学一致性卓越的语音语料库。serena-synthetic-it-27h数据集的核心经典使用场景,即聚焦于意大利语单说话人TTS声学模型的训练与微调,尤其适配Piper等轻量级端到端架构。其约27.3小时的合成语音、逾2.9万条片段、22.05kHz单声道WAV格式以及严格的响度归一化与静音修剪处理,共同构筑了一个声学特征高度稳定的训练场域。借助原生Piper格式的元数据,研究者可将该数据集直接作为目标说话人的语音基底,驱动声学模型在音素时长建模、基频轮廓预测及频谱包络拟合等关键环节实现高效收敛,从而生成自然流畅、音色统一的意大利语合成语音。
衍生相关工作
serena-synthetic-it-27h的诞生与迭代,深度嵌入于开源语音合成工具链的协同演进之中。其配套的qwen3-tts-dataset-generator管道,将生成、验证、发音校验、归一化与发布等环节整合为端到端工作流,为后续合成TTS数据集的构建提供了可复用的工程范式。围绕该数据集衍生的经典工作,涵盖基于Piper架构的意大利语声学模型微调实验、合成语音音素错误率与自然度感知的相关性分析,以及面向语音克隆伦理边界的合成数据治理框架探讨。这些工作共同拓展了合成语音数据在TTS训练、语音学实证研究与AI安全评估三重维度上的学术纵深,形成了从数据生产到应用反思的完整闭环。
数据集最近研究
最新研究方向
在低资源语音合成与语音克隆技术交织演进的背景下,serena-synthetic-it-27h数据集折射出合成语音数据驱动TTS训练的前沿趋势。当前研究聚焦于利用大模型(如Qwen3-TTS-1.7B-Base)在上下文学习模式下生成高一致性单说话人语音,以缓解意大利语等中等资源语言在Piper等轻量级TTS框架下的数据稀缺困境。该数据集通过词级与音素级双重自动校验机制控制合成质量,为合成语音的可靠性评估提供了可复现范式。其混合语料构建策略兼顾Tatoeba改编与LLM原创,回应了合成数据版权与多样性争议。相关研究正探索合成语音在跨语言迁移、伦理风险与声纹安全中的边界,对推动包容性语音技术及合成数据治理具有实证意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务