遇见数据集

ACV_speech

收藏
github2026-06-05 更新2026-06-11 收录
官方服务:

资源简介:

ACV_speech是一个用于TTS(文本到语音)的公共语音数据集,目前提供的是普通话中文语音数据集,适用于ACV-001,其他语言和ACV-002的语音变体仍在制作中。数据集包含原始、未处理的录音,按句子分割为16位44.1kHz的wav格式,以及csv格式的转录和显示数据来源的内容列表。数据来源于网络小说和诗歌。

ACV_speech is a public speech dataset for Text-to-Speech (TTS). Currently, it provides Mandarin Chinese speech datasets compatible with ACV-001, while speech variants for other languages and ACV-002 are still under development. The dataset contains raw, unprocessed audio recordings split by sentences into 16-bit, 44.1kHz WAV format, along with CSV-formatted transcriptions and a content list that indicates the data sources. The data is sourced from online novels and poems.

创建时间:
2026-06-05
原始信息汇总

数据集概述

  • 名称:ACV_speech
  • 用途:面向文本转语音(TTS)使用的公开语音数据集。
  • 语言:当前提供的是普通话(Mandarin Chinese)语音数据集。
  • 数据来源:网络小说和诗歌。

数据集内容

  • 音频格式:原始未经处理的录音,按句子切分,采用 16 位、44.1kHz 的 WAV 格式。
  • 标注文件:包含 CSV 格式的转写文本,以及展示数据来源的内容列表。
  • 数据样例:内容列表以编号形式记录句子原文及出处,例如:
    • 001,我有一座恐怖屋,一,暮陽中學。作者,我會修空調
    • 002,每個人心中都有一口深不可測的井,井裏埋藏著無法言説不堪回首的記憶

相关项目

  • 该数据集为项目 ACV-001 设计。
  • 其他语言数据集以及专为 ACV-002 设计的语音变体仍在制作中。

致谢

  • 声音提供者:Jonathan Huang 黃奕晨(ArchiVoice 所有者)。

许可协议

  • 许可证类型CC BY-SA 4.0
  • 版权归属:© 2026 YiChen Huang(Archivoice
  • 适用范围
    • 该许可证仅适用于直接使用该数据集以及主要基于 ACV_speech 声音训练的模型。
    • 不适用于通过并行训练方式训练的模型。
    • 以 ACV_speech 作为补充数据训练的模型,可遵循其自身的许可证。
搜集汇总
数据集介绍
ACV_speech 数据集图片
构建方式
在语音合成技术不断演进的时代背景下,高质量、多语种的公开语音数据集对于推动文本到语音(TTS)模型的发展具有至关重要的作用。ACV_speech 数据集专为普通话语音合成而设计,其构建方式严谨而系统:原始录音由专业声音提供者以16位、44.1kHz的WAV格式逐句采集,未经任何后期处理,确保了音频的保真度。每个句子的录音均对应一份CSV格式的转录文本,详细记录了每一条语音的文本内容及来源,数据源主要取自网络小说与诗歌,从而为模型训练提供了丰富的韵律和情感变化。
特点
该数据集的核心特色在于其原始性与纯净性。所有录音均以未加工的状态呈现,避免了预处理可能带来的信号失真,使研究者能够基于最真实的语音特征进行模型训练与微调。音频与转录文本的严格一一对应关系,简化了数据清洗和对齐流程。此外,数据集附带的来源清单使用户可以追溯每一条语音的文本出处,这对于研究不同文学风格对合成语音自然度的影响提供了宝贵的视角。
使用方法
使用ACV_speech数据集时,研究人员可以直接将16位44.1kHz的WAV文件作为TTS模型的输入音频,配合CSV格式的转录文本进行声学特征提取与音素对齐。对于专注于ACV-001或ACV-002架构的开发者,该数据集提供了直接可用的训练与评估基础。由于数据采用宽松的CC BY-SA 4.0许可协议,用户在遵守署名与相同方式共享条款的前提下,可自由地在非商业或商业项目中使用、修改及分发该数据集。
背景与挑战
背景概述
ACV_speech 数据集由黄奕晨(Jonathan Huang)于2026年创建,归属于 ArchiVoice 项目,旨在为文本转语音(TTS)系统提供公开的语音数据。该数据集聚焦于普通话中文语音,原始录音以16位44.1kHz WAV格式逐句分割,并附带CSV格式的转录文本及数据来源列表。数据主要源自网络小说和诗歌,如《我有一座恐怖屋》等作品,为多语言 TTS 研究奠定了语料基础。作为 ACV-001 和 ACV-002 模型的核心语音资源,该数据集填补了非商业领域高质量中文语音数据的空白,对推动个性化语音合成及跨语言 TTS 技术发展具有重要影响力。
当前挑战
当前 ACV_speech 数据集面临的挑战主要包括三方面:其一,领域问题上,TTS 系统对语音的自然度、韵律和情感表达要求极高,而单一来源的网络小说与诗歌语料难以覆盖多样化的口语场景,可能导致合成语音缺乏泛化性。其二,构建过程中,原始录音未经处理(raw recordings),环境噪声、发音变异等缺陷需依赖后期矫正,增加了数据清洗与标注的成本。其三,其他语言及 ACV-002 的语音变体仍处于制作阶段,多语言扩展的滞后限制了数据集在跨语言 TTS 研究的应用潜力。此外,CC BY-SA 4.0 许可协议对并行训练模型的豁免条款,也可能引发版权合规与学术使用边界的争议。
常用场景
经典使用场景
ACV_speech数据集专为文本到语音(TTS)合成任务而设计,在中文语音合成领域具有典型应用价值。该数据集包含以16位44.1kHz WAV格式存储的原始语音片段,每段录音均对应经由网络小说与诗歌转录的文本标注,适用于构建端到端的神经TTS模型。研究人员可借助该数据集训练语音合成系统,实现从文本到自然流畅中文语音的映射,尤其适合文学性、叙事性内容的语音生成场景,为个性化语音助手的开发提供了高质量的发音数据基础。
解决学术问题
该数据集有效解决了中文TTS研究中高质量、多领域语音数据稀缺的瓶颈问题。传统开源中文语音数据集多集中于朗读式或命令式语音,缺乏涵盖网络文学、诗歌等多样文体的精细化标注语料。ACV_speech通过提供带有原始录音与精确转录的配对数据,支持研究者探索韵律建模、情感表达与风格迁移等学术难题,推动了非标准文本(如小说对话、诗歌节奏)到语音的自然转换研究,对提升合成语音的自然度与表现力具有重要理论意义。
衍生相关工作
ACV_speech数据集直接关联并服务于ACV系列语音模型项目,如ACV-001与ACV-002,为其提供了基础的中文语音训练材料。该数据集还可用于调优诸如FastSpeech、Tacotron等经典TTS架构在中文场景下的表现,或作为多说话人语音合成研究的辅助数据源。未来工作可围绕该数据集构建跨语种语音合成系统,或探索与情感标签结合的情感语音生成,进而衍生出针对特定文学体裁(如悬疑、诗歌)的专用语音模型,丰富内容创作的声学表达维度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务