bengali-tts-folderized-parquet-stage1
收藏资源简介:
该数据集名为Bengali TTS Folderized Parquet Stage 1,是一个用于孟加拉语文本转语音任务的中间数据集。数据以Parquet格式存储,组织方式为按说话者文件夹划分,每个文件夹内包含多个Parquet分片文件(例如part-00000.parquet)以及一个元数据统计文件(stats.json)。数据集的核心特征是包含一个audio音频字段。此版本是一个修复过程,重用了已上传的Parquet分片并重建了紧凑的元数据。数据集适用于孟加拉语语音合成模型的训练或相关研究。
The dataset is named Bengali TTS Folderized Parquet Stage 1 and is an intermediate dataset for Bengali text-to-speech tasks. The data is stored in Parquet format and organized into speaker-specific folders, each containing multiple Parquet shard files (e.g., part-00000.parquet) along with a metadata statistics file (stats.json). The core feature of the dataset is an audio field. This version is a repair process that reuses previously uploaded Parquet shards and reconstructs compact metadata. The dataset is suitable for training Bengali speech synthesis models or related research.
数据集概述
- 名称: Bengali TTS Folderized Parquet Stage 1
- 语言: 孟加拉语 (bn)
- 标签: 文本转语音 (text-to-speech)、音频 (audio)、Parquet 格式、中间数据集 (intermediate-dataset)
- 配置:
- 配置名称:
govt_data - 默认配置: 是
- 数据文件: 训练集 (train) 位于
Govt Data/part-*.parquet
- 配置名称:
- 数据集特征:
audio: 音频数据
数据布局
- 数据按说话者组织为文件夹,结构如下:
<speaker>/part-00000.parquet<speaker>/part-00001.parquet<speaker>/metadata/stats.json
说明
- 该数据集为修复版本,复用了已上传的 Parquet 分片,并重建了紧凑的元数据。




