官方服务:
资源简介:
speech-datasets-praneeth
普拉尼特语音数据集(speech-datasets-praneeth)
应用场景:
创建时间:
2023-06-15
相关数据集
Nexdata/accented_english
--- YAML tags: - copy-paste the tags obtained with the tagging app: https://github.com/huggingface/datasets-tagging task_categories: - automatic-speech-recognition language: - en --- # Dataset Card f
Hugging Face2023-11-22 更新1120
glenn2/voice_breaths
--- dataset_info: features: - name: audio dtype: audio: sampling_rate: 48000 - name: sentence dtype: string splits: - name: train num_bytes: 55098221109.05 num_
Hugging Face2024-04-13 更新280
minato-ryan/emilia-cjk-xcodec2
该数据集包含多个配置(ja_long,ja_short,ja_skipped,ja_very_long),每个配置都有如uid、dnsmos、时长、语言、说话人、文本、wav文件和ids等特征。每个配置的训练分割都包含了示例数量和字节数的信息。此外,还提供了每个配置的下载大小和数据集大小。
Hugging Face2025-10-24 更新110
ASR-CCantCSC: A Chinese Cantonese (Canton) Conversational Speech Corpus
This open-source dataset consists of 4.25 hours of transcribed Guangzhou Cantonese conversational speech on certain topics, where ten conversations between ten pairs of speakers were contained.
MagicHub开源社区2021-03-18 更新370
filipinospeechcorpus
菲律宾语音语料库(Filipino Speech Corpus, FSC)是一个用于自动语音识别(ASR)和文本转语音(TTS)任务的句子级语音数据集。该数据集以Hugging Face Parquet格式存储,包含16kHz单声道音频片段。数据集总大小约为6GB,由139个分片组成。每个样本包含音频文件、对应的文本转录、音频时长、单词数量、说话者ID、性别、年龄组、语音类型(朗读/自发/机器生成
Hugging Face2026-03-22 更新240



