登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
ASR-TEDLIUM: An English Speech Corpus from TED-LIUM
ASR-TEDLIUM: An English Speech Corpus from TED-LIUM
收藏
MagicHub开源社区
2021-07-06 更新
2024-06-08 收录
自动语音识别
语音语料库
数据链接:
https://magichub.com/datasets/english-speech-corpus-from-ted-lium/
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
About this resource:
应用场景:
创建时间:
2021-07-06
相关数据集
CL-MASR
自动语音识别
持续学习
CL-MASR是一个为研究多语言自动语音识别在持续学习环境下表现而设计的基准。它提供了一系列持续学习方法,这些方法基于大规模预训练的ASR模型,并配有常用指标来评估学习新语言时的有效性,同时解决灾难性遗忘问题。
arXiv
2023-10-26 更新
38
0
keystats/swahili_asr_data
自动语音识别
这是一个包含斯瓦希里语音频和对应转录文本的数据集,适用于自动语音识别和文本到音频的任务。数据集分为训练集和验证集,总共包含约101.99 GB的数据,下载大小约为9.48 GB。
Hugging Face
2025-11-08 更新
12
0
BD-4SK-ASR (Basic Dataset for Sorani Kurdish Automatic Speech Recognition)
自动语音识别
库尔德语处理
The Basic Dataset for Sorani Kurdish Automatic Speech Recognition (BD-4SK-ASR) 是一个用于 Sorani Kurdish 自动语音识别的数据集。我们提出了一个实验数据集,即 Sorani Kurdish 自动语音识别基本数据集 (BD-4SK-ASR),它我们第一次尝试为 Sorani Kurdish 开发自动语音识别。
OpenDataLab
2026-07-12 更新
8
0
pasketti
语音识别
自动语音识别
该数据集名为'On Top of Pasketti — Children's Word ASR (Training Data)',是一个用于儿童语音自动识别(ASR)任务的训练数据集。数据集包含95,572条语音样本,总时长约185.4小时,音频格式为FLAC。每条样本包含多个字段:utterance_id(唯一标识符)、child_id(匿名说话者标识符)、session_id(录音会话标识符)
Hugging Face
2026-02-19 更新
26
0
MothersTongue/mother_tongue_dataset
自动语音识别
Shona语
该数据集包含音频和句子两个特征,音频的采样率为16000Hz,句子为字符串类型。数据集分为训练集,包含240个样本,总大小为57965401字节。数据集用于自动语音识别任务,语言为绍纳语(Shona),数据集的名称为learn shona,许可证为MIT。
Hugging Face
2024-06-18 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广