登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Diacritic Restoration in Yoruba Language
Diacritic Restoration in Yoruba Language
收藏
kaggle
2022-01-23 更新
2024-03-07 收录
语言处理
约鲁巴语
数据链接:
https://www.kaggle.com/datasets/welcomehere/restoringdiacritics2
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
A project on diacritic restoration of languages
一项致力于语言变音符号恢复(diacritic restoration)的项目
应用场景:
创建时间:
2022-01-23
相关数据集
yodas_owsmv4
语音识别
语言处理
该数据集包含了跨越75种语言的166,000小时的多种语言语音,被分割成30秒的长格式音频片段。数据来源于YODAS2数据集,该数据集基于大规模的网络爬取内容。由于网络源数据的性质,原始的YODAS2数据集可能包含不准确的语言标签和音频-文本对不齐的情况。为了解决这一问题,我们开发了一个可扩展的数据清洗管道,使用公开可用的工具包,从而形成原始数据集的一个精选子集。这个清洗后的数据集是我们OWSM
Hugging Face
2025-06-03 更新
32
0
中英混读手机采集语音数据【数据堂】
语音识别
语言处理
1,535小时中英混读手机采集语音数据由3972名中国本土人员参与录制,口音覆盖七大方言区。录音文本均为中英混合句子,涵盖通用场景及人机交互场景,内容丰富,转写精准。可用于改善语音识别系统对中英混读语音的识别效果。
OpenDataLab
2023-12-20 更新
14
0
fMRI Neural Activation Data
神经科学
语言处理
该数据集包含了来自5名受试者的功能性磁共振成像(fMRI)神经激活数据,这些数据是通过两个实验获得的,实验中使用了168段语言刺激来研究大脑反应。这两个实验旨在保持语义相关性,该数据集被用于评估在神经解码中预测语言刺激的双边匹配性能。数据规模涉及5名受试者,总计672个作为刺激呈现的句子。任务是通过大脑活动来预测语言刺激的神经解码。
arXiv
10
0
cz_corpus
语言处理
捷克语研究
该数据集是为词类比任务设计的,用于检查捷克语词汇和短语的句法、形态句法和语义属性。数据集可供研究社区使用,支持Word2Vec和GloVe算法进行实验。
github
2021-12-31 更新
28
0
Australian Radio Talkback Corpus (ART)
广播转录
语言处理
Australian Radio Talkback (ART) is a set of transcribed recordings of samples of national, regional and commercial Australian talkback radio from 2004 to 2006. It consists of transcriptions of 27 audi
figshare.mq.edu.au
2024-04-24 更新
12
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广