登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
bumie-e/Yoruba-diacritics-vs-non-diacritics
bumie-e/Yoruba-diacritics-vs-non-diacritics
收藏
Hugging Face
2024-01-22 更新
2024-03-04 收录
约鲁巴语
变音符号恢复
数据链接:
https://hf-mirror.com/datasets/bumie-e/Yoruba-diacritics-vs-non-diacritics
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: gpl-3.0 ---
许可证:GNU通用公共许可证第3.0版(GPL-3.0)
应用场景:
提供机构:
bumie-e
原始信息汇总
许可证
类型
: GPL-3.0
相关数据集
Yankari
自然语言处理
约鲁巴语
Yankari数据集是由非洲语言保护中心创建的一个大规模单语种约鲁巴语数据集,旨在填补自然语言处理(NLP)领域中约鲁巴语资源的重大空白。该数据集包含51,407份文档,总计超过3000万Tokens,来源于13个不同的高质量来源,如新闻网站、博客和维基百科等。数据集的创建过程强调了伦理数据收集、严格的质量控制和语言真实性的保护,避免了宗教文本和机器翻译内容的使用。Yankari数据集的应用领域广
arXiv
2024-12-04 更新
139
0
ÌròyìnSpeech
语音识别
约鲁巴语
ÌròyìnSpeech是一个旨在增加高质量当代约鲁巴语语音数据量的新型语料库,适用于文本到语音(TTS)和自动语音识别(ASR)任务。该数据集由斯坦福大学等机构创建,包含约23000条从新闻和创意写作领域精选的文本句子,以及42小时的语音数据,由80名志愿者录制。数据集创建过程中,采用了参与式方法,将5000条句子提供给Mozilla Common Voice平台进行众包录音和验证。Ìròyìn
arXiv
2024-03-27 更新
9
0
menyo20k_mt
低资源机器翻译
约鲁巴语
MENYO-20k是一个多领域并行数据集,包含从新闻文章、TED演讲、电影剧本、广播稿、科技文章以及其他网络短文和专业翻译人员整理的文本。数据集规模为20,100个平行句子,分为10,070个训练句、3,397个开发句和6,633个测试句(包括3,419个多领域句子、1,714个新闻领域句子和1,500个TED演讲稿领域句子)。它主要用于英-约鲁巴语的翻译任务,并采用CC BY-NC 4.0非商业
OpenCSG
2024-07-19 更新
7
0
YOSM
情感分析
约鲁巴语
YOSM是首个针对尼日利亚电影评论的约鲁巴语情感语料库,由蒙特克莱尔州立大学创建。该数据集包含1500条电影评论,这些评论来自IMDB、Rotten Tomatoes等五个在线电影评论平台,涵盖了平衡的正面和负面评论。数据集的创建过程包括从英文评论中收集数据,然后由约鲁巴语母语者进行手动翻译。YOSM数据集主要应用于情感分析领域,旨在帮助电影制片人和观众了解电影的市场反应和观众情感,从而优化电影制
arXiv
2022-04-21 更新
21
0
shunyalabs/yoruba-speech-dataset
语音识别
约鲁巴语
--- dataset_info: features: - name: audio dtype: audio: sampling_rate: 16000 - name: transcript dtype: string splits: - name: train num_bytes: 2311876592.205 nu
Hugging Face
2025-08-25 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广