登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
AfroXLMR-29L corpus
AfroXLMR-29L corpus
收藏
Zenodo
2025-01-02 更新
2026-04-07 收录
非洲语言
多语言预训练
数据链接:
https://zenodo.org/doi/10.5281/zenodo.14585892
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
African corpus used to develop AfroXLMR-29L https://huggingface.co/Davlan/afro-xlmr-large-29L
应用场景:
创建时间:
2025-01-02
相关数据集
Afrivoice_Kinyarwanda
语音识别
非洲语言
非洲语音基尼亚鲁旺达语音识别数据集(Afrivoice Kinyarwanda ASR dataset),包含农业、教育、金融、政府和健康五个领域的图像、音频描述和转录数据。
Hugging Face
2025-09-09 更新
16
0
masakhane/afrimmlu
多语言问答
非洲语言
AFRIMMLU是一个评估数据集,包含将MMLU数据集的一部分翻译成15种非洲语言的版本。它包括所有17种语言的测试集,并保留了原始MMLU数据集中的英语和法语子集。数据集的结构包括问题、选项、答案和主题字段,并且每种语言都有验证集、开发集和测试集的分割。
Hugging Face
2025-04-15 更新
14
0
Additional file 4 of Automatic construction of generic Hausa language stop words list using term frequency-inverse document frequency
自然语言处理
非洲语言
Additional file 4
DataCite Commons
2024-12-16 更新
11
0
kf-embed-pretrain-corpus-700M
多语言预训练
自然语言处理
KF-Embed Pretraining Corpus 是一个用于预训练多语言嵌入模型的大规模数据集,特别强调对印度语言的支持。该数据集汇集了16个不同的开源数据集,包含7.1亿个(查询,正例)对,覆盖50多种语言,总大小为128GB。每个记录包含三个字段:'source'(来源数据集标识)、'query'(查询文本如标题、问题等)和'positive'(相关联的长文本如文章正文、答案等)。数据集
Hugging Face
2026-04-13 更新
15
0
michsethowusu/ganda-wolof_sentence-pairs
非洲语言
自然语言处理
Ganda-Wolof句子对数据集包含非洲语言句子对及其相似度评分,适用于机器翻译、句子对齐等自然语言处理任务。数据集的每一行由三个字段组成:相似度评分(介于0到1之间),Ganda语言句子和Wolof语言句子。
Hugging Face
2025-04-02 更新
11
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广