登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
NaijaT5 corpus
NaijaT5 corpus
收藏
Zenodo
2025-01-02 更新
2026-04-07 收录
尼日利亚皮钦英语语料库
低资源语言模型训练
数据链接:
https://zenodo.org/doi/10.5281/zenodo.14585894
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
NaijaT5 corpus used to create https://huggingface.co/Uphando-ng/naija-t5-base
应用场景:
创建时间:
2025-01-02
相关数据集
Cantonese.md
粤语语料库
低资源语言模型训练
Cantonese.md是一个开源项目,致力于通过高质量的数据集保存和推广粤语。该项目以Markdown格式存储粤语成语(歇後語)等内容,旨在为大型语言模型提供高质量的粤语训练数据。
github
2026-04-28 更新
32
0
nassimjp/bactrian_ps
指令微调
低资源语言模型训练
--- dataset_info: features: - name: instruction dtype: string - name: input dtype: string - name: id dtype: string - name: output dtype: string splits: - name: train
Hugging Face
2026-04-18 更新
10
0
Nemotron-Pretraining-SFT_translated
斯洛文尼亚语机器翻译
低资源语言模型训练
本数据集是Nemotron Pretraining SFT数据的斯洛文尼亚语翻译版本,源数据取自nvidia/Nemotron-Pretraining-SFT-v1数据集的Nemotron-SFT-General子集,并进行了子采样。使用cjvt/GaMS-DPO-Translator模型进行自动翻译,包含约90万个文档,翻译后的斯洛文尼亚语文本约含8.89亿单词。每个样本包含以下字段:id(保留
Hugging Face
2026-07-21 更新
5
0
mozhi-ai/tamil-corpus
泰米尔语
低资源语言模型训练
mozhi-ai泰米尔语料库是一个持续更新的高质量泰米尔语言数据集,专门用于大型语言模型(LLM)的训练。该语料库收集了来自古典文学、维基百科、新闻和网络来源的文本,涵盖了多种领域和语言寄存器。数据集包含8,682个文档,总计4,958,322个字符和553,762个单词,经过严格的语言检测、Unicode标准化、去重和质量过滤处理。每个文档都标注了来源、许可证、收集日期、内容领域、语言寄存器、文
Hugging Face
2026-04-25 更新
10
0
NaijaT5 corpus
尼日利亚英语NLP
低资源语言模型训练
NaijaT5 corpus used to create https://huggingface.co/Uphando-ng/naija-t5-base
Zenodo
2025-01-02 更新
6
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广