登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
hau_newscrawl_2011
hau_newscrawl_2011
收藏
corpora.uni-leipzig.de
2025-03-25 收录
豪萨语
新闻语料库
数据链接:
https://corpora.uni-leipzig.de?corpusId=hau_newscrawl_2011
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Hausa news corpus based on material crawled in 2011
基于2011年爬取资料的豪萨语新闻语料库
应用场景:
提供机构:
corpora.uni-leipzig.de
相关数据集
hausa_voa_ner
实体识别
豪萨语
Hausa VOA NER语料库专注于豪萨语的命名实体识别任务,基于VOA豪萨语新闻语料构建。该语料库包含超过1000条样本,并提供了训练集、验证集和测试集划分。数据集中,每个样本都包含文本分词和对应的命名实体标签,标签类型包括人物、组织、地点和日期等。该语料库在CC-BY 4.0许可下发布,允许用户自由使用和共享。
Opencsg
2024-07-19 更新
22
0
smi_newscrawl_2011
萨米文化
新闻语料库
Sami news corpus based on material crawled in 2011
corpora.uni-leipzig.de
11
0
zha_wikipedia_2012
壮语
维基百科
Zhuang Wikipedia corpus based on material from 2012
corpora.uni-leipzig.de
8
0
bkai-foundation-models/BKAINewsCorpus
新闻语料库
语言模型预训练
BKAINewsCorpus数据集是基于Binhvq News Corpus扩展而来的越南新闻语料库,新增了1000万篇文章,最终形成了一个包含约3200万篇文章的语料库。数据集经过模糊去重处理,生成了53GB的干净数据,适用于大语言模型的持续预训练。
Hugging Face
2024-03-05 更新
16
0
tam_newscrawl_2011
泰米尔语
自然语言处理
Tamil news corpus based on material crawled in 2011
corpora.uni-leipzig.de
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广