登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
AfroMAFT unpre-processed
AfroMAFT unpre-processed
收藏
Zenodo
2022-08-15 更新
2026-04-07 收录
非洲语言语料库
多语言自然语言处理
数据链接:
https://zenodo.org/record/6993547
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Unpre-processed mC4 and news corpus we used for the MAFAND paper
应用场景:
提供机构:
Jesujoba O. Alabi; Saarland University
创建时间:
2022-08-15
相关数据集
Skywork/ChineseDomainModelingEval
多语言自然语言处理
模型评估
Skywork/ChineseDomainModelingEval是中文领域建模能力评测数据集,我们对多个领域筛选出2023年9月份-2023年10月份新发布的几百到上千篇高质量文章,并人工进行了核对。测试数据的来源也足够广泛,质量也高。我们可以选取当前最新的文章评测不同模型的Perplexity,模型很难作弊。并且我们会持续按照最新数据评测各个模型效果,动态更新各个模型能力。
Hugging Face
2023-11-02 更新
50
0
duwuonline/UIT-VSMEC
情感分析
多语言自然语言处理
该数据集来自UIT(信息技术大学),包含7个类别:其他、厌恶、享受、愤怒、惊讶、悲伤、恐惧。数据集的语言为越南语,主要用于情感分类任务。
Hugging Face
2023-08-28 更新
16
0
ai4bharat/IndicQA-devanagari
印度语言问答系统
多语言自然语言处理
indicqa数据集包含了三个配置:indicqa.gu、indicqa.ml和indicqa.ta。每个配置都由上下文、问题、ID和答案组成,其中答案包括答案的起始位置和文本。该数据集适用于问答系统的研究和开发。
Hugging Face
2025-01-03 更新
6
0
PL-Mix
有毒内容检测
多语言自然语言处理
PL-Mix 是一个平衡的波兰语数据集,专为训练和评估提示级别有害性分类器而设计。该数据集包含 1,040 个提示,均等地分为有害(520)和无害(520)样本,并采用 80/20 分层训练-测试分割。PL-Mix 旨在解决波兰语有害提示检测领域公开可用、平衡且语言多样资源的缺乏问题,支持波兰语言模型的安全性分类和机械可解释性方法研究。 数据集结构方面,每个样本包含以下字段:`text`(波兰语
Hugging Face
2026-02-03 更新
22
0
MERA-evaluation/ruVQA
视觉问答
多语言自然语言处理
ruVQA是一个用于俄语的公开视觉问答(VQA)数据集,包含真实照片和抽象插图两种类型的图像。问题分为简单和复杂两类,涵盖了多种类型如二元、比较、数量、地点、方式、哪个、什么、谁等。简单问题仅需基于图像的感知,而复杂问题则需要推理步骤。数据集中的图像均来自公开资源,包括真实照片和卡通抽象图像。数据集旨在测试模型在不同类型图像中区分对象、理解不同问题类型并基于图像生成简短答案的能力。
Hugging Face
2024-12-11 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广