登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
castorini/prebuilt-indexes-mmeb
castorini/prebuilt-indexes-mmeb
收藏
Hugging Face
2026-03-03 更新
2026-02-07 收录
数据链接:
https://hf-mirror.com/datasets/castorini/prebuilt-indexes-mmeb
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
应用场景:
提供机构:
castorini
相关数据集
castorini/webis-touche2020-v3
文本检索
文档检索
该数据集专为文本检索任务设计,包含三个不同的配置以适应不同的数据处理需求。默认配置用于测试集,记录了查询ID、文档ID及其相关分数。语料库配置提供了大量文档的详细信息,包括ID、标题和文本内容。查询配置则专注于记录查询的ID和文本内容。数据集的原始数据来源于BeIR/webis-touche2020,适用于进行文档检索的算法开发和评估。
Hugging Face
2024-05-17 更新
65
0
castorini/triviaqa_gar-t5_expansions
问答系统
自然语言处理
该数据集提供了使用gar-T5模型对Trivia QA语料库的答案、标题和句子进行扩展的结果。数据集包含开发集(dev)和测试集(test),每个集合的数据条目包括ID、预测答案、预测标题和预测句子。
Hugging Face
2022-02-17 更新
30
0
castorini/mr-tydi-corpus
自然语言处理
文本检索
Mr. TyDi是一个多语言基准数据集,基于TyDi构建,涵盖11种类型多样的语言,包括阿拉伯语、孟加拉语、英语、芬兰语、印尼语、日语、韩语、俄语、斯瓦希里语、泰卢固语和泰语。该数据集专门用于单语检索,特别是评估学习到的密集表示的排名。数据集的唯一配置是语言,所有三个折叠(训练、开发和测试)共享相同的语料库,因此每个语言下只有一个训练折叠。
Hugging Face
2022-10-12 更新
21
0
castorini/odqa-wiki-corpora
信息检索
自然语言处理
--- annotations_creators: - no-annotation language: - en language_creators: [] license: - cc-by-sa-3.0 multilinguality: - monolingual pretty_name: Open-Domain Question Answering Wikipedia Corpora size
Hugging Face
2023-01-05 更新
36
0
castorini/afriberta-corpus
自然语言处理
非洲语言
AfriBERTas Corpus数据集是用于训练AfriBERTa模型的语料库,数据主要来源于BBC新闻网站,部分语言的数据来自Common Crawl。该数据集支持多种非洲语言,包括阿法尔语、阿姆哈拉语、豪萨语等。每个数据点包含id和text字段,数据集分为训练集和测试集,且每个语言的数据集大小不一。使用该数据集时需要注意数据可能存在的偏见,因为大部分数据来自新闻网站,模型可能会偏向新闻领域。
Hugging Face
2022-10-19 更新
30
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广