登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
ruwikIR19k
ruwikIR19k
收藏
Zenodo
2020-01-03 更新
2026-04-07 收录
多语言信息检索
数据链接:
https://zenodo.org/record/3707614
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Russian Information Retrieval dataset build with the wikIR tool.
应用场景:
提供机构:
FREJ Jibril
创建时间:
2020-01-03
相关数据集
mMARCO
多语言信息检索
深度学习评估
mMARCO是一个多语言版本的MS MARCO段落排序数据集,由坎皮纳斯大学神经网络实验室创建,包含13种语言。该数据集通过机器翻译创建,旨在解决非英语语言在信息检索任务中训练资源稀缺的问题。数据集包含超过53万条查询-段落相关对,适用于训练和评估深度学习模型。mMARCO的创建不仅丰富了多语言信息检索的训练资源,还通过零样本学习场景的评估,展示了其对提升模型效果的潜力。
arXiv
2022-08-18 更新
106
0
lemon-mint/mr-tydi-ko-all-prefixed
多语言信息检索
稠密检索训练
该数据集包含三个主要特征:anchor、positive和negative,每个特征的数据类型均为字符串。数据集仅包含一个训练集,共有131,700个样本,总大小为191,988,250字节。下载大小为52,482,755字节。数据集的配置名为default,数据文件路径为data/train-*。
Hugging Face
2024-07-02 更新
10
0
MetaCLIR
多语言信息检索
信息检索
此数据将文本元信息数据添加到两个现有的语料库中,以进行跨语言信息检索: BoostCLIR和大规模CLIR数据集 (wiki-clir)。
OpenDataLab
2026-07-12 更新
6
0
miracl/miracl
多语言信息检索
搜索技术
MIRACL(跨语言连续体的多语言信息检索)是一个多语言检索数据集,专注于18种不同语言的搜索,这些语言在全球范围内拥有超过30亿的母语使用者。该数据集包含16种已知语言的收集数据,另外2种惊喜语言的数据将在稍后发布。数据集的主题由每种语言的母语者生成,并且他们还会标记主题与给定文档列表之间的相关性。该存储库仅包含MIRACL的主题和qrels。数据集的结构包括主题和qrels,分别以.tsv和标
Hugging Face
2024-12-29 更新
28
0
mteb/NeuCLIR2023Retrieval_rus_top_250_only_w_correct-v2
多语言信息检索
俄语文本检索
该数据集包含三个配置:corpus、default和queries。corpus配置存储文本数据,default配置可能表示查询和文本之间的关系,queries配置存储查询文本数据。数据集包含测试集,适用于自然语言处理任务。
Hugging Face
2024-09-28 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广