irds/mmarco_zh_train
收藏资源简介:
`mmarco/zh/train`数据集由`ir-datasets`包提供,主要用于文本检索任务。该数据集包含808,731个查询(`queries`)、532,761个相关性评估(`qrels`)和39,780,811个文档对(`docpairs`)。用户可以通过Python代码加载这些数据,并按照提供的格式进行处理。
The `mmarco/zh/train` dataset, provided by the `ir-datasets` package, is primarily intended for text retrieval tasks. This dataset contains 808,731 queries, 532,761 relevance judgments (qrels), and 39,780,811 document pairs (docpairs). Users can load these data via Python code and process them in accordance with the provided format.
数据集概述
数据集名称
mmarco/zh/train
数据来源
- 源数据集:
irds/mmarco_zh
任务类别
- 文本检索
数据内容
queries(查询):808,731条qrels(相关性评估):532,761条docpairs(文档对):39,780,811对
使用方法
python from datasets import load_dataset
queries = load_dataset(irds/mmarco_zh_train, queries) for record in queries: record # {query_id: ..., text: ...}
qrels = load_dataset(irds/mmarco_zh_train, qrels) for record in qrels: record # {query_id: ..., doc_id: ..., relevance: ..., iteration: ...}
docpairs = load_dataset(irds/mmarco_zh_train, docpairs) for record in docpairs: record # {query_id: ..., doc_id_a: ..., doc_id_b: ...}
引用信息
@article{Bonifacio2021MMarco, title={{mMARCO}: A Multilingual Version of {MS MARCO} Passage Ranking Dataset}, author={Luiz Henrique Bonifacio and Israel Campiotti and Roberto Lotufo and Rodrigo Nogueira}, year={2021}, journal={arXiv:2108.13897} }




