irds/beir_msmarco_train
收藏资源简介:
--- pretty_name: '`beir/msmarco/train`' viewer: false source_datasets: ['irds/beir_msmarco'] task_categories: - text-retrieval --- # Dataset Card for `beir/msmarco/train` The `beir/msmarco/train` dataset, provided by the [ir-datasets](https://ir-datasets.com/) package. For more information about the dataset, see the [documentation](https://ir-datasets.com/beir#beir/msmarco/train). # Data This dataset provides: - `queries` (i.e., topics); count=502,939 - `qrels`: (relevance assessments); count=532,751 - For `docs`, use [`irds/beir_msmarco`](https://huggingface.co/datasets/irds/beir_msmarco) ## Usage ```python from datasets import load_dataset queries = load_dataset('irds/beir_msmarco_train', 'queries') for record in queries: record # {'query_id': ..., 'text': ...} qrels = load_dataset('irds/beir_msmarco_train', 'qrels') for record in qrels: record # {'query_id': ..., 'doc_id': ..., 'relevance': ..., 'iteration': ...} ``` Note that calling `load_dataset` will download the dataset (or provide access instructions when it's not public) and make a copy of the data in 🤗 Dataset format. ## Citation Information ``` @inproceedings{Bajaj2016Msmarco, title={MS MARCO: A Human Generated MAchine Reading COmprehension Dataset}, author={Payal Bajaj, Daniel Campos, Nick Craswell, Li Deng, Jianfeng Gao, Xiaodong Liu, Rangan Majumder, Andrew McNamara, Bhaskar Mitra, Tri Nguyen, Mir Rosenberg, Xia Song, Alina Stoica, Saurabh Tiwary, Tong Wang}, booktitle={InCoCo@NIPS}, year={2016} } @article{Thakur2021Beir, title = "BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models", author = "Thakur, Nandan and Reimers, Nils and Rücklé, Andreas and Srivastava, Abhishek and Gurevych, Iryna", journal= "arXiv preprint arXiv:2104.08663", month = "4", year = "2021", url = "https://arxiv.org/abs/2104.08663", } ```
--- 数据集友好名称: '`beir/msmarco/train`' 查看器: 禁用 源数据集: ['irds/beir_msmarco'] 任务类别: - 文本检索(text-retrieval) --- # 数据集卡片:`beir/msmarco/train` 本数据集`beir/msmarco/train`由[ir-datasets](https://ir-datasets.com/)工具包提供。如需了解该数据集的详细信息,请参阅[官方文档](https://ir-datasets.com/beir#beir/msmarco/train)。 # 数据集内容 本数据集包含以下内容: - `queries`(即查询主题):共计502,939条 - `qrels`(即相关性标注):共计532,751条 - 如需加载`docs`(文档),请使用 [`irds/beir_msmarco`](https://huggingface.co/datasets/irds/beir_msmarco)。 ## 使用方法 python from datasets import load_dataset queries = load_dataset('irds/beir_msmarco_train', 'queries') for record in queries: record # {'query_id': ..., 'text': ...} qrels = load_dataset('irds/beir_msmarco_train', 'qrels') for record in qrels: record # {'query_id': ..., 'doc_id': ..., 'relevance': ..., 'iteration': ...} 注:调用`load_dataset`将下载该数据集(若数据集未公开,则会提供访问指引),并将其转换为🤗 Dataset格式的副本。 ## 引用信息 @inproceedings{Bajaj2016Msmarco, title={MS MARCO: A Human Generated MAchine Reading COmprehension Dataset}, author={Payal Bajaj, Daniel Campos, Nick Craswell, Li Deng, Jianfeng Gao, Xiaodong Liu, Rangan Majumder, Andrew McNamara, Bhaskar Mitra, Tri Nguyen, Mir Rosenberg, Xia Song, Alina Stoica, Saurabh Tiwary, Tong Wang}, booktitle={InCoCo@NIPS}, year={2016} } @article{Thakur2021Beir, title = "BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models", author = "Thakur, Nandan and Reimers, Nils and Rücklé, Andreas and Srivastava, Abhishek and Gurevych, Iryna", journal= "arXiv preprint arXiv:2104.08663", month = "4", year = "2021", url = "https://arxiv.org/abs/2104.08663", }
数据集概述
数据集名称
beir/msmarco/train
数据集来源
由ir-datasets包提供。
数据集内容
- queries:查询语句,数量为502,939。
- qrels:相关性评估,数量为532,751。
- docs:文档数据,需从
irds/beir_msmarco获取。
数据集使用示例
python from datasets import load_dataset
queries = load_dataset(irds/beir_msmarco_train, queries) for record in queries: record # {query_id: ..., text: ...}
qrels = load_dataset(irds/beir_msmarco_train, qrels) for record in qrels: record # {query_id: ..., doc_id: ..., relevance: ..., iteration: ...}
引用信息
@inproceedings{Bajaj2016Msmarco, title={MS MARCO: A Human Generated MAchine Reading COmprehension Dataset}, author={Payal Bajaj, Daniel Campos, Nick Craswell, Li Deng, Jianfeng Gao, Xiaodong Liu, Rangan Majumder, Andrew McNamara, Bhaskar Mitra, Tri Nguyen, Mir Rosenberg, Xia Song, Alina Stoica, Saurabh Tiwary, Tong Wang}, booktitle={InCoCo@NIPS}, year={2016} } @article{Thakur2021Beir, title = "BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models", author = "Thakur, Nandan and Reimers, Nils and Rücklé, Andreas and Srivastava, Abhishek and Gurevych, Iryna", journal= "arXiv preprint arXiv:2104.08663", month = "4", year = "2021", url = "https://arxiv.org/abs/2104.08663", }




