BeIR/msmarco-qrels
收藏资源简介:
BEIR是一个异构的基准测试集,由18个不同的数据集组成,涵盖了9种信息检索任务,包括事实核查、问答、生物医学信息检索、新闻检索、论点检索、重复问题检索、引用预测、推文检索和实体检索。所有任务均为英文。数据集的结构包括corpus、queries和qrels文件,分别用于存储文档、查询和查询与文档的相关性判断。这些数据集已经过预处理,可以直接用于实验。
BEIR is a heterogeneous benchmark dataset composed of 18 distinct datasets, covering 9 information retrieval tasks including fact checking, question answering, biomedical information retrieval, news retrieval, argument retrieval, duplicate question retrieval, citation prediction, tweet retrieval, and entity retrieval. All tasks are in English. The dataset structure includes corpus, queries and qrels files, which are respectively used to store documents, queries, and relevance judgments between queries and documents. These datasets have been preprocessed and can be directly used for experiments.
数据集概述
名称: BEIR Benchmark
描述: BEIR是一个异构基准,包含18个不同数据集,代表9种信息检索任务。
语言: 英语 (en)
许可证: CC-BY-SA-4.0
多语言性: 单语
任务类别:
- 文本检索
- 零样本检索
- 信息检索
- 零样本信息检索
任务ID:
- 段落检索
- 实体链接检索
- 事实检查检索
- 推文检索
- 引用预测检索
- 重复问题检索
- 论点检索
- 新闻检索
- 生物医学信息检索
- 问答检索
数据集结构
数据实例:
- 语料库:
.jsonl文件,包含文档ID、标题和文本。 - 查询:
.jsonl文件,包含查询ID和文本。 - qrels:
.tsv文件,包含查询ID、文档ID和评分。
数据字段:
- 语料库:
_id(文档ID),title(标题),text(文本) - 查询:
_id(查询ID),text(查询文本) - qrels:
query-id(查询ID),corpus-id(文档ID),score(评分)
数据集创建
许可证信息: CC-BY-SA-4.0
引用信息:
@inproceedings{ thakur2021beir, title={{BEIR}: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models}, author={Nandan Thakur and Nils Reimers and Andreas R{"u}ckl{e} and Abhishek Srivastava and Iryna Gurevych}, booktitle={Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track (Round 2)}, year={2021}, url={https://openreview.net/forum?id=wCu6T5xFjeJ} }
贡献者: @Nthakur20




