BeIR/quora-generated-queries
收藏资源简介:
BEIR Benchmark是一个异构的基准测试,由18个不同的数据集组成,涵盖了9种信息检索任务,包括事实核查、问答、生物医学信息检索等。所有数据集均为英文,并且已经过预处理,可以直接用于实验。数据集的结构包括corpus、queries和qrels文件,分别用于存储文档、查询和相关判断。
BEIR Benchmark is a heterogeneous benchmark consisting of 18 distinct datasets, covering 9 information retrieval tasks including fact checking, question answering, biomedical information retrieval and others. All datasets are in English and have been preprocessed for direct experimental use. The dataset structure includes corpus, queries and qrels files, which are used to store documents, queries and relevance judgments respectively.
BEIR Benchmark 数据集概述
数据集描述
数据集摘要
BEIR是一个异构基准,由18个不同数据集组成,涵盖9种信息检索任务,包括事实检查、问答、生物医学信息检索等。
支持的任务和排行榜
BEIR支持多种任务,包括文本检索、零样本检索、信息检索等,并提供排行榜以评估模型性能。
语言
所有任务均使用英语。
数据集结构
数据实例
BEIR数据集包含三个主要部分:文档库、查询和相关性判断文件。文档库和查询以.jsonl格式存储,相关性判断以.tsv格式存储。
数据字段
- 文档库:包含文档ID、标题和文本。
- 查询:包含查询ID和查询文本。
- 相关性判断:包含查询ID、文档ID和相关性分数。
数据分割
数据集根据不同任务和数据集进行分割,如MSMARCO、TREC-COVID等,每个数据集的查询数量、文档数量和相关性判断数量各不相同。
数据集创建
数据来源
数据集由多个现有数据集组成,但具体的数据收集和标准化过程未详细说明。
注释信息
数据集的注释过程、注释者和个人敏感信息处理未详细说明。
使用数据集的考虑
社会影响
数据集的社会影响、潜在偏见和其他已知限制未详细说明。
附加信息
数据集管理员
数据集管理员信息未详细说明。
许可信息
数据集使用CC-BY-SA-4.0许可。
引用信息
引用此数据集时,应使用提供的引用格式。
贡献者
感谢@Nthakur20为数据集的贡献。




