遇见数据集

BeIR/trec-news-generated-queries

收藏
Hugging Face2022-10-23 更新2024-03-04 收录
官方服务:

资源简介:

BEIR Benchmark是一个异构的基准测试,由18个不同的数据集组成,代表了9种信息检索任务。这些任务包括事实核查、问答、生物医学信息检索、新闻检索、论点检索、重复问题检索、引用预测、推文检索和实体检索。所有数据集均为英文,并已预处理,可用于实验。数据集包含corpus、queries和qrels三个部分,分别用于存储文档、查询和查询与文档的相关性判断。数据集支持多种信息检索任务,并提供了一个排行榜来评估模型在这些任务上的表现。

BEIR Benchmark is a heterogeneous benchmark composed of 18 distinct datasets, representing 9 information retrieval tasks. These tasks include fact checking, question answering, biomedical information retrieval, news retrieval, argument retrieval, duplicate question retrieval, citation prediction, tweet retrieval, and entity retrieval. All datasets are in English and have been preprocessed for experimental use. The datasets include three core components: corpus, queries, and qrels, which are respectively used to store documents, queries, and relevance judgments between queries and documents. This benchmark supports multiple information retrieval tasks and provides a leaderboard for evaluating model performance on these tasks.

提供机构:
BeIR
原始信息汇总

BEIR Benchmark 数据集概述

数据集描述

数据集总结

BEIR是一个异构基准,由18个不同的数据集组成,代表9个信息检索任务,包括事实检查、问答、生物医学信息检索、新闻检索等。所有这些数据集都经过预处理,可供实验使用。

支持的任务和排行榜

该数据集支持一个排行榜,评估模型在特定任务上的表现,如F1或EM,以及从维基百科检索支持信息的能力。当前表现最佳的模型可在此处找到。

语言

所有任务均为英语。

数据集结构

所有BEIR数据集必须包含语料库、查询和qrels(相关性判断文件),格式如下:

  • corpus文件:.jsonl格式,包含一系列字典,每个字典包含三个字段:_id(唯一文档标识符)、title(文档标题,可选)和text(文档段落或段落文本)。
  • queries文件:.jsonl格式,包含一系列字典,每个字典包含两个字段:_id(唯一查询标识符)和text(查询文本)。
  • qrels文件:.tsv格式,包含三个列:query-idcorpus-idscore,按此顺序排列。

数据实例

数据集示例包括:

  • corpus:文档标题和文本内容。
  • queries:查询文本。
  • qrels:查询与文档的相关性判断。

数据字段

  • corpus:包含_id(文档ID)、title(标题)和text(文本)。
  • queries:包含_id(查询ID)和text(查询文本)。
  • qrels:包含_id(查询ID)、_id(文档ID)和score(相关性评分)。

数据分割

数据集根据不同的任务和类型进行分割,如训练集、开发集和测试集,具体信息请参阅数据集详情。

搜集汇总
数据集介绍
BeIR/trec-news-generated-queries 数据集图片
构建方式
在信息检索领域,零样本评估是衡量模型泛化能力的关键挑战。BeIR/trec-news-generated-queries数据集作为BEIR基准测试的一部分,专门聚焦于新闻检索任务。其构建方式基于TREC-NEWS评测任务,通过整合新闻文章语料库(包含约595K篇文档)与人工标注的查询-文档相关性判断(qrels)文件形成。语料库以JSON Lines格式存储,每条记录包含唯一文档标识符、标题与正文;查询集则包含问题文本及其对应ID;相关性判断采用TSV格式记录查询与文档间的二元关联分数。该数据集未提供训练集,仅保留测试集用于评估,旨在模拟真实场景下检索模型面对未见新闻数据的表现。
特点
该数据集的核心特点在于其专为新闻检索场景设计,语料库涵盖多领域新闻文章,查询数量虽仅57条,但每个查询平均对应约19.6个相关文档,保证了评估的统计可靠性。作为BEIR异构基准的一部分,它遵循统一的数据结构(corpus、queries、qrels三文件格式),便于与其他18个数据集进行跨任务比较。其零样本评估特性尤为突出:模型需在无领域内训练数据的情况下,从海量新闻中精准定位相关结果,这直接考验检索系统的语义理解与泛化能力。此外,数据集采用CC-BY-SA-4.0许可,确保了学术研究的开放性与可复现性。
使用方法
使用该数据集时,研究者需遵循BEIR框架的标准流程。首先加载corpus.jsonl文件构建文档索引,随后通过queries.jsonl获取测试查询,并利用qrels.tsv作为黄金标准评估检索效果。推荐使用稠密检索模型(如DPR、ColBERT)或稀疏检索方法(如BM25)进行实验,通过计算NDCG、MAP、Recall等指标衡量性能。由于数据集仅含测试集,用户可将其作为零样本评估的固定基准,无需划分训练集。具体实现可参考BEIR官方GitHub仓库中的示例代码,通过Python调用beir库快速完成数据加载与评估循环,从而聚焦于模型架构的优化而非数据处理细节。
背景与挑战
背景概述
信息检索领域长期以来缺乏一个能够全面评估模型零样本泛化能力的标准化基准。为填补这一空白,由加拿大滑铁卢大学Nandan Thakur、德国达姆施塔特工业大学UKP实验室Nils Reimers及Iryna Gurevych等研究人员共同构建了BEIR基准(2021年发表于NeurIPS数据集与基准赛道)。该基准整合了18个覆盖事实核查、问答、生物医学检索、新闻检索等9类任务的多样化数据集,旨在系统性地衡量检索模型在未见任务上的迁移表现。其中,TREC-NEWS子集(即BeIR/trec-news-generated-queries)聚焦新闻检索,包含约59.5万篇新闻文章与57个查询,为评估模型在长文本、时序敏感场景下的检索能力提供了关键测试平台。BEIR的发布推动了密集检索与稀疏检索模型的公平对比,成为零样本信息检索研究的重要里程碑。
当前挑战
BEIR基准所解决的领域问题在于,传统信息检索评测多集中于单一领域或任务,模型在跨领域零样本场景下的泛化能力难以被有效衡量。构建过程中面临的核心挑战包括:1)数据异构性——整合来自新闻、医学、科学等18个差异显著的数据集,需统一格式为corpus、queries和qrels三文件结构,并处理各数据集原始标注质量不一的问题;2)查询生成——部分子集(如TREC-NEWS)原始查询数量有限,需借助自动或人工方法扩充查询以确保评测统计显著性;3)规模平衡——各子集语料库规模从数千篇到数百万篇不等(如TREC-NEWS含59.5万篇,而SciFact仅5千篇),需设计合理的评测协议避免大语料主导整体指标。这些挑战使得BEIR在保证评测广度与公平性的同时,也为后续基准构建提供了方法论参考。
常用场景
经典使用场景
在信息检索领域,BeIR/trec-news-generated-queries 数据集作为 BEIR 基准测试的重要组成部分,其经典使用场景聚焦于评估检索模型在零样本设定下的泛化能力。该数据集专门面向新闻领域的文本检索任务,通过提供来自 TREC-NEWS 语料的查询与文档对,为研究者构建了一个标准化的测试平台。借助这一资源,研究人员能够系统性地衡量模型在未见过的新闻数据集上的检索表现,从而检验其跨领域迁移的鲁棒性。这一场景不仅推动了检索模型从监督学习向零样本泛化的范式转变,也为后续多任务检索方法的比较提供了坚实的实验基础。
解决学术问题
该数据集的核心学术贡献在于解决了信息检索模型评估中普遍存在的领域偏差问题。传统检索基准往往局限于单一任务或领域,导致模型性能无法反映其在真实异构场景中的表现。BeIR/trec-news-generated-queries 通过融入新闻检索这一特定任务,与 BEIR 框架内其他 17 个数据集协同,构建了涵盖事实核查、生物医学、问答等九大任务的多元评估体系。这一设计有效揭示了模型在跨领域检索中的脆弱性,推动了学术界对零样本检索能力的深入探讨,其意义在于为检索模型的通用性设立了更为严苛的衡量标准,进而促使研究者关注模型的可迁移性与鲁棒性。
衍生相关工作
基于该数据集及其所在的 BEIR 基准,学术界衍生出了一系列具有影响力的经典工作。其中,最突出的方向包括面向零样本检索的密集检索模型优化,例如基于对比学习的 SimCSE 与 Contriever 等模型均在 BEIR 上进行了系统性评测。此外,研究者利用该数据集提出了多种跨领域适应策略,如通过领域对抗训练或知识蒸馏来增强检索模型的泛化能力。在方法层面,基于预训练语言模型的检索架构(如 DPR、ColBERT)的零样本表现也常以此数据集为验证基准。这些衍生工作不仅深化了对检索模型泛化机理的理解,也推动了信息检索技术向更通用、更高效的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务