遇见数据集

irds/cord19_fulltext_trec-covid

收藏
Hugging Face2023-01-05 更新2024-03-04 收录
官方服务:

资源简介:

`cord19/fulltext/trec-covid`数据集由`ir-datasets`包提供,主要用于文本检索任务。数据集中包含50个查询(即主题)和69,318个相关性评估(qrels)。

The `cord19/fulltext/trec-covid` dataset, provided by the `ir-datasets` package, is primarily used for text retrieval tasks. It contains 50 queries (i.e., topics) and 69,318 relevance judgments (qrels).

提供机构:
irds
原始信息汇总

数据集概述

数据集名称

cord19/fulltext/trec-covid

数据集来源

ir-datasets提供。

数据内容

  • queries:查询主题,数量为50。
  • qrels:相关性评估,数量为69,318。

数据集使用示例

python from datasets import load_dataset

queries = load_dataset(irds/cord19_fulltext_trec-covid, queries) for record in queries: record # {query_id: ..., title: ..., description: ..., narrative: ...}

qrels = load_dataset(irds/cord19_fulltext_trec-covid, qrels) for record in qrels: record # {query_id: ..., doc_id: ..., relevance: ..., iteration: ...}

引用信息

@article{Voorhees2020TrecCovid, title={TREC-COVID: Constructing a Pandemic Information Retrieval Test Collection}, author={E. Voorhees and Tasmeer Alam and Steven Bedrick and Dina Demner-Fushman and W. Hersh and Kyle Lo and Kirk Roberts and I. Soboroff and Lucy Lu Wang}, journal={ArXiv}, year={2020}, volume={abs/2005.04474} } @article{Wang2020Cord19, title={CORD-19: The Covid-19 Open Research Dataset}, author={Lucy Lu Wang and Kyle Lo and Yoganand Chandrasekhar and Russell Reas and Jiangjiang Yang and Darrin Eide and K. Funk and Rodney Michael Kinney and Ziyang Liu and W. Merrill and P. Mooney and D. Murdick and Devvret Rishi and Jerry Sheehan and Zhihong Shen and B. Stilson and A. Wade and K. Wang and Christopher Wilhelm and Boya Xie and D. Raymond and Daniel S. Weld and Oren Etzioni and Sebastian Kohlmeier}, journal={ArXiv}, year={2020} }

搜集汇总
数据集介绍
irds/cord19_fulltext_trec-covid 数据集图片
构建方式
在信息检索领域,面向特定事件的文本检索测试集构建至关重要。该数据集基于TREC-COVID挑战赛的检索任务,从CORD-19(COVID-19开放研究数据集)中提取全文内容,并精心设计了50条查询主题(queries)以及69,318条相关性判断(qrels)。构建过程遵循严格的信息检索评估标准,由领域专家对文档与查询的相关性进行人工标注,从而形成一个高可靠性的评测基准,旨在支持疫情相关科学文献的检索研究。
特点
该数据集的核心特点在于其聚焦于COVID-19疫情这一重大公共卫生事件,提供了丰富的全文文本资源与细粒度的相关性标注。50条查询主题涵盖病毒传播、治疗手段、流行病学等多个维度,而近七万条相关性判断则确保了评测的统计稳健性。此外,数据集依托ir-datasets框架进行标准化封装,便于研究者直接调用,无需额外预处理,显著提升了实验的可复现性与效率。
使用方法
研究者可通过HuggingFace的datasets库便捷地加载该数据集。具体而言,使用load_dataset函数并指定数据集名称‘irds/cord19_fulltext_trec-covid’,随后选择‘queries’或‘qrels’子集即可获取查询主题或相关性判断数据。每条查询记录包含查询ID、标题、描述及叙事文本,而相关性记录则包含查询ID、文档ID、相关性等级及迭代信息。该接口设计简洁,适合直接用于信息检索系统的评测与对比实验。
背景与挑战
背景概述
在新型冠状病毒肺炎(COVID-19)全球大流行期间,科学界以前所未有的速度产出了大量相关文献,使得从海量文本中快速、准确地检索关键信息成为一项紧迫任务。为应对这一挑战,艾伦人工智能研究所(Allen Institute for AI)联合多所机构于2020年发布了COVID-19开放研究数据集(CORD-19),汇集了数十万篇学术论文。同年,由Ellen Voorhees等人主导的TREC-COVID信息检索测试集应运而生,旨在为CORD-19全文数据提供标准化的检索评价基准。该数据集包含50个精心设计的查询主题和超过69000条相关性判断,成为评估疫情相关文本检索系统性能的核心资源,对推动信息检索领域在公共卫生危机中的应用产生了深远影响。
当前挑战
该数据集面临的核心挑战在于应对疫情文献的快速演变与检索需求的动态性。一方面,COVID-19相关研究呈指数级增长,新术语、新发现不断涌现,导致静态查询集难以覆盖实时信息需求,且文献质量参差不齐,增加了相关性判断的复杂性。另一方面,构建过程中需克服标注一致性难题:50个查询主题由多位专家协同设计,但不同专家对“相关性”的理解存在主观差异;同时,从数十万篇论文中筛选出69,318条相关性判断,需耗费大量人力与时间,且难以保证完全覆盖所有潜在相关文档。此外,数据集规模相对较小,限制了深度学习模型在低资源场景下的泛化能力。
常用场景
经典使用场景
在信息检索领域,CORD-19全文语料库与TREC-COVID评测任务的结合,构成了一套极具代表性的基准测试集合。该数据集精心筛选了与COVID-19相关的科学文献全文,并配以50个专家构建的查询主题及逾六万九千条相关性判断,使得研究者能够系统性地评估检索模型在突发公共卫生事件情境下的表现。其经典用途在于支持基于深度语义匹配的检索算法、零样本与少样本学习策略,以及面向科学文献的问答系统的性能验证,成为衡量检索系统在生物医学领域泛化能力的重要标尺。
解决学术问题
该数据集的核心学术贡献在于解决了疫情初期科学信息过载与知识发现效率低下的矛盾。传统的检索评测集合多聚焦于新闻或通用网页,缺乏针对新兴流行病学、病毒学与临床治疗等专业领域的细粒度标注资源。CORD-19全文TREC-COVID集合通过提供大规模、高质量的相关性判断,使得研究者能够量化评估模型在快速演变的科学知识前沿中的检索精度与召回率,进而推动了对语义鸿沟、查询漂移以及跨模态信息融合等经典学术问题的深入探索。
衍生相关工作
基于该数据集,学术界涌现了一系列具有里程碑意义的衍生工作。其中,TREC-COVID评测任务本身催生了多种融合预训练语言模型(如BioBERT、SciBERT)的检索架构,并促使研究者提出了面向科学文献的段落排序与证据提取方法。此外,该集合被广泛用作跨语言检索、持续学习检索以及可解释性检索研究的基准,衍生出如COVID-19知识图谱问答、疫苗文献自动综述生成等创新工作,深刻影响了生物医学信息检索与自然语言处理交叉领域的发展方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务