遇见数据集

allenai/cord19

收藏
Hugging Face2022-11-03 更新2024-03-04 收录
官方服务:

资源简介:

CORD-19是一个关于COVID-19和相关冠状病毒研究的学术论文语料库,由Allen Institute for AI的Semantic Scholar团队维护,旨在支持文本挖掘和自然语言处理研究。数据集为英文单语,包含多个配置,如metadata、fulltext和embeddings,每个配置都有详细的字段描述和数据分割信息。

CORD-19 is an academic paper corpus focused on COVID-19 and related coronavirus research, maintained by the Semantic Scholar team at the Allen Institute for AI, with the objective of supporting text mining and natural language processing research. This is a monolingual English dataset that includes multiple configurations such as metadata, fulltext and embeddings. Each configuration is accompanied by detailed field descriptions and data splitting information.

提供机构:
allenai
原始信息汇总

数据集卡片:CORD-19

数据集描述

数据集概述

CORD-19是一个关于COVID-19及相关冠状病毒研究的学术论文语料库,由Semantic Scholar团队在Allen Institute for AI维护,旨在支持文本挖掘和NLP研究。

支持的任务和排行榜

请参阅相关Kaggle挑战中定义的任务。

语言

该数据集为英语(en)。

数据集结构

数据实例

以下代码块展示了JSON格式的一个样本概览(由于某些字段非常长,因此进行了缩写): json { "abstract": "OBJECTIVE: This retrospective chart review describes the epidemiology and clinical features of 40 patients with culture-proven Mycoplasma pneumoniae infections at King Abdulaziz University Hospital, Jeddah, Saudi Arabia. METHODS: Patients with positive M. pneumoniae cultures from respiratory specimens from January 1997 through December 1998 were identified through the Microbiology records. Charts of patients were reviewed. RESULTS: 40 patients were identified [...]", "authors": "Madani, Tariq A; Al-Ghamdi, Aisha A", "cord_uid": "ug7v899j", "doc_embeddings": [ -2.939983606338501, -6.312200546264648, -1.0459030866622925, [...] 766 values in total [...] -4.107113361358643, -3.8174145221710205, 1.8976187705993652, 5.811529159545898, -2.9323840141296387 ], "doi": "10.1186/1471-2334-1-6", "journal": "BMC Infect Dis", "publish_time": "2001-07-04", "sha": "d1aafb70c066a2068b02786f8929fd9c900897fb", "source_x": "PMC", "title": "Clinical features of culture-proven Mycoplasma pneumoniae infections at King Abdulaziz University Hospital, Jeddah, Saudi Arabia", "url": "https: //www.ncbi.nlm.nih.gov/pmc/articles/PMC35282/" }

数据字段

目前仅集成以下字段:cord_uid, sha, source_x, title, doi, abstract, publish_time, authors, journal。在fulltext配置中,pdf_json_files中的章节被转换为fulltext特征。

  • cord_uid: 为每个CORD-19论文分配的唯一标识符,类型为str
  • sha: 与CORD-19论文关联的所有PDF的SHA1,类型为List[str]
  • source_x: 接收论文的来源名称,类型为List[str]
  • title: 论文标题,类型为str
  • doi: 论文DOI,类型为str
  • abstract: 论文摘要,类型为str
  • publish_time: 论文发表日期,类型为str,格式为yyyy-mm-dd
  • authors: 论文作者,类型为List[str]
  • journal: 论文期刊,类型为str

额外字段基于加载时的选择配置:

  • fulltext: 从JSON(从PDF提取)中所有文本章节的串联,类型为str
  • doc_embeddings: 文档嵌入,类型为sequence,包含浮点值元素的向量。

数据分割

由于该数据集未提供注释,所有实例均在训练分割中提供。

各配置的大小如下:

train
metadata 368618
fulltext 368618
embeddings 368618

数据集创建

策划理由

请参阅官方README

源数据

请参阅官方README

注释

无注释。

使用数据的注意事项

数据集的社会影响

[更多信息需补充]

偏见的讨论

[更多信息需补充]

其他已知限制

[更多信息需补充]

附加信息

数据集策展人

[更多信息需补充]

许可信息

[更多信息需补充]

引用信息

@article{Wang2020CORD19TC, title={CORD-19: The Covid-19 Open Research Dataset}, author={Lucy Lu Wang and Kyle Lo and Yoganand Chandrasekhar and Russell Reas and Jiangjiang Yang and Darrin Eide and K. Funk and Rodney Michael Kinney and Ziyang Liu and W. Merrill and P. Mooney and D. Murdick and Devvret Rishi and Jerry Sheehan and Zhihong Shen and B. Stilson and A. Wade and K. Wang and Christopher Wilhelm and Boya Xie and D. Raymond and Daniel S. Weld and Oren Etzioni and Sebastian Kohlmeier}, journal={ArXiv}, year={2020} }

贡献

感谢@ggdupont添加此数据集。

搜集汇总
数据集介绍
allenai/cord19 数据集图片
构建方式
CORD-19数据集由艾伦人工智能研究所的Semantic Scholar团队精心构建,旨在为COVID-19及相关冠状病毒研究提供全面的学术论文语料库。其构建过程依托于对多个权威学术来源的整合,包括PubMed Central、arXiv、Elsevier以及世界卫生组织等渠道,通过自动化流程收集并规范化论文元数据,如标题、作者、摘要、DOI、出版时间及期刊信息。此外,数据集还提供了两种增强配置:fulltext版本将PDF解析为结构化全文文本,而embeddings版本则利用SPECTER模型(一种基于BERT的文档表示学习框架)生成768维的文档嵌入向量,以支持深层次语义分析。所有数据均以统一的JSON格式存储,并通过唯一标识符cord_uid进行索引,最终形成包含约36.8万篇论文的稳定训练集。
使用方法
使用CORD-19数据集时,可通过Hugging Face Datasets库便捷加载,支持三种配置:metadata加载基础元数据,fulltext获取包含全文的完整记录,embeddings则返回附加文档向量的数据。加载后,数据以字典形式呈现,用户可直接访问cord_uid、abstract、fulltext等字段。对于自然语言处理任务,如文本分类或信息检索,可利用fulltext字段进行模型微调;而嵌入配置则适用于基于向量的相似性搜索或下游机器学习任务。数据集仅提供训练集划分,未预设标注任务,因此用户需根据具体研究目标(如Kaggle挑战中的问题)自行设计标签或使用无监督方法。建议结合官方文档与API(如Semantic Scholar接口)以增强数据利用效率。
背景与挑战
背景概述
CORD-19(COVID-19 Open Research Dataset)是由艾伦人工智能研究所(Allen Institute for AI)的语义学者(Semantic Scholar)团队于2020年创建的大规模学术文献语料库,旨在应对新冠疫情引发的全球公共卫生危机。该数据集汇集了超过36万篇关于新冠病毒及相关冠状病毒研究的论文,涵盖摘要、全文及文档嵌入等多维信息,成为自然语言处理与文本挖掘领域的重要资源。其核心研究问题在于如何通过自动化技术从海量科学文献中快速提取关键知识,以支持药物研发、流行病学分析及政策制定。自发布以来,CORD-19已催生多个Kaggle挑战赛,显著推动了信息检索、问答系统及知识图谱等方向的研究进展,成为疫情期间开放科学合作的典范。
当前挑战
CORD-19数据集面临的核心挑战在于多维度信息处理的复杂性。首先,从领域问题看,该数据集旨在解决疫情文献的快速检索与知识整合难题,但论文来源多样(如PubMed Central、arXiv、WHO等),导致格式不统一、元数据缺失或重复,给自动化解析带来障碍。其次,构建过程中,团队需从PDF和XML文件中提取全文并转换为结构化JSON,但部分论文存在扫描质量低、图表干扰或排版混乱等问题,影响文本识别准确率。此外,文档嵌入的生成依赖SPECTER模型,其性能受限于预训练语料的覆盖范围,对新兴病毒术语的表示能力不足。这些挑战共同制约了数据集在下游任务中的鲁棒性与时效性。
常用场景
经典使用场景
在自然语言处理与生物医学文本挖掘的交汇领域,CORD-19数据集因其汇聚了海量关于COVID-19及相关冠状病毒研究的学术论文全文与元数据,成为经典的信息检索与知识抽取平台。研究者常利用其构建问答系统,如针对病毒传播机制、治疗方案或疫苗研发等关键问题,从数十万篇文献中自动提取精准答案。该数据集还广泛应用于文本分类任务,例如区分论文的研究类型或评估其临床相关性,以及训练命名实体识别模型以识别病毒株、药物名称和基因术语,从而推动生物医学文献的自动化分析。
解决学术问题
CORD-19数据集的核心学术价值在于解决了疫情初期科研文献激增所导致的信息过载与知识获取瓶颈问题。在COVID-19大流行爆发之际,全球科学家迫切需要快速整合分散于不同数据库的科研成果,以加速对病毒特性、流行病学特征及潜在疗法的理解。该数据集通过统一格式提供论文摘要、全文及引用关系,使得基于深度学习的文献综述生成、科学假设推理和知识图谱构建成为可能,极大地提升了科研文献的利用效率,并为后续类似公共卫生事件的应急响应提供了方法论范本。
实际应用
在实际应用中,CORD-19数据集为公共卫生决策与临床实践提供了强有力的数据支撑。例如,通过分析论文中的治疗干预措施,研究人员能够汇总不同药物(如瑞德西韦、地塞米松)的有效性证据,辅助医生制定循证治疗方案。同时,该数据集被用于构建疫情趋势预测模型,通过挖掘文献中病毒变异和传播参数的历史数据,为政策制定者提供防控策略建议。此外,医药企业利用该数据集进行靶点发现和药物重定位,加速了从基础研究到临床应用的转化进程。
数据集最近研究
最新研究方向
在COVID-19大流行催生全球科研协作的背景下,CORD-19数据集作为一项里程碑式的资源,持续推动着生物医学自然语言处理的前沿探索。当前研究热点聚焦于利用该数据集构建大规模预训练语言模型,以从海量文献中自动提取病毒变异、药物靶点及临床干预措施等关键信息。例如,通过SPECTER嵌入技术,研究者得以捕捉论文间的语义关联,进而辅助知识图谱构建与科学发现推理。该数据集在Kaggle挑战赛中的广泛应用,不仅加速了文本挖掘算法的迭代,更深刻影响了公共卫生决策的智能化进程,彰显了开放科学在应对全球危机中的核心价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务