遇见数据集

medalpaca/medical_meadow_cord19

收藏
Hugging Face2023-04-06 更新2024-03-04 收录
官方服务:

资源简介:

CORD 19数据集是为了响应COVID-19疫情,由白宫和多个领先研究团体共同准备的,包含超过1,000,000篇学术文章,其中超过400,000篇有全文,涉及COVID-19、SARS-CoV-2及相关冠状病毒。该数据集旨在支持全球研究社区应用自然语言处理和其他AI技术,以生成新的见解来支持对抗这一传染病的斗争。这是一个经过处理的版本,移除了部分空条目并格式化以兼容alpaca训练。

CORD 19数据集是为了响应COVID-19疫情,由白宫和多个领先研究团体共同准备的,包含超过1,000,000篇学术文章,其中超过400,000篇有全文,涉及COVID-19、SARS-CoV-2及相关冠状病毒。该数据集旨在支持全球研究社区应用自然语言处理和其他AI技术,以生成新的见解来支持对抗这一传染病的斗争。这是一个经过处理的版本,移除了部分空条目并格式化以兼容alpaca训练。

提供机构:
medalpaca
原始信息汇总

CORD-19 数据集概述

基本信息

  • 任务类别: 摘要生成
  • 语言: 英语
  • 数据集大小: 100K<n<1M

数据集描述

  • 数据集名称: COVID-19 Open Research Dataset (CORD-19)
  • 数据集目的: 为全球研究社区提供一个包含超过1,000,000篇学术文章的资源,其中超过400,000篇包含全文,内容涉及COVID-19、SARS-CoV-2及相关冠状病毒。此数据集旨在支持应用自然语言处理和其他AI技术,以产生对抗击传染病的新见解。
  • 数据处理: 本数据集为处理版本,已移除部分空项并格式化,以便与alpaca训练兼容。

引用信息

@inproceedings{wang-etal-2020-cord, title = "{CORD-19}: The {COVID-19} Open Research Dataset", author = "Wang, Lucy Lu and Lo, Kyle and Chandrasekhar, Yoganand and Reas, Russell and Yang, Jiangjiang and Burdick, Doug and Eide, Darrin and Funk, Kathryn and Katsis, Yannis and Kinney, Rodney Michael and Li, Yunyao and Liu, Ziyang and Merrill, William and Mooney, Paul and Murdick, Dewey A. and Rishi, Devvret and Sheehan, Jerry and Shen, Zhihong and Stilson, Brandon and Wade, Alex D. and Wang, Kuansan and Wang, Nancy Xin Ru and Wilhelm, Christopher and Xie, Boya and Raymond, Douglas M. and Weld, Daniel S. and Etzioni, Oren and Kohlmeier, Sebastian", booktitle = "Proceedings of the 1st Workshop on {NLP} for {COVID-19} at {ACL} 2020", month = jul, year = "2020", address = "Online", publisher = "Association for Computational Linguistics", url = "https://www.aclweb.org/anthology/2020.nlpcovid19-acl.1" }

搜集汇总
数据集介绍
medalpaca/medical_meadow_cord19 数据集图片
构建方式
在COVID-19疫情肆虐全球的背景下,白宫与多家顶尖研究机构联合发起了COVID-19开放研究数据集(CORD-19)项目,旨在为全球科研界提供关于新冠病毒、SARS-CoV-2及相关冠状病毒的学术文献资源。该数据集囊括超过一百万篇学术文章,其中四十余万篇具备完整全文。medalpaca/medical_meadow_cord19在此基础上进行了精细加工,移除了部分空条目,并重新格式化数据以适配Alpaca训练框架,从而构建出可直接用于自然语言处理任务的高质量子集。
特点
该数据集的核心特色在于其大规模、专业性与时效性的深度融合。涵盖海量COVID-19相关学术文献,使其成为生物医学领域少有的超大规模语料库。数据经过清洗与结构化处理,保证了内容的准确性与可用性。同时,其与Alpaca训练格式的兼容设计,极大降低了研究者应用前沿AI技术的门槛,尤其适用于文本摘要等自然语言生成任务,为疫情相关知识的快速挖掘与整合提供了坚实的数据基础。
使用方法
研究人员可直接通过Hugging Face平台加载该数据集,利用其与Alpaca格式兼容的特性,快速开展模型微调与评估。典型应用场景包括学术文献摘要生成,即输入论文的标题或摘要片段,训练模型产出精炼的总结。使用时需注意数据已预先完成清洗,无需额外预处理。建议配合transformers库中的序列到序列模型(如T5或BART)进行训练,以充分发挥其在生物医学文本理解上的潜力。
背景与挑战
背景概述
在新冠肺炎疫情肆虐全球的危急时刻,科研界亟需高效整合海量文献以加速病毒研究与防控策略的制定。为此,2020年白宫联合艾伦人工智能研究所等顶尖机构,由Lucy Lu Wang等学者主导构建了COVID-19开放研究数据集(CORD-19),汇聚超过100万篇相关学术论文,其中40余万篇提供全文。该数据集聚焦于SARS-CoV-2及冠状病毒的跨学科知识挖掘,旨在利用自然语言处理等技术推动抗疫研究。其发布迅速成为全球AI医疗领域的核心资源,催生了大量文本摘要、知识图谱等下游任务,对突发公共卫生事件下的数据共享范式产生了深远影响。
当前挑战
CORD-19所应对的领域挑战在于从海量且快速增长的疫情文献中自动提炼关键信息,例如生成简洁准确的论文摘要以支持决策,这对传统信息检索方法构成严峻考验。数据构建过程中亦面临诸多困难:需整合来自不同出版源的异构格式,处理部分条目缺失或重复的问题;同时需确保标注质量以适配监督学习,例如medalpaca团队对原始数据进行了清洗与格式化,移除空条目并调整为alpaca训练兼容结构。此外,论文主题的时效性与术语多样性进一步增加了模型泛化的复杂性,而版权与伦理限制也为数据开放共享设置了边界。
常用场景
经典使用场景
Medical Meadow CORD19 数据集源自 COVID-19 开放研究语料库,经过精心清洗与格式化,适配于 Alpaca 训练范式。其最经典的使用场景在于为大规模语言模型提供医学领域的指令微调数据,尤其聚焦于 COVID-19 相关学术文献的摘要生成任务。研究者利用该数据集训练模型,使其能够从海量科研论文中提炼关键信息,生成简洁准确的摘要,从而加速医学知识的获取与传播。这一场景不仅推动了自然语言处理技术在生物医学文本挖掘中的应用,更为疫情背景下的科研协作提供了高效工具。
实际应用
在实际应用中,Medical Meadow CORD19 可赋能智能问答系统与科研辅助平台,帮助临床医生和研究人员快速获取 COVID-19 相关的关键发现。例如,部署基于该数据集训练的模型,能够实时解析新发表的论文,生成摘要并回答特定问题,如病毒传播机制或疫苗效果。此外,它还可用于构建自动化文献筛选工具,支持公共卫生决策者快速评估证据质量。这些应用显著提升了信息处理效率,在疫情应对中发挥了重要的技术支撑作用。
衍生相关工作
Medical Meadow CORD19 衍生了一系列经典工作,包括基于该数据集的指令微调模型,如融合了生物医学知识的 Alpaca 变体。研究者还将其与 BioBERT、PubMedBERT 等预训练模型结合,开发出专门用于 COVID-19 文献摘要与问答的微调方案。此外,该数据集被用于评估语言模型在医学领域零样本和少样本学习能力,推动了相关基准测试的建立。这些工作不仅验证了数据集的有效性,还拓展了其在生物医学自然语言处理中的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务