遇见数据集

KaiLv/UDR_PubMed

收藏
Hugging Face2023-06-21 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: idx dtype: int64 - name: question dtype: string - name: target dtype: string - name: len_question dtype: int64 - name: len_target dtype: int64 splits: - name: train num_bytes: 162901962 num_examples: 56254 - name: validation num_bytes: 9201246 num_examples: 3187 - name: test num_bytes: 9799062 num_examples: 3481 - name: debug num_bytes: 14522497 num_examples: 5000 download_size: 110779150 dataset_size: 196424767 --- # Dataset Card for "UDR_PubMed" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

--- 数据集信息: 特征字段: - 字段名:idx,数据类型:64位整型 - 字段名:question,数据类型:字符串 - 字段名:target,数据类型:字符串 - 字段名:len_question,数据类型:64位整型 - 字段名:len_target,数据类型:64位整型 数据集划分: - 划分名称:训练集(train),字节大小:162901962,样本数量:56254 - 划分名称:验证集(validation),字节大小:9201246,样本数量:3187 - 划分名称:测试集(test),字节大小:9799062,样本数量:3481 - 划分名称:调试集(debug),字节大小:14522497,样本数量:5000 下载总大小:110779150 数据集总占用字节数:196424767 --- # 「UDR_PubMed」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
KaiLv
原始信息汇总

数据集概述

数据集名称

UDR_PubMed

数据集特征

  • idx: 数据类型为 int64
  • question: 数据类型为 string
  • target: 数据类型为 string
  • len_question: 数据类型为 int64
  • len_target: 数据类型为 int64

数据集分割

  • train: 包含56254个样本,总大小为162901962字节
  • validation: 包含3187个样本,总大小为9201246字节
  • test: 包含3481个样本,总大小为9799062字节
  • debug: 包含5000个样本,总大小为14522497字节

数据集大小

  • 下载大小: 110779150字节
  • 数据集总大小: 196424767字节
搜集汇总
数据集介绍
构建方式
在生物医学信息检索领域,高质量的数据集是推动模型性能提升的关键。KaiLv/UDR_PubMed数据集基于PubMed文献数据库构建,通过系统性采集与结构化处理,形成了包含问题与目标文本对的资源集合。数据集共收录62922个样本,其中训练集56254条、验证集3187条、测试集3481条,并额外设置了包含5000条样本的调试集。每个样本由索引、问题文本、目标文本及各自长度字段组成,确保了数据结构的完整性与可操作性。
特点
该数据集呈现出显著的领域适配性与规模优势。其样本均源自PubMed权威文献源,问题与目标文本的对应关系经过精心设计,能够有效支撑生物医学领域的检索与问答任务。数据集的四元组划分(训练、验证、测试、调试)为模型开发提供了完整的工作流支持,其中调试集便于快速迭代验证。字段中问题长度与目标长度的显式记录,进一步便利了数据预处理与模型输入格式的标准化。
使用方法
研究者可通过HuggingFace Datasets库便捷加载该资源,使用load_dataset函数指定数据集标识符即可获取。数据集支持标准的机器学习工作流:训练集用于模型参数学习,验证集辅助超参数调优,测试集进行最终性能评估。调试集特别适用于小规模实验或错误分析。在应用层面,该数据集可直接用于训练基于Transformer架构的检索模型,或作为微调生物医学领域专用语言模型的监督信号。
背景与挑战
背景概述
在自然语言处理与生物医学交叉领域,知识密集型任务的求解长期受限于领域语料的稀疏性与结构化不足。由KaiLv团队于近年构建的UDR_PubMed数据集,依托PubMed这一全球最大的生物医学文献数据库,聚焦于统一文档检索(Unified Document Retrieval)任务,旨在弥合通用检索模型在专业术语与复杂查询上的性能鸿沟。该数据集包含逾五万条训练样本及对应的验证、测试子集,每项数据均由文献索引、问题文本与目标答案构成,为模型在生物医学场景下的精确检索与推理提供了高质量的基准资源。其发布不仅推动了检索增强生成(RAG)技术在医疗领域的应用,更成为评估预训练语言模型领域适应性的重要标尺。
当前挑战
当前UDR_PubMed数据集面临的核心挑战体现在两个维度。其一,生物医学领域特有的术语歧义性与概念层级复杂性,使得模型需同时应对同义词消歧(如‘心肌梗死’与‘心脏病发作’的等价识别)与跨粒度查询(从基因名到疾病表型的映射),这对检索模型的语义理解能力提出了严苛要求。其二,构建过程中,从海量非结构化文献中自动抽取高质量问答对面临噪声控制难题,例如长文本截断导致的上下文缺失、多源文献间的信息冗余与冲突,以及标注一致性维护,均需依赖复杂的启发式规则与人工审核循环,这在一定程度上限制了数据集的规模扩展与动态更新效率。
常用场景
经典使用场景
在生物医学自然语言处理领域,KaiLv/UDR_PubMed数据集被广泛用于构建和评估面向PubMed文献的查询理解与文档检索模型。该数据集包含超过六万条训练样本,每条样本由问题、目标文本及其长度信息构成,为研究者提供了标准化的监督学习基准。其经典使用场景集中于训练序列到序列模型,以从生物医学问题中精准生成对应的文献摘要或关键信息片段,从而推动信息抽取技术在专业学术文本上的应用。
解决学术问题
该数据集有效解决了生物医学文献检索中查询与目标文本之间语义鸿沟的学术难题。在传统关键词匹配方法难以捕捉复杂临床问题与文献内容之间深层关联的背景下,UDR_PubMed通过提供大规模、高质量的问答对,支持研究者开发基于深度语义理解的检索模型。这显著提升了从海量PubMed文献中定位相关信息的准确率,为生物医学信息学中的证据检索、系统综述自动化等研究提供了关键数据支撑。
衍生相关工作
基于UDR_PubMed数据集,衍生出一系列经典工作,包括基于预训练语言模型(如BioBERT、PubMedBERT)的微调检索框架,以及结合对比学习的查询-文档匹配方法。部分研究进一步将该数据集与多任务学习结合,同时优化问题生成与文档摘要生成。此外,该数据集还促进了跨语言生物医学检索模型的开发,推动了多模态生物医学信息处理领域的进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务