PubMedQA-MetaGenBlendedRAG
收藏资源简介:
PubMedQA-MetaGen是一个元数据增强的生物医学问答数据集,基于原始PubMedQA数据集,通过MetaGenBlendedRAG管道进行增强。数据集包含了原始和增强的语料库版本,支持传统和元数据驱动的生物医学自然语言处理研究。
PubMedQA-MetaGen is a metadata-augmented biomedical question answering dataset. Built upon the original PubMedQA dataset, it is enhanced via the MetaGenBlendedRAG pipeline. The dataset includes both the original and augmented corpus versions, supporting research on both traditional and metadata-driven biomedical natural language processing.
PubMedQA-MetaGen数据集概述
数据集基本信息
- 创建者: 专家生成
- 语言: 英语 (en)
- 多语言性: 单语言
- 规模: 10K<n<100K
- 源数据集: 原始PubMedQA数据集
- 任务类别:
- 问答系统
- 信息检索
- 元数据丰富
- 任务ID:
- 开放域问答
- 检索增强生成
- 许可证: MIT
数据集结构
- 特征:
- id: 字符串
- question: 字符串
- context: 字符串
- answer: 字符串
- 各种元数据字段(在丰富文件中)
- 分割:
- train: 61249个示例
- test: 1000个示例
文件内容
-
PubMedQA_original_corpus.json
- 包含原始PubMedQA语料库,格式直接来自官方PubMedQA数据集。
- 每条记录包括生物医学问题、上下文(摘要)和答案字段。
-
PubMedQA_corpus_with_metadata.json
- 包含元数据丰富版本,通过MetaGenBlendedRAG管道处理原始语料库生成。
- 每条记录除了原始字段外,还增加了结构化元数据,包括关键概念、MeSH术语、自动生成的关键词、提取的实体和LLM生成的摘要。
数据集用途
- RAG评估: 使用丰富的上下文评估检索增强QA模型。
- 语义搜索: 构建改进的生物医学搜索引擎,利用主题、实体和关键词元数据。
- NLP和LLM微调: 用于微调受益于结构化生物医学上下文的模型。
数据集创建过程
- 来源: 原始PubMedQA数据集。
- 元数据丰富: 应用MetaGenBlendedRAG管道(基于规则、NLP和LLM驱动的丰富)。
- 输出: 两个文件——原始和丰富版本,支持传统和元数据驱动的研究。
使用限制
- 用于生物医学QA、RAG、语义检索和元数据丰富评估的研究和教育用途。
- 注意: 一些由LLM生成的元数据字段质量可能参差不齐,关键应用需验证输出。
引用
@misc{pubmedqa-metagen, title={PubMedQA-MetaGen: Metadata-Enriched PubMedQA Corpus}, author={Solanki, Shivam R., Mangal, Abhilasha and Sawarkar, Kunal}, year={2025}, howpublished={url{https://huggingface.co/datasets/Shivam6693/PubMedQA-MetaGenBlendedRAG/}}, note={Enriched with the MetaGen pipeline for RAG and biomedical QA research.} }
联系方式
如有问题、建议或贡献,请在Hugging Face数据集页面提交问题或直接联系作者。




