xingqiang/microbiology-qa-dataset
收藏资源简介:
# 🦠 微生物医学QA完整数据集 v2.1 (增强版) ## 📊 数据集概览 | 指标 | 数值 | |------|------| | **总数据量** | 308,971 条 | | **训练集** | 278,073 条 | | **验证集** | 15,448 条 | | **测试集** | 15,450 条 | | **文件大小** | ~330 MB | ## 📁 数据来源 ### 1. LLM生成的教科书QA (15,487条) 高质量专业医学问答,使用Qwen-Plus从权威医学教材中提取: - 热病桑福德抗微生物治疗指南: 3,350条 - 临床微生物学手册(上): 3,789条 - 临床微生物学手册(下): 3,876条 - 哈里森感染病学: 4,472条 ### 2. CSV微生物报告分析QA (22,842条) ✨增强版 来自9,990份真实微生物检测报告: - 物种鉴定与丰度分析 - 病原体检测与临床建议 - 菌群多样性评估 - **增强处理**: 去重1,183条 + 问题多样化(Qwen-Plus生成5种表述变体) ### 3. 过滤的开源医学数据 (270,642条) 从546K条开源数据中筛选微生物相关内容: - PubMedQA: 187,403条 (英文生物医学问答) - MedMCQA: 49,226条 (医学选择题) - CMtMedQA: 27,377条 (中文医患对话) - MedQA: 6,637条 (医学考试题) ## 🔤 数据格式 ```json { "instruction": "问题/指令", "input": "可选的上下文/选项", "output": "答案/回复", "source": "数据来源", "category": "分类标签", "data_source": "llm_textbook/csv_analysis/opensource" } ``` ## 🎯 覆盖主题 - **病原微生物**: 细菌、病毒、真菌、寄生虫 - **感染性疾病**: 肺炎、败血症、尿路感染等 - **抗微生物治疗**: 抗生素、抗病毒药、抗真菌药 - **耐药性**: MRSA、VRE、CRE、ESBL等 - **诊断技术**: 培养、PCR、mNGS、质谱 - **微生物组**: 肠道菌群、菌群失调 ## 📦 使用方式 ```python from datasets import load_dataset dataset = load_dataset('json', data_files={ 'train': 'train.jsonl', 'validation': 'validation.jsonl', 'test': 'test.jsonl' }) print(f"训练集: {len(dataset['train']):,} 条") # 输出: 训练集: 279,138 条 ``` ## 🔧 生成方法 1. **LLM智能提取**: 使用Qwen-Plus对医学教材进行智能分片(500-2500字符),自动生成高质量QA 2. **结构化分析**: 解析微生物检测CSV报告,生成专业分析QA 3. **关键词过滤**: 使用272个中英文微生物领域关键词过滤开源数据 ## 📅 版本信息 - **版本**: 2.1 (增强版) - **生成日期**: 2024-12-02 - **项目**: DeepMicroPath ## 🔄 v2.1 更新内容 - CSV数据去重:移除1,183条完全重复的QA对 - 问题多样化:使用Qwen-Plus为2个高频问题生成5种不同表述变体 - 问题复用率从76.9%降低,提高了数据多样性
# 🦠 Complete Microbial Medical QA Dataset v2.1 (Enhanced Version) ## 📊 Dataset Overview | Metrics | Value | |------|------| | **Total Entries** | 308,971 | | **Training Set** | 278,073 | | **Validation Set** | 15,448 | | **Test Set** | 15,450 | | **File Size** | ~330 MB | ## 📁 Data Sources ### 1. LLM-generated Textbook QA (15,487 entries) High-quality professional medical Q&A pairs extracted from authoritative medical textbooks using Qwen-Plus: - Sanford Guide to Antimicrobial Therapy: 3,350 entries - Manual of Clinical Microbiology (Volume 1): 3,789 entries - Manual of Clinical Microbiology (Volume 2): 3,876 entries - Harrison's Principles of Infectious Diseases: 4,472 entries ### 2. CSV Microbial Report Analysis QA (22,842 entries) ✨ Enhanced Version Derived from 9,990 real microbial test reports: - Species identification and abundance analysis - Pathogen detection and clinical recommendations - Microbiota diversity assessment - **Enhancement Processing**: Duplicate removal of 1,183 entries + Question diversification (5 expression variants generated by Qwen-Plus) ### 3. Filtered Open-Source Medical Data (270,642 entries) Screened from 546K open-source medical data: - PubMedQA: 187,403 entries (English biomedical Q&A) - MedMCQA: 49,226 entries (Medical multiple-choice questions) - CMtMedQA: 27,377 entries (Chinese doctor-patient dialogue Q&A) - MedQA: 6,637 entries (Medical examination questions) ## 🔤 Data Format json { "instruction": "Question/Instruction", "input": "Optional context/options", "output": "Answer/Response", "source": "Data source", "category": "Classification tag", "data_source": "llm_textbook/csv_analysis/opensource" } ## 🎯 Covered Topics - **Pathogenic Microorganisms**: Bacteria, Viruses, Fungi, Parasites - **Infectious Diseases**: Pneumonia, Sepsis, Urinary Tract Infection, etc. - **Antimicrobial Therapy**: Antibiotics, Antiviral Drugs, Antifungal Drugs - **Drug Resistance**: MRSA, VRE, CRE, ESBL, etc. - **Diagnostic Techniques**: Culture, PCR, mNGS, Mass Spectrometry - **Microbiome**: Intestinal Microbiota, Dysbiosis ## 📦 Usage Method python from datasets import load_dataset dataset = load_dataset('json', data_files={ 'train': 'train.jsonl', 'validation': 'validation.jsonl', 'test': 'test.jsonl' }) print(f"Training Set: {len(dataset['train']):,} entries") # Output: Training Set: 279,138 entries ## 🔧 Generation Methods 1. **LLM Intelligent Extraction**: Use Qwen-Plus to perform intelligent chunking (500-2500 characters) on medical textbooks, automatically generating high-quality Q&A pairs 2. **Structured Analysis**: Parse microbial test CSV reports to generate professional analytical Q&A pairs 3. **Keyword Filtering**: Filter open-source data using 272 Chinese and English microbial domain keywords ## 📅 Version Information - **Version**: 2.1 (Enhanced Version) - **Generation Date**: 2024-12-02 - **Project**: DeepMicroPath ## 🔄 v2.1 Update Content - CSV Data Duplicate Removal: Removed 1,183 fully duplicate Q&A pairs - Question Diversification: Generated 5 distinct expression variants for 2 high-frequency questions using Qwen-Plus - Reduced the question reuse rate from 76.9%, improving data diversity




