Health_QA_English
收藏资源简介:
Health QA English数据集是一个高度结构化的医学问答数据集,包含经过提取、清理和标准化的英文医学问答对。该数据集是BRAIN HEALTH (HELIX-FT)项目的基准数据集,旨在微调大型语言模型(LLMs)以充当医疗助手。数据集包含18,876个高质量的医学问答对,每个条目包含以下字段:问题(question)、结构化问题(context_question)、答案(answer)、专业领域(speciality)、紧急程度(urgency)、提取的临床实体(entities)和问题主题标题(article_title)。数据集经过严格的评估,包括基于LLM的RAG Triad指标(如上下文相关性、忠实性、专业性和答案相关性)和经典NLP指标(如词汇多样性、重复率、语义相似度等)。
The Health QA English dataset is a highly structured medical question-answering dataset containing extracted, cleaned, and standardized English medical question-answer pairs. This dataset serves as a benchmark for the BRAIN HEALTH (HELIX-FT) project, aiming to fine-tune large language models (LLMs) to act as medical assistants. The dataset includes 18,876 high-quality medical question-answer pairs, with each entry containing the following fields: question, context_question, answer, speciality, urgency, entities, and article_title. The dataset has undergone rigorous evaluation, including LLM-based RAG Triad metrics (such as context relevance, faithfulness, professionalism, and answer relevance) and classical NLP metrics (such as lexical diversity, repetition rate, semantic similarity, etc.).
Health QA English 数据集概述
基本信息
- 数据集名称: Health QA English
- 语言: 英语
- 许可协议: MIT
- 数据集大小: 10,000 < n < 100,000(实际包含 18,876 条高质量医疗问答对)
- 任务类型: 问答(Question-Answering)、文本生成(Text Generation)
- 数据集链接: https://huggingface.co/datasets/Kakyoin03/Health_QA_English
数据集背景
该数据集是 BRAIN HEALTH (HELIX-FT) 项目的基线数据集,旨在用于微调大型语言模型(LLMs)以充当医疗助手。数据经过提取、清洗和标准化处理,结构高度规范化。
数据结构
每条数据包含以下字段:
- question: 患者提出的原始问题
- context_question: 结构化、摘要化的问题版本,保留症状信息
- answer: 医疗专业人员的回答
- speciality: 医学领域(如心脏病学、皮肤科)
- urgency: 分诊级别(Faible、Moyen、Fort)
- entities: 提取的临床实体(年龄、症状、疾病、药物)
- article_title: 问题上下文的主题标题
评估与验证
数据集采用 LLM-as-a-judge 评估框架,结合 Grok-4.20-Reasoning(xAI)与经典 NLP 指标进行严格评估。
1. RAG Triad 指标(Grok-4.20 评估)
| 指标 | 得分 | 说明 |
|---|---|---|
| 上下文相关性 | 4.45 / 5.0 | 捕捉患者症状的准确性高 |
| 忠实性 | 4.35 / 5.0 | 事实依据优秀 |
| 专业性 | 4.05 / 5.0 | 医学语气正式、专业 |
| 答案相关性 | 3.80 / 5.0 | 临床回答目标明确、严格 |
2. 词汇与数据多样性指标
- 类型-符号比率(TTR):问题部分为 0.0283(词汇多样性较低,体现标准医疗形式化)
- 完全重复率:18.04%(原始网络爬取数据的典型特征)
- 近似重复率(Jaccard > 80%):0.0006%
3. 自动 NLP 管道评分
- 语义相似度(余弦相似度):0.5349
- BERTScore(F1):0.8505
- 安全评分(危险关键词检测):99.2%
评估代码
数据集使用 llm_as_a_judge.py 脚本,基于 RAG Triad 框架进行指标提取,调用 Grok-4.20-reasoning 模型对问答样本进行评分。




