遇见数据集

Zhikangyun-Huatuo

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

Zhikangyun-Huatuo 是一个基于华佗(Huatuo)中文医患问答数据清洗构建的医疗问答数据集,专为大模型在医疗领域的微调(SFT/LoRA)设计。该数据集是“本草医疗 Qwen2.5-7B”微调模型的配套训练数据。数据集共包含 9,344 条样本,具体划分为:训练集 7,000 条、验证集 1,000 条、测试集 1,000 条以及补充生成样本 344 条。数据格式采用扩展 Alpaca 格式,每条样本包含 instruction(主问题)、input(可选补充输入,如检查报告或症状描述)、output(医疗标准回答)及 history(多轮对话历史,单轮对话为空数组)。数据经过严格的清洗管线:首先通过 Hive 暂存和 PySpark 对原始数据进行清洗转换,然后使用 Dify 工作流结合 GPT-4o-mini 从医学准确性、回答长度、专业术语数量、是否参考经典书籍论文、完整性等维度进行多维打分,强制保留评分 ≥6.0 的样本,保留比例控制在 90%-95%。该数据集适用于医疗领域的 SFT 和 LoRA 微调(如 Qwen2.5-7B),以及医疗问答、健康科普、导诊等场景的评估。数据集以 Apache-2.0 许可证发布,语言为中文,可通过 ModelScope 和 Git 下载。

Zhikangyun-Huatuo is a medical question-answering dataset built by cleaning and constructing from the Huatuo Chinese doctor-patient Q&A data, specifically designed for fine-tuning (SFT/LoRA) of large models in the medical domain. This dataset serves as the companion training data for the Bencao Medical Qwen2.5-7B fine-tuned model. It contains a total of 9,344 samples, divided into: 7,000 training samples, 1,000 validation samples, 1,000 test samples, and 344 additional generated samples. The data format adopts the extended Alpaca format, where each sample includes instruction (main question), input (optional supplementary input, such as examination reports or symptom descriptions), output (standard medical answer), and history (multi-turn dialogue history, empty array for single-turn dialogue). The data undergoes a rigorous cleaning pipeline: first, raw data is cleaned and transformed using Hive staging and PySpark, then a Dify workflow combined with GPT-4o-mini is used to perform multi-dimensional scoring based on medical accuracy, answer length, number of professional terms, reference to classic books or papers, completeness, etc. Samples with a score ≥6.0 are forcibly retained, with a retention ratio controlled between 90% and 95%. This dataset is suitable for SFT and LoRA fine-tuning in the medical domain (e.g., Qwen2.5-7B), as well as evaluation of medical Q&A, health science popularization, and triage scenarios. The dataset is released under the Apache-2.0 license, in Chinese, and can be downloaded via ModelScope and Git.

创建时间:
2026-08-11
原始信息汇总

数据集概述

Zhikangyun-Huatuo 是一个用于医疗领域大模型微调的中文问答数据集,基于华佗(Huatuo)医患问答数据清洗构建,适用于大语言模型的监督微调(SFT/LoRA)任务。该数据集是「本草医疗 Qwen2.5-7B」微调模型的配套训练数据。

数据规模

文件 条数 说明
train.json 7,000 训练集
val.json 1,000 验证集
test.json 1,000 测试集
generated_medical.json 344 补充生成样本
合计 9,344

数据格式(扩展 Alpaca)

每条样本包含以下字段:

  • instruction:用户主问题(必填)
  • input:可选的补充输入或背景,如检查报告、症状描述(可为空)
  • output:标准医疗回答
  • history:可选的多轮对话历史,格式为 [[用户, 助手], ...],单轮样本为空数组

清洗管线

  1. 原始华佗医患数据通过 Hive 暂存 + PySpark 进行清洗和转换。
  2. 使用 Dify 工作流 + GPT-4o-mini 进行多维打分,评估指标包括医学准确性、回答长度、专业术语数量、是否参考经典书籍论文、完整性,强制要求得分 ≥ 6.0,保留比例控制在 90%-95%。
  3. 剔除低质样本后,按 7000/1000/1000 划分训练集、验证集和测试集,并注册至 LLaMA-Factory。

用途

  • 医疗领域 SFT + LoRA 微调(如 Qwen2.5-7B,基于 LLaMA-Factory 训练)。
  • 医疗问答、健康科普、导诊场景的评估。

下载方式

  • 通过 ModelScope SDK 加载: python from modelscope import MsDataset ds = MsDataset.load(Aulink/Zhikangyun-Huatuo)

  • 通过 Git 克隆: bash git clone https://www.modelscope.cn/datasets/Aulink/Zhikangyun-Huatuo.git

关联项目

  • 微调模型:Aulink/HealthPulse-Qwen2.5-7B(本草医疗 Qwen2.5-7B),可在 ModelScope(https://www.modelscope.cn/models/Aulink/HealthPulse-Qwen2.5-7B)和 Hugging Face(https://huggingface.co/Weikaijie/HealthPulse-Qwen2.5-7B)获取。
  • 项目仓库:https://github.com/Aurirlk/HealthPulse (ai_model/ 目录包含训练参数、微调步骤、评测脚本)。

免责声明

数据用于学习与研究目的,医学信息请以专业医生意见为准。

许可协议:Apache-2.0
语言:中文
任务类别:文本生成、问答
其他标签:医疗、健康

搜集汇总
数据集介绍
Zhikangyun-Huatuo 数据集图片
构建方式
Zhikangyun-Huatuo医疗问答数据集源于华佗中文医患问答数据,经系统化清洗与构建而成。原始数据体量庞大但质量参差,构建过程中先借助Hive暂存与PySpark进行初步清洗转换,随后利用Dify工作流结合GPT-4o-mini多维打分机制,从医学准确性、回答长度、专业术语数量、是否参考经典文献及完整性等维度进行评估,强制要求得分不低于6.0,并将保留比例控制在90%-95%,以此筛除低质样本。最终将清洗后的数据按7000/1000/1000划分为训练集、验证集和测试集,另含344条补充生成样本,总计9344条。
特点
该数据集具备鲜明的医疗领域特色与高质量标注特点。数据格式采用扩展Alpaca结构,包含instruction、input、output及history字段,不仅支持单轮问答,亦兼容多轮对话场景,灵活适配不同微调需求。数据内容覆盖医疗问答、健康科普与导诊等实际应用,其清洗管线融合了大数据处理与智能评估技术,确保了医学信息的准确性与专业性,为医疗领域大模型微调提供了坚实的数据基础。
使用方法
数据集专为医疗领域大模型微调设计,适用于SFT与LoRA等训练范式,可基于Qwen2.5-7B等模型通过LLaMA-Factory框架进行训练。使用者可通过ModelScope SDK或Git克隆方式便捷获取数据,并以JSON格式解析后直接用于模型训练与评估。该数据集亦可用于医疗问答、健康科普、导诊等场景的性能测试,为模型效果评估提供标准化的数据支撑。
背景与挑战
背景概述
随着大语言模型在垂直领域的深入应用,医疗问答成为其最具挑战性的落地场景之一。自2023年起,以华佗为代表的中文医患问答数据为医疗大模型提供了宝贵语料,但原始数据质量参差、噪声显著,难以直接用于高效微调。在此背景下,本数据集由智康云团队于2024年创建,依托Hive与PySpark构建清洗管线,结合Dify工作流与GPT-4o-mini多维评分机制,筛选出近万条高质量医患问答对。该数据集旨在支撑Qwen2.5-7B等模型的医疗领域SFT与LoRA微调,其发布为中文医疗大模型的训练提供了标准化数据基准,推动了医疗AI在导诊、健康科普等场景的落地研究。
当前挑战
本数据集所面临的挑战涵盖领域难题与构建障碍。在领域层面,医疗问答需兼顾医学准确性、回答完整性与语言安全性,而中文医患对话存在口语化严重、术语混杂、信息冗余等问题,直接制约模型生成质量。在构建过程中,原始华佗数据体量庞大但质量参差,需利用PySpark进行高效清洗与转换,同时借助GPT-4o-mini对医学准确性、专业术语密度、参考文献引用等维度进行打分,并强制阈值≥6.0,在保证低质剔除的同时将保留率控制在90%-95%,平衡数据规模与质量。此外,数据划分、多轮对话处理及伦理合规性亦构成了不容忽视的挑战。
常用场景
经典使用场景
在自然语言处理与医疗人工智能交汇的研究领域中,高质量的中文医患问答数据是构建专业领域对话系统的基石。Zhikangyun-Huatuo 医疗问答数据集正是为此而生,它提供了经过精细清洗与筛选的、覆盖多种医学议题的医患问答对,并以扩展 Alpaca 格式组织,可直接用于大语言模型的指令微调与少样本学习。该数据集的经典使用场景包括对基座模型进行 SFT(监督微调)和 LoRA(低秩适配)训练,以增强模型在医学知识问答、症状解读、健康咨询等方面的生成能力,使其在专业术语使用、回答完整性与逻辑性上更贴近医疗从业者的表述习惯。
解决学术问题
该数据集有效缓解了中文医疗领域高质量标注数据稀缺且质量参差不齐的学术困境。通过构建包含7,000条训练样本及配套验证与测试集的多任务学习资源,它解决了医疗问答系统中普遍存在的领域知识覆盖不足、多轮对话连贯性差、回答缺乏专业依据等关键问题。其严格的清洗流程(基于多维评分机制)确保了数据的高可靠性,为研究者提供了可复现、可比较的基准,推动了医疗大模型在知识理解、推理与生成方面的评估与优化,并为中文医学自然语言处理研究奠定了坚实的数据基础。
衍生相关工作
该数据集的发布衍生了一系列具有重要影响的研究工作,极大地促进了中文医疗语言模型的发展。最直接的是,它作为核心训练资源,支撑了“本草医疗 Qwen2.5-7B”这一微调模型的诞生,该模型在医疗问答任务上展现了卓越的性能。在此基础上,研究者进一步探索了针对不同医学亚专科的数据细化与模型优化策略,催生了诸如医疗领域检索增强生成(RAG)系统的构建、基于多轮对话的诊疗决策模型、乃至融合了医疗知识图谱的复杂推理模型等创新性工作。这些后续研究不仅验证了数据集的质量与通用性,还推动了从单一问答向辅助诊断、个性化健康管理等更为复杂智能医疗应用生态的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务