med-synth-questions-gemma-3-27b-deepseek-v4-flash
收藏资源简介:
Med Synth Questions (Gemma-3 + DeepSeek V4 Flash) 是一个合成医学问答数据集,旨在为医学问题提供包含推理过程的答案。该数据集基于开源数据集 openmed-community/med-synth-questions-gemma-3-27b-it 中的医学问题,使用 DeepSeek V4 Flash 模型生成合成推理轨迹和最终答案。数据集包含 29,148 条有效记录(从原始 32,560 条中移除了 2 条重复记录和 3,410 条不完整/截断记录)。每条记录采用对话格式,包含用户提出的医学问题、助手生成的完整答案(以正确标点结尾)以及一个独立的推理内容字段(reasoning_content),该字段以“● Question: ... → ...”的 SYNTH 风格呈现推理过程。数据平均每条推理轨迹约 1,591 个字符,格式合规率达 99.2%。数据集还包含丰富的元数据,如数据来源、来源索引、生成协议(Ollama)、模型名称、对话轮次、生成时间戳等。该数据集适用于文本生成和问答任务,特别是需要模型展示推理过程的医学领域应用。数据集仅限研究和教育用途,不提供医疗建议。
数据集概述
该数据集是一个用于医疗领域推理和问答的合成数据集。
- 数据集名称: Med Synth Questions (Gemma-3 + DeepSeek V4 Flash)
- 数据集规模: 29,148 条记录
- 语言: 英语
- 许可证: openmdw-1.1
- 任务类型: 文本生成、问答
- 标签: 合成、推理、SFT(监督微调)、医疗
数据来源与生成
- 源数据: 来自 openmed-community/med-synth-questions-gemma-3-27b-it 数据集的医疗问题。
- 生成方式: 使用 DeepSeek V4 Flash 模型生成答案和推理过程。原始数据集包含 32,560 条记录,经过去重(移除2条重复)和过滤(移除3,410条不完整或截断的记录)后得到当前版本。
数据内容与格式
每条记录包含一个医疗问题及其对应的综合推理过程和完整答案。格式如下:
python { "messages": [ {"role": "user", "content": "医疗问题..."}, {"role": "assistant", "content": "以正确标点结尾的完整答案。", "reasoning_content": "推理过程..."} ], "source": "hf:openmed-community/med-synth-questions-gemma-3-27b-it", "source_index": 500, "target": "both", "protocol": "ollama", "model": "deepseek-v4-flash:cloud", "num_conversation_turns": 2, "num_generated_turns": 1, "generated_at": "2026-07-22T..." }
数据质量与验证
- 推理轮次: 29,148 轮,格式合规率为 99.2%。
- 平均长度: 每条推理记录平均包含 1,591 个字符。
- 过滤条件: 移除了助手回答未以终止标点符号(如
.,!,?等)结尾的记录,这些主要是因达到最大令牌数而被截断的长回答。 - 验证结果:
- 格式合规: 99.2% (28,912/29,148 轮)
- 重复项: 0 (已去重)
- 空/空值推理: 0
- 不完整/截断: 0 (已过滤)
使用声明
该数据集仅供研究及教育用途,不可作为医疗建议来源。




