遇见数据集

med-synth-questions-gemma-3-27b-deepseek-v4-flash

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

Med Synth Questions (Gemma-3 + DeepSeek V4 Flash) 是一个合成医学问答数据集,旨在为医学问题提供包含推理过程的答案。该数据集基于开源数据集 openmed-community/med-synth-questions-gemma-3-27b-it 中的医学问题,使用 DeepSeek V4 Flash 模型生成合成推理轨迹和最终答案。数据集包含 29,148 条有效记录(从原始 32,560 条中移除了 2 条重复记录和 3,410 条不完整/截断记录)。每条记录采用对话格式,包含用户提出的医学问题、助手生成的完整答案(以正确标点结尾)以及一个独立的推理内容字段(reasoning_content),该字段以“● Question: ... → ...”的 SYNTH 风格呈现推理过程。数据平均每条推理轨迹约 1,591 个字符,格式合规率达 99.2%。数据集还包含丰富的元数据,如数据来源、来源索引、生成协议(Ollama)、模型名称、对话轮次、生成时间戳等。该数据集适用于文本生成和问答任务,特别是需要模型展示推理过程的医学领域应用。数据集仅限研究和教育用途,不提供医疗建议。

创建时间:
2026-07-25
原始信息汇总

数据集概述

该数据集是一个用于医疗领域推理和问答的合成数据集。

  • 数据集名称: Med Synth Questions (Gemma-3 + DeepSeek V4 Flash)
  • 数据集规模: 29,148 条记录
  • 语言: 英语
  • 许可证: openmdw-1.1
  • 任务类型: 文本生成、问答
  • 标签: 合成、推理、SFT(监督微调)、医疗

数据来源与生成

  • 源数据: 来自 openmed-community/med-synth-questions-gemma-3-27b-it 数据集的医疗问题。
  • 生成方式: 使用 DeepSeek V4 Flash 模型生成答案和推理过程。原始数据集包含 32,560 条记录,经过去重(移除2条重复)和过滤(移除3,410条不完整或截断的记录)后得到当前版本。

数据内容与格式

每条记录包含一个医疗问题及其对应的综合推理过程和完整答案。格式如下:

python { "messages": [ {"role": "user", "content": "医疗问题..."}, {"role": "assistant", "content": "以正确标点结尾的完整答案。", "reasoning_content": "推理过程..."} ], "source": "hf:openmed-community/med-synth-questions-gemma-3-27b-it", "source_index": 500, "target": "both", "protocol": "ollama", "model": "deepseek-v4-flash:cloud", "num_conversation_turns": 2, "num_generated_turns": 1, "generated_at": "2026-07-22T..." }

数据质量与验证

  • 推理轮次: 29,148 轮,格式合规率为 99.2%。
  • 平均长度: 每条推理记录平均包含 1,591 个字符。
  • 过滤条件: 移除了助手回答未以终止标点符号(如 ., !, ? 等)结尾的记录,这些主要是因达到最大令牌数而被截断的长回答。
  • 验证结果:
    • 格式合规: 99.2% (28,912/29,148 轮)
    • 重复项: 0 (已去重)
    • 空/空值推理: 0
    • 不完整/截断: 0 (已过滤)

使用声明

该数据集仅供研究及教育用途,不可作为医疗建议来源。

搜集汇总
数据集介绍
med-synth-questions-gemma-3-27b-deepseek-v4-flash 数据集图片
构建方式
本数据集源于开源医学问答社区openmed-community的med-synth-questions-gemma-3-27b-it数据集,经进一步精炼与增强而形成。原始数据共计32,560条记录,通过剔除2条重复项及3,410条因生成过程中达到最大token限制而截断的不完整条目,最终保留29,148条高质量医学问答对。每条记录均由DeepSeek V4 Flash模型以SYNTH风格生成推理轨迹与最终答案,推理过程平均长度为1,591字符,格式合规率高达99.2%。数据构建过程中采用严格的端点标点过滤策略,确保每条助理回答均以句号、感叹号、问号、括号或引号等终止符结尾,从而保障输出的完整性与连贯性。
使用方法
本数据集适用于基于文本生成与问答任务的监督微调流程,可直接加载至HuggingFace的datasets库中使用。用户可通过load_dataset('openmed-community/med-synth-questions-gemma-3-27b-deepseek-v4-flash')命令轻松获取全部29,148条记录。每条数据遵循多轮对话格式,包含messages、source、model等字段,便于集成至各类训练框架。建议在应用时将数据集划分为训练集与验证集,利用包含的推理轨迹字段增强模型对医学问题的逻辑解析能力。需特别强调的是,该数据集仅供研究与教育用途,不得作为临床决策依据,使用者应遵守相关法律、伦理及模型使用条款,并始终咨询合格的专业医疗人员。
背景与挑战
背景概述
该数据集名为med-synth-questions-gemma-3-27b-deepseek-v4-flash,由openmed-community团队于2026年7月前后创建,旨在通过合成推理轨迹增强医学问答的数据资源。该数据集基于Google的Gemma 3 27B指令模型生成的医学问题,再利用DeepSeek V4 Flash模型生成推理过程与答案,最终形成29,148条高质量记录。其核心研究问题在于探索如何利用大型语言模型构建结构化的医学推理数据集,以支持监督式微调(SFT)和推理能力提升。作为合成医学数据领域的重要尝试,该数据集填补了医学领域高质量推理轨迹数据的空白,为后续模型训练提供了可复用的基准资源。
当前挑战
该数据集主要面临多层面的挑战。在领域问题层面,医学问答需应对复杂临床推理、术语多样性和答案准确性等核心难题,合成数据必须确保逻辑严谨且符合医学范式。在构建过程中,原始32,560条记录中出现了3,410条截断或不完整条目,占比超过10%,这反映出模型生成长度受限和输出质量不稳定的挑战。此外,格式合规性虽达99.2%,但仍存在少量非标准输出,提示需要更精细的过滤机制。数据来源的可靠性与伦理合规性亦是重要挑战,因其涉及医学专业内容,需严格避免误导性信息并遵守相关使用条款。
常用场景
经典使用场景
在智能医疗问答系统的研究浪潮中,med-synth-questions-gemma-3-27b-deepseek-v4-flash数据集凭借其精心构建的合成推理轨迹与高质量答案,成为微调医学领域大语言模型的标杆资源。该数据集包含近三万个经过严格筛选的医患对话记录,每一条均涵盖完整的医疗问题、结构化的推理链以及精准的最终回复,尤其适用于监督式微调中的指令跟随与推理能力增强。研究者利用其对基础模型进行领域适配训练,能够显著提升模型在复杂临床问题上的逻辑推演和准确作答能力。此外,该数据集的格式规范统一,便于直接加载至主流的训练框架,为医学自然语言处理社区提供了高效易用的基准训练材料。
解决学术问题
长期以来,医学领域大语言模型面临两大核心瓶颈:一是缺乏高质量、结构化且包含推理过程的标注数据,二是模型在面对复杂医学问题时容易产生逻辑跳跃或事实错误。本数据集通过整合开源医学问答源与先进合成模型,批量生成了附带清晰思维链的推理轨迹,有效缓解了数据稀缺与推理不透明的问题。在学术研究层面,它支持了对模型归因能力、链式推理稳健性以及医学知识对齐度的深入探究,推动了大语言模型从简单文本匹配向可解释医学推理的范式转变。其过滤机制也引发了对长文本生成截断与质量控制方法的讨论,为后续数据集构建提供了方法论参考。
实际应用
在实际落地场景中,该数据集的价值体现在多个前沿领域。其一,可用于构建医学智能问诊助手,辅助基层医疗机构实现初步病情咨询与分诊引导。其二,数据集中的结构化推理样本为临床决策支持系统提供了训练素材,帮助系统在药物相互作用分析、病例辅助诊断等任务中给出有理有据的建议。其三,医学教育平台可借此开发交互式教学模块,通过展示推理过程帮助学生理解临床思维逻辑。此外,该数据集还可用于医疗客服机器人、患者随访系统等场景,提升医疗服务的可及性与效率。
数据集最近研究
最新研究方向
该数据集聚焦于利用合成推理轨迹增强医学问答系统的生成能力,依托Gemma-3与DeepSeek V4 Flash的协同架构,构建了包含近三万个高质量医学推理样本的语料库。当前前沿方向集中于探索大语言模型在临床知识推理中的可靠性边界,通过去除截断响应与冗余数据,确保每一条推理痕迹的语义完整性与格式合规性,为医学领域的监督微调(SFT)提供了基准级训练素材。此工作呼应了生成式AI在医疗场景落地的伦理与安全诉求,其开源属性与严格的数据清洗流程,推动了可解释、可追溯的医学问答模型从实验室走向实际应用的进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务