遇见数据集

ReasonMed

收藏
arXiv2025-06-11 更新2025-11-28 收录
官方服务:

资源简介:

ReasonMed是一个大规模的医学推理数据集,包含37万个经过严格验证的示例,比之前的同类数据集大一个数量级。数据集由多个竞争性大型语言模型生成,并经过多阶段优化和验证流程,以确保推理路径的正确性和逻辑连贯性。数据集包含详细的推理过程和简洁的答案总结,有助于分析医学领域中的有效推理模式。ReasonMed旨在推动医学推理模型的发展,并解决医疗领域中知识密集型问答的挑战。

ReasonMed is a large-scale medical reasoning dataset consisting of 370,000 rigorously validated examples, which is an order of magnitude larger than prior comparable datasets. Generated by multiple competitive large language models, the dataset undergoes a multi-stage optimization and validation workflow to guarantee the correctness and logical coherence of its reasoning paths. It includes detailed reasoning processes and concise answer summaries, which facilitates the analysis of effective reasoning patterns in the medical field. ReasonMed aims to advance the development of medical reasoning models and address the challenges of knowledge-intensive question answering in the healthcare domain.

创建时间:
2025-06-11
搜集汇总
数据集介绍
ReasonMed 数据集图片
构建方式
在医学推理领域,现有数据集规模有限且多源自单一教师模型,知识覆盖不足。为突破这一瓶颈,ReasonMed数据集采用了一种创新的多智能体架构进行构建。研究团队首先从MedQA、MMLU、PubMedQA及MedMCQA等基准中汇集约19.5万个问题,随后利用Qwen-2.5-72B、DeepSeek-R1-Distill-Llama-70B及HuatuoGPT-o1-70B这三个具有互补知识优势的大语言模型,通过调整采样超参数生成了约175万条多样化推理路径。基于验证结果,数据集设计了三级难度流水线:对于简单问题,通过质量排序器选取最优两条路径;中等难度问题则触发错误精炼器,结合验证日志对路径进行修正与扩展;困难问题直接调用GPT-o1生成高保真推理链。经过这一多阶段精炼流程,最终产出了37万条高质量医学推理样本。
特点
ReasonMed数据集最显著的特征在于其空前的规模与严苛的质量控制体系。作为目前最大的开源医学推理数据集,它包含37万条经过严格验证的高质量样本,数量级远超此前同类资源。在数据多样性方面,通过融合通用型与医学专用型等多种大语言模型的输出,数据集涵盖了广泛的医学知识领域,有效弥补了单一模型的知识盲区。尤为独特的是,每条样本同时包含详细的链式推理过程与精炼的答案摘要,这种双重结构为系统分析不同推理策略在医学问答中的效能提供了理想平台。此外,多级难度流水线的设计确保了从简单到复杂问题的均匀覆盖,使得数据集能够全面支撑对推理模型能力的评估与训练。
使用方法
ReasonMed数据集为训练和评估医学推理模型提供了灵活且高效的使用方案。在训练层面,研究者可根据需求选择三种不同粒度的监督微调范式:仅使用详细链式推理的CoT模式,仅使用精炼摘要的Response模式,以及将两者结合的Reason模式。实验表明,融合详细推理与简洁摘要的混合策略(Reason模式)在多个基准上取得了最优性能,训练出的ReasonMed-7B模型在PubMedQA等任务上甚至超越了LLaMA3.1-70B等更大参数规模的模型。在评估方面,数据集配套了基于大语言模型的评分评估器(Score Evaluator),可对生成的推理路径进行0到10分的量化评分,为不同方法的横向比较提供了标准化手段。
背景与挑战
背景概述
在知识密集型医疗问答领域,尽管基于推理的大语言模型在数学和编程任务中展现出卓越能力,但其在医疗场景中的应用仍面临显著挑战。现有医疗推理数据集如medical-o1-reasoning-SFT和Medical-R1-Distill-Data受限于规模与知识覆盖范围,且多源于单一教师模型,缺乏系统性优化。为弥合这一空白,由阿里巴巴达摩院、兰州大学、中国人民大学等机构的研究人员于2025年联合发布了ReasonMed——当前规模最大的开源医疗推理数据集。该数据集汇聚19.5万道涵盖MedQA、MedMCQA、PubMedQA及MMLU医学子集的试题,通过多智能体框架生成约175万条推理路径,经严格验证与优化后精选出37万条高质量样本,为医疗推理模型训练提供了前所未有的数据基础。
当前挑战
ReasonMed所聚焦的核心挑战体现在领域问题与数据构建两个层面。在领域问题层面,医疗问答高度依赖专业知识,要求模型不仅具备逻辑推理能力,还需准确理解病理生理学、药理学等复杂医学知识,且推理路径必须兼具逻辑连贯性与医学事实准确性——这与数学或编程领域的可验证性形成鲜明对比。在数据构建层面,首要挑战是如何从多个异构大语言模型(如通用模型Qwen-2.5-72B、DeepSeek-R1-Distill-Llama-70B及医学专用模型HuatuoGPT-o1-70B)生成的多样化推理路径中,剔除事实错误并保留高质量样本。为此,研究团队设计了包含验证器、质量排序器与错误修正器的多阶段流水线,针对不同难度等级的问题分别采用直接筛选、定向修正和GPT-o1重生成策略,在保证数据规模的同时实现了严格的质量控制。
常用场景
经典使用场景
在知识密集型的医学问答领域,ReasonMed数据集被广泛用于训练和评估大语言模型的推理能力。其最经典的场景是将复杂的链式思维推理与简洁的答案摘要结合,通过监督微调提升模型在多项选择题上的表现。研究者常利用该数据集对7B参数级别的模型进行多尺度微调,分别在MedQA、MedMCQA、PubMedQA和MMLU等基准上验证推理路径的完整性与答案的准确性,从而探索显式推理对医学知识问答性能的提升效果。
衍生相关工作
ReasonMed数据集推动了多个方向的衍生研究工作,包括多智能体数据协作框架的扩展(如将医学、编程、数学等多领域推理任务统一构建)、推理路径质量评估与自动修正方法(如基于验证器日志的Error Refiner机制),以及“LLM-as-a-Judge”范式在医学领域的确立。其提出的多级难度自适应优化管道(Easy/Medium/Difficult Pipeline)为后续构建高质量、高覆盖度的专门领域数据集提供了可复现的方法论参考。
数据集最近研究
最新研究方向
ReasonMed作为当前规模最大的开源医学推理数据集,聚焦于利用多智能体协作框架生成、验证并优化复杂临床问答中的链式推理路径。其前沿方向在于系统性地探索详尽的思维链推理与精炼摘要响应在知识密集型医学问答中的最佳融合策略,通过混合式微调方法显著提升了模型在多个基准上的表现。该研究紧密关联大语言模型在专业医疗领域应用的热点,通过构建涵盖多源模型知识与多级质量管线的数据生成范式,有效缓解了现有医学推理数据集规模有限、知识覆盖不足等瓶颈。ReaconMed-7B模型以7B参数量级超越多个更大规模模型,为构建高效、可靠的临床决策支持系统提供了坚实的数据基础和理论依据,推动了医学人工智能在推理能力与实用化方向上的重要进展。
相关研究论文
  • 1
    通过阿里巴巴达摩院, 兰州大学基础医学院, 中国人民大学高瓴人工智能学院, 北京关键模型与智能治理实验室, 教育部下一代智能搜索与推荐工程研究中心, 湖畔实验室 · 2025年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务