HealthBench-BR, PCDT-QA
收藏资源简介:
HealthBench-BR包含1,780个真/假临床断言(每个指南10个,平衡50/50),每个断言成对出现:一个陈述忠实于指南,第二个修改关键细节(剂量、给药途径、监测间隔等)。正确分类需要精确的事实回忆,而不是表面级别的启发式。PCDT-QA包含890个开放式问题(每个指南5个),参考答案基于指南文本。评估使用LLM-as-a-judge流程(GPT-4.1)产生二元正确/不正确判决,适应临床响应的开放性。
HealthBench-BR consists of 1,780 true/false clinical claims (10 per guideline, balanced 50/50). Each claim appears in pairs: one statement is faithful to the guideline, while the second modifies key details such as dosage, administration route, monitoring intervals, and other relevant factors. Correct classification requires precise factual recall rather than surface-level heuristics. PCDT-QA contains 890 open-ended questions (5 per guideline), with reference answers grounded in the guideline texts. Evaluation employs the LLM-as-a-judge workflow (GPT-4.1) to generate binary correct/incorrect judgments, tailored to the open-ended nature of clinical responses.
数据集概述
Teaching LLMs Brazilian Healthcare 是一个专注于将大型语言模型(LLMs)适配到巴西统一医疗系统(SUS)临床知识的数据集与模型项目。该项目基于巴西卫生部发布的178份官方临床指南,通过持续预训练(CPT)和强化学习(GRPO)构建了领域适配流水线。
数据集构成
- 原始指南数据集:包含178份巴西卫生部官方临床指南(PCDTs、DDTs、使用协议、国家指南和护理路径),总计约540万 token。其中89份用于训练,89份用于测试。
- 合成语料库:约7000万 token,包含17,800个样本。每份指南被改写为三种互补格式(复述、维基百科风格文章、带推理的问答对),由GPT-4.1-mini、GPT-5-nano、GPT-OSS-20B和Qwen3-235B四个生成器模型生成。
- 训练数据:仅从训练集指南生成问答格式的合成数据,复述和维基百科风格数据来自所有指南。
基准测试
- HealthBench-BR:包含1,780条真/假临床断言(每份指南10条,正负样本平衡)。每条断言成对出现,一条忠实于指南,另一条修改关键细节(剂量、给药途径、监测间隔等),评估模型的精确事实召回能力。
- PCDT-QA:包含890个开放式问题(每份指南5个),附带基于指南文本的参考答案。使用GPT-4.1作为评判者进行二元正确/错误判定。
两个基准测试均按指南级别划分,训练和测试集各包含445或890个问题,与合成训练数据无重叠。
主要结果
在测试集上,经CPT和RL训练后的14B开源模型(Qwen2.5-14B-Instruct)表现如下:
- HealthBench-BR:83.9% 准确率
- PCDT-QA:85.4% 准确率
该模型在两个基准测试上均超越了GPT-4.1、GPT-5.2、Claude Sonnet 4.6、Gemini 3.1 Pro等专有前沿模型。
发布成果
所有资源整理在 HuggingFace 上的 Protocolos Clínicos BR 集合 中。
数据集:
- hugo/protocolos-clinicos-br — 178份原始指南及用于CPT的13种合成配置
- hugo/healthbench-br — 真/假基准测试
- hugo/pcdt-qa — 开放式问答基准测试
模型(基于Qwen2.5-14B-Instruct):
- protocolos-clinicos-br-rl-4gen-14b — CPT(4个生成器)+ GRPO LoRA(最佳模型,HB: 83.9, PCDT: 85.4)
- protocolos-clinicos-br-rl-1gen-14b — CPT(1个生成器)+ GRPO LoRA(HB: 75.6, PCDT: 65.4)
- protocolos-clinicos-br-cpt-4gen-14b — CPT(4个生成器),全量微调(HB: 71.1, PCDT: 86.3)
- protocolos-clinicos-br-cpt-1gen-14b — CPT(1个生成器),全量微调(HB: 69.6, PCDT: 66.3)
- protocolos-clinicos-br-cpt_lora-4gen-14b — CPT(4个生成器)通过LoRA(HB: 70.3, PCDT: 77.1)
- protocolos-clinicos-br-cpt_lora-1gen-14b — CPT(1个生成器)通过LoRA(HB: 67.2, PCDT: 65.2)
- protocolos-clinicos-br-cpt_replay-1gen-14b — CPT(1个生成器)+ FineWeb-EN回放(HB: 63.8, PCDT: 65.6)
- protocolos-clinicos-br-base_rl-1gen-14b — 仅RL(无CPT),LoRA(HB: 64.2, PCDT: 29.4)
仓库结构
train/— CPT、SFT和RL(GRPO)训练脚本healthbench-br/— 真/假评估(含和不含RAG)pcdt-qa/— 开放式问答评估(含和不含RAG)rag_utils/— 基于指南语料库的Oracle和RAG检索器(BM25、嵌入)forgetting/— 分布外基准测试(BLUEX、MMLU/ARC/HellaSwag、IFEval、HealthQA、DrBode、MedPT)




