triage-medical-dataset
收藏资源简介:
POC Triage Medical 是一个双语(法语/英语)医疗初诊分诊数据集,主要用于监督微调(SFT)和偏好对齐(DPO)任务。数据集来源于四个主要语料库:FrenchMedMCQA、MediQAl、MedQuAD 和 UltraMedical-Preference,涵盖多选题、开放式问答和偏好对数据。数据集规模在10万到100万样本之间,包含训练集、验证集和测试集。每个样本包含患者案例描述、结构化响应(分诊)、症状、病史、生命体征等字段,并标注分诊级别(最高紧急、中度紧急、延迟紧急)。数据集经过匿名化处理,符合GDPR要求,并包含完整性校验和安全临床规则。适用于医疗文本生成、问答系统等自然语言处理任务。
POC Triage Medical is a bilingual (French/English) medical initial triage dataset primarily intended for supervised fine-tuning (SFT) and direct preference optimization (DPO) tasks. The dataset is derived from four main corpora: FrenchMedMCQA, MediQAl, MedQuAD, and UltraMedical-Preference, covering multiple-choice questions, open-ended question answering, and preference pair data. With a scale ranging from 100,000 to 1,000,000 samples, it includes training, validation, and test splits. Each sample contains fields such as patient case description, structured triage response, symptoms, medical history, and vital signs, and is annotated with triage levels: highest emergency, moderate emergency, and delayed emergency. The dataset has been anonymized to comply with GDPR requirements, and incorporates integrity checks and safe clinical guidelines. It is suitable for natural language processing tasks including medical text generation and question answering systems.
数据集卡片 - POC Triage Medical
1. 基本描述
- 名称: POC Triage Medical
- 语言: 法语 (fr), 英语 (en)
- 许可证: CC BY 4.0
- 任务类别: 文本生成, 问答
- 标签: 医疗, 分诊, 监督微调, 直接偏好优化, 双语
- 规模: 100K < n < 1M
2. 数据集构成与配置
数据集包含两个主要配置,用于不同的训练目的:
- SFT配置: 用于监督微调的指令/响应对。
- 文件路径:
sft/train.jsonl,sft/validation.jsonl,sft/test.jsonl
- 文件路径:
- DPO配置: 用于偏好对齐的 chosen/rejected 对。
- 文件路径:
dpo/train.jsonl,dpo/validation.jsonl,dpo/test.jsonl
- 文件路径:
3. 数据来源与清单
数据集由以下四个来源的语料库构成:
| 数据集 | 类型 | 语言 | 大小 | 许可证 | PII风险 | 用途 | 相关性/10 |
|---|---|---|---|---|---|---|---|
FrenchMedMCQA (qanastek/frenchmedmcqa) |
多项选择题 | 法语 | 3,105 | Apache-2.0 | 低 | SFT + DPO | 6 |
MediQAl (ANR-MALADES/MediQAl) |
多项选择题 + 开放式问题 | 法语 | 32,603 | CC BY 4.0 | 低(待确认) | SFT + DPO | 7 |
MedQuAD (abachaa/MedQuAD) |
问答对 | 英语 | 47,457 | CC BY 4.0 | 低 | SFT + DPO | 5 |
UltraMedical-Preference (TsinghuaC3I/UltraMedical-Preference) |
偏好对 (chosen/rejected) | 英语 | 100k+ | MIT | 低(待验证) | 仅用于DPO | 6 |
来源选择规则
- 许可证为
unknown_verify的来源在解决前被排除。 pii_risk高于low的来源不在范围内。- UltraMedical-Preference 保留
label_source=gpt4和confidence=medium的标签。 - UltraMedical-Preference 被排除在精选的SFT数据之外,仅用于DPO。
4. 构建策略
SFT数据 (~5,000 对)
- 目标数量: 5,000 对指令/响应。
- 目标分布: 2,500 法语 / 2,500 英语(容忍度 60/40)。
- 混合来源:
- 法语: MediQAl + FrenchMedMCQA(将多项选择题转换为分诊风格)。
- 英语: MedQuAD。
- 强制响应模板:
- 病例重述。
- 缺失问题(症状、病史、生命体征)。
- 建议的分诊级别。
- 危险信号。
- 升级指示。
DPO数据
- 直接基础: UltraMedical-Preference (
chosen/rejected对),附带label_source: gpt4和confidence: medium。 - 补充“黄金”数据集(目标):
- 500 至 2,000 对分诊数据。
- 偏好标准:安全性、谨慎性、导向一致性、明确的危险信号。
- 优先对关键病例进行人工标注。
优先级排序
- FrenchMedMCQA
- MediQAl (CC BY 4.0)
- UltraMedical-Preference (中等置信度标签)
- MedQuAD
5. 规范模式
每条记录都标准化为以下模式:
| 字段 | 类型 | 描述 |
|---|---|---|
id |
string | 唯一标识符 |
schema_version |
string | 模式版本 (v1.0.0) |
lang |
string | 语言 (fr / en) |
instruction |
string | 患者病例描述 |
response |
string | 结构化响应(分诊) |
symptoms |
string | 呈现的症状 |
history |
string | 病史 |
vitals |
string | 生命体征 |
triage_level |
string | urgence_maximale / urgence_moderee / urgence_differee |
triage_confidence |
string | 置信度水平 |
source |
string | 原始来源 |
source_split |
string | 原始划分(如适用) |
confidence |
string | 标签置信度 |
license |
string | 来源许可证 |
anonymized |
bool | 如果已匿名化则为 true |
created_at |
string | 创建时间戳 |
分诊标签
urgence_maximaleurgence_modereeurgence_differee
数据划分
- train / validation / test (近似按
语言 × 分诊级别分层)。
6. 治理与安全
数据保护与匿名化
- 自动GDPR验证 + 建议人工审查。
- 每条记录可追溯来源和许可证。
- 强制匿名化(字段
anonymized=true)。
完整性
- SHA256校验和 + 大小 + 时间戳记录在
reports/integrity_manifest.json中。 - 验证命令:
make data-integrity-check。
临床安全规则
- 安全性 > 完备性。
- 禁止:未经检查的确定性诊断、有风险的个性化处方。
- 义务:阐明不确定性和紧急阈值。
来源验证
- 每个来源的报告:
validation/<source>/final_validation.json。 - 全局摘要:
reports/source_validation_summary.json。 - 裁决:
GO,VALIDATE或NO_GO。 - 如果所需来源不是
GO,则week1-all失败。 - 阈值在
configs/pipeline.yaml → source_validation中配置。
版本控制
- 脚本 + 清单: Git。
- 大型数据集: Hugging Face Datasets。
- 每条记录的元数据:
source,source_license,redistribution_ok,pii_risk,confidence_level。
7. 相关命令
bash make data-integrity-build # 生成完整性清单 make data-integrity-check # 检查完整性 make data-source-validate # 验证来源 make fetch-raw # 下载原始数据



