meddies-consultant
收藏资源简介:
Meddies Consultant 是一个以越南语为主的临床咨询和问答监督数据集,旨在为构建更安全的医疗AI提供支持。该数据集包含多轮双语(越南语和英语)咨询、随机医疗问答以及仅含问题的提示,适用于医疗对话生成和问答任务。数据集分为四个配置:english(109,005条多轮英语咨询,平均16.12轮/例)、vietnamese(58,064条多轮越南语咨询,平均12.33轮/例)、RandomQA(67,372条问答监督数据)和RandomQuestion(61,162条仅含问题的数据)。数据字段包括咨询配置的messages、target_disease和patient_persona,以及问答数据的question、answer、category和complexity。数据集覆盖1,236种目标疾病,并采用FIFE和OPQRST等患者中心化访谈框架。适用于越南语优先的医疗助手指令调优、双语迁移研究以及医疗检索实验。数据集为CC-BY-NC-4.0许可,强调其作为合成训练数据的性质,不应用于临床决策。
Meddies Consultant is a Vietnamese-focused clinical consultation and question-answer supervision dataset designed to support the development of safer medical AI. The dataset includes multi-turn bilingual (Vietnamese and English) consultations, random medical Q&A, and question-only prompts, suitable for medical dialogue generation and Q&A tasks. The dataset is divided into four configurations: english (109,005 multi-turn English consultations, averaging 16.12 turns/case), vietnamese (58,064 multi-turn Vietnamese consultations, averaging 12.33 turns/case), RandomQA (67,372 Q&A supervision data), and RandomQuestion (61,162 question-only data). Data fields include messages, target_disease, and patient_persona for consultation configurations, and question, answer, category, and complexity for Q&A data. The dataset covers 1,236 target diseases and employs patient-centered interview frameworks such as FIFE and OPQRST. It is suitable for Vietnamese-priority medical assistant instruction tuning, bilingual transfer research, and medical retrieval experiments. The dataset is licensed under CC-BY-NC-4.0, emphasizing its nature as synthetic training data and not for clinical decision-making.
Meddies Consultant 数据集概述
数据集基本信息
- 数据集名称:Meddies Consultant
- 语言:越南语(vi)、英语(en)
- 许可证:CC-BY-NC-4.0
- 标注创建者:机器生成
- 语言创建者:机器生成
- 多语言类型:多语言
- 数据规模:100K < n < 1M
- 任务类别:问答、文本生成
- 标签:医疗、健康护理、越南语、英语、临床对话、FIFE、OPQRST、多轮对话
数据集内容与结构
该数据集包含四个配置(config),提供不同风格的监督数据类型:
| 配置名称 | 行数 | 平均轮次/示例 | 说明 |
|---|---|---|---|
| english | 109,005 | 16.12 | 多轮英语咨询对话,包含 target_disease 和 patient_persona |
| vietnamese | 58,064 | 12.33 | 多轮越南语咨询对话,采用相同精简模式 |
| RandomQA | 67,372 | 2.00 | 问答形式的监督数据,包含 category 和 complexity |
| RandomQuestion | 61,162 | 1.00 | 仅问题的监督数据,适用于提示或检索类任务 |
数据模式(Schema)
- 咨询配置(english / vietnamese):
id、subset、messages、target_disease、turns_count、patient_persona - RandomQA:
id、messages、question、answer、category、complexity、turns_count - RandomQuestion:
id、messages、question、category、complexity、turns_count
数据覆盖与统计
| 配置 | 行数 | 用户消息数 | 助手消息数 |
|---|---|---|---|
| english | 109,005 | 826,308 | 930,683 |
| vietnamese | 58,064 | 329,728 | 386,082 |
| RandomQA | 67,372 | 67,372 | 67,372 |
| RandomQuestion | 61,162 | 61,162 | 0 |
数据质量与控制
公开资料中明确提及以下质量控制措施:
- 确定性回退ID(针对无源ID的行)
- 重复检测(文件级别和全局级别)
- 解析与结构异常检查
- 审核标准涵盖:完整性、适当性、自然性、共情能力、OPQRST质量、FIFE对齐、结构连贯性和安全性
适用范围与限制
适用场景
- 越南语优先的医疗咨询助手指令微调
- 追问能力和对话结构评估
- 英越双语咨询数据的迁移学习
- 窄域医疗检索或答案生成实验的问答监督
限制说明
- 属于合成训练数据,非医疗建议
- 不可作为授权的临床应用或部署审批
- QA行不可作为引用的临床指导
- 英越数据分割不保证平衡
- 精简模式不代表完整的患者病历
使用示例
python from datasets import load_dataset
consult_vi = load_dataset("Meddies/meddies-consultant", "vietnamese", split="train") consult_en = load_dataset("Meddies/meddies-consultant", "english", split="train") qa = load_dataset("Meddies/meddies-consultant", "RandomQA", split="train")
支持通过 streaming=True 参数进行流式加载。
引用信息
bibtex @dataset{meddies_consultant_2026, title={Meddies Consultant: Vietnamese-first medical consultation and QA dataset}, author={MeddiesAI}, year={2026}, publisher={Hugging Face}, url={https://huggingface.co/datasets/Meddies/meddies-consultant} }




