Kabatubare/medical-guanaco-3000
收藏资源简介:
--- title: Reduced Medical Q&A Dataset language: en license: unknown tags: - healthcare - Q&A - NLP - dialogues pretty_name: Medical Q&A Dataset --- # Dataset Card for Reduced Medical Q&A Dataset This dataset card provides comprehensive details about the Reduced Medical Q&A Dataset, which is a curated and balanced subset aimed for healthcare dialogues and medical NLP research. ## Dataset Details ### Dataset Description The Reduced Medical Q&A Dataset is derived from a specialized subset of the larger MedDialog collection. It focuses on healthcare dialogues between doctors and patients from sources like WebMD, Icliniq, HealthcareMagic, and HealthTap. The dataset contains approximately 3,000 rows and is intended for a variety of applications such as NLP research, healthcare chatbot development, and medical information retrieval. - **Curated by:** Unknown (originally from MedDialog) - **Funded by [optional]:** N/A - **Shared by [optional]:** N/A - **Language(s) (NLP):** English - **License:** Unknown (assumed for educational/research use) ### Dataset Sources [optional] - **Repository:** N/A - **Paper [optional]:** N/A - **Demo [optional]:** N/A ## Uses ### Direct Use - NLP research in healthcare dialogues - Development of healthcare question-answering systems - Medical information retrieval ### Out-of-Scope Use - Not a substitute for certified medical advice - Exercise caution in critical healthcare applications ## Dataset Structure Each entry in the dataset follows the structure: "### Human:\n[Human's text]\n\n### Assistant: [Assistant's text]" ## Dataset Creation ### Curation Rationale The dataset was curated to create a balanced set of medical Q&A pairs using keyword-based sampling to cover a wide range of medical topics. ### Source Data #### Data Collection and Processing The data is text-based, primarily in English, and was curated from the larger "Medical" dataset featuring dialogues from Icliniq, HealthcareMagic, and HealthTap. #### Who are the source data producers? The original data was produced by healthcare professionals and patients engaging in medical dialogues on platforms like Icliniq, HealthcareMagic, and HealthTap. ### Annotations [optional] No additional annotations; the dataset is text-based. ## Bias, Risks, and Limitations - The dataset is not a substitute for professional medical advice. - It is designed for research and educational purposes only. ### Recommendations Users should exercise caution and understand the limitations when using the dataset for critical healthcare applications. ## Citation [optional] N/A ## Glossary [optional] N/A ## More Information [optional] N/A ## Dataset Card Authors [optional] N/A ## Dataset Card Contact N/A
--- 标题:精简版医学问答数据集(Reduced Medical Q&A Dataset) 语言:英语 授权协议:未知 标签: - 医疗健康 - 问答(Q&A) - 自然语言处理(Natural Language Processing, NLP) - 对话数据 展示名称:医学问答数据集 --- # 精简版医学问答数据集数据集卡片 本数据集卡片详细介绍了精简版医学问答数据集(Reduced Medical Q&A Dataset),该数据集为经过筛选与均衡处理的子集,旨在服务于医疗对话与医学自然语言处理研究。 ## 数据集详情 ### 数据集概述 精简版医学问答数据集源自大型MedDialog数据集的专属子集,其数据来源于WebMD、Icliniq、HealthcareMagic及HealthTap等平台上的医患医疗对话。该数据集包含约3000条数据记录,可应用于自然语言处理研究、医疗聊天机器人开发以及医学信息检索等多种场景。 - **数据筛选方:** 未知(原始数据源自MedDialog) - **资助方 [可选]:** 无 - **分享方 [可选]:** 无 - **自然语言处理语言:** 英语 - **授权协议:** 未知(仅可用于教育/研究用途) ## 【可选】数据集来源 - **代码仓库:** 无 - **相关论文 [可选]:** 无 - **演示示例 [可选]:** 无 ## 数据集用途 ### 直接用途 - 医疗对话方向的自然语言处理研究 - 医疗问答系统开发 - 医学信息检索 ### 超出适用范围的用途 - 不得作为合规医疗建议的替代方案 - 在关键医疗场景中使用需格外谨慎 ## 数据集结构 数据集中的每条记录均遵循如下格式:`### 人类: [人类发言内容] ### 助手:[助手发言内容]` ## 数据集构建 ### 筛选依据 本数据集通过基于关键词的采样方式构建,旨在生成覆盖广泛医学主题的均衡医学问答对集合。 ### 源数据 #### 数据收集与处理流程 本数据集为文本格式,主要语言为英语,源自包含Icliniq、HealthcareMagic及HealthTap平台对话的大型"Medical"数据集。 #### 源数据生产者 原始数据由医疗专业人士与患者在Icliniq、HealthcareMagic及HealthTap等平台上进行医疗对话时生成。 ### 标注信息 [可选] 无额外标注,本数据集仅包含文本数据。 ## 偏差、风险与局限性 - 本数据集不得替代专业医疗建议 - 本数据集仅适用于研究与教育用途 ### 使用建议 用户在将本数据集用于关键医疗场景时,应充分知悉其局限性并谨慎操作。 ## 【可选】引用文献 无 ## 【可选】术语表 无 ## 【可选】更多信息 无 ## 【可选】数据集卡片作者 无 ## 数据集卡片联系方式 无
Reduced Medical Q&A Dataset 数据集概述
数据集描述
Reduced Medical Q&A Dataset 是从 MedDialog 集合的一个专门子集中派生出来的,专注于医生和患者之间的医疗对话。数据集包含约 3,000 条记录,适用于 NLP 研究、医疗聊天机器人开发和医学信息检索等多种应用。
- 语言: 英语
- 许可: 未知(假设用于教育/研究用途)
数据来源
数据集主要从 Icliniq、HealthcareMagic 和 HealthTap 等平台上的医疗对话中筛选出来。
使用场景
直接使用
- 医疗对话的 NLP 研究
- 医疗问答系统开发
- 医学信息检索
非适用场景
- 不能替代专业医疗建议
- 在关键医疗应用中需谨慎使用
数据集结构
每条记录的结构为:"### Human: [Humans text]
Assistant: [Assistants text]"
数据集创建
筛选理由
数据集通过关键词抽样,旨在创建一个涵盖广泛医疗主题的平衡的医疗问答对集合。
源数据
数据主要为英语文本,源自 Icliniq、HealthcareMagic 和 HealthTap 等平台上的医疗对话。
源数据生产者
原始数据由医疗专业人员和患者在 Icliniq、HealthcareMagic 和 HealthTap 等平台上进行医疗对话产生。
偏差、风险和限制
- 数据集不能替代专业医疗建议。
- 仅设计用于研究和教育目的。
建议
用户在使用数据集进行关键医疗应用时应谨慎并理解其限制。




