遇见数据集

cMedQA2

收藏
OpenCSG2024-02-20 更新2026-01-19 收录
官方服务:

资源简介:

cMedQA2中文医学问答数据集1.0,可用于非商业研究.cMedQA2包含10.8万个单轮对话,包括咨询和指导情况。通过使用关键字过滤和命名实体识别过滤记录后,分别从每个数据集中随机选择40万和2万个样本作为SFT数据集构建的源样本。

The cMedQA2 Chinese Medical Question Answering Dataset 1.0 is intended for non-commercial research purposes only. It contains 108,000 single-turn dialogues covering consultation and guidance scenarios. After filtering records via keyword filtering and named entity recognition, 400,000 and 20,000 samples were randomly selected from each dataset respectively as source samples for supervised fine-tuning (SFT) dataset construction.

提供机构:
billionaire
创建时间:
2024-02-21
搜集汇总
数据集介绍
cMedQA2 数据集图片
背景与挑战
背景概述
cMedQA2是一个中文医学问答数据集,包含10.8万个单轮对话,用于非商业研究,数据经过匿名化处理以保护隐私。数据集分为训练集、开发集和测试集,支持医学问答任务,并与一篇关于多尺度注意力交互网络的学术论文相关联。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务