HPAI-BSC/medmcqa-cot
收藏资源简介:
为了提升MedMCQA数据集训练分割的答案质量,我们利用Mixtral-8x7B模型生成Chain of Thought(CoT)答案。我们为该数据集创建了一个自定义提示,并手工制作了一些示例。对于多选题,我们要求模型重新表述并解释问题,然后解释每个选项与问题的关系,最后总结这些解释以得出最终答案。在生成合成数据的过程中,模型还会被提供解决方案和参考答案。如果模型未能生成正确的响应,我们会重新生成解决方案,直到生成正确的响应为止。更多细节可在相关论文中找到。
为了提升MedMCQA数据集训练分割的答案质量,我们利用Mixtral-8x7B模型生成Chain of Thought(CoT)答案。我们为该数据集创建了一个自定义提示,并手工制作了一些示例。对于多选题,我们要求模型重新表述并解释问题,然后解释每个选项与问题的关系,最后总结这些解释以得出最终答案。在生成合成数据的过程中,模型还会被提供解决方案和参考答案。如果模型未能生成正确的响应,我们会重新生成解决方案,直到生成正确的响应为止。更多细节可在相关论文中找到。
数据集概述
基本信息
- 名称: medmcqa-cot
- 许可证: Apache 2.0
- 任务类别:
- 问答
- 多选题
- 语言: 英语
- 标签:
- 医学
- 生物学
- 大小范围: 100K<n<1M
数据集描述
该数据集通过使用Mixtral-8x7B生成思维链(CoT)答案,增强了MedMCQA数据集的训练分割答案质量。数据集创建过程中,模型会重新表述和解释问题,并对每个选项进行解释,最终总结得出最终答案。对于模型未能正确生成答案的情况,会重新生成解决方案直至得到正确答案。
数据集来源
数据集创建
- 目的: 提供一个基于medmcqa的高质量、易于使用的指令调优数据集。
引用信息
-
BibTeX:
@misc{gururajan2024aloe, title={Aloe: A Family of Fine-tuned Open Healthcare LLMs}, author={Ashwin Kumar Gururajan and others}, year={2024}, eprint={2405.01886}, archivePrefix={arXiv}, primaryClass={cs.CL} } @InProceedings{pmlr-v174-pal22a, title = {MedMCQA: A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering}, author = {Pal, Ankit and others}, booktitle = {Proceedings of the Conference on Health, Inference, and Learning}, year = {2022}, publisher = {PMLR} }




