yashm/bioinformatics-qa-dataset
收藏资源简介:
一个精心整理的生物信息学和计算生物学问题回答数据集,用于模型训练。数据集包含5880个示例,涵盖65个独特主题,每行数据包含id、主题、问题和回答四个字段。该数据集主要用于生物医学和生物信息学领域的大型语言模型的指令调适和领域适应,以及生命科学术语的问答基准测试和提示-响应训练流程。数据经过清洗处理,包括去除空白字符、空行和重复数据,并重新索引id。
A curated question-answer dataset for bioinformatics and computational biology model training. The dataset contains 5880 examples covering 65 unique topics, with each row containing id, topic, question, and answer fields. It is primarily intended for instruction tuning and domain adaptation of large language models in biomedical and bioinformatics fields, as well as QA benchmarking in life-science terminology and prompt-response training pipelines. The data has been cleaned by trimming whitespace, removing empty question/answer rows and exact duplicates, and reindexing ids.




