usmle_textbooks
收藏资源简介:
该数据集是一个基于开源教科书文本构建的数据集,旨在为语言模型训练或相关自然语言处理任务提供高质量的领域文本数据。数据内容来源于三本公开获取的教科书:1) 《流行病学》(Epidemiology,ISBN 13: 9781957213651);2) 《临床前学生神经科学》(Neuroscience for Pre-Clinical Students,ISBN 978-1-949373-80-6);3) 《临床前学生微生物学、药理学和免疫学》(Microbiology, Pharmacology, and Immunology for Pre-Clinical Students,ISBN 978-1-962841-04-7)。数据集包含四个分割:训练集(train,759个样本)和三个以“qwen3_5”命名的模型生成或处理集(qwen3_5_9b、qwen3_5_27b、qwen3_5_35b,各1000个样本),总计3759个样本,数据总大小约8.3 MB。每个样本包含三个字段:source_book(字符串,指示文本来源的教科书)、text(字符串,教科书文本内容)、emb(浮点数列表,代表文本的嵌入向量表示)。该数据集适用于文本嵌入学习、领域语言模型微调、教科书内容分析或医学/科学教育相关的自然语言处理任务。
数据集概述:usmle_textbooks
该数据集由 LeoZotos 提供,主要面向 USMLE(美国医师执业资格考试)领域,汇集了多本医学教材的文本内容及其对应的嵌入向量表示,可用于医学文本分析、信息检索或模型训练。
数据特征
每条数据包含三个字段:
- source_book(字符串):文本来源的教材名称或标识。
- text(字符串):教材中的文本片段内容。
- emb(浮点数列表):文本对应的嵌入向量,用于表征语义信息。
数据划分与规模
数据集包含一个默认配置,下分为6个数据划分,总大小约为12.87MB,下载大小约为6.71MB:
| 划分名称 | 样本数 | 字节数 |
|---|---|---|
| train | 759 | 1,874,440 |
| qwen3_5_9b | 1,000 | 2,173,146 |
| qwen3_5_27b | 1,000 | 2,138,902 |
| qwen3_5_35b | 1,000 | 2,106,957 |
| gemma4_31b | 1,000 | 2,432,260 |
| gpt_20b | 1,000 | 2,141,507 |
其中 train 为原始训练数据,其余划分可能对应不同模型生成的增强或扩展数据。
数据来源
数据集所引用的教材包括:
- Epidemiology:来源为 VTechWorks,ISBN 13: 9781957213651,可访问链接
https://vtechworks.lib.vt.edu/items/3f46b25c-c8e7-46bc-a7ef-64e0db8556be。 - Neuroscience for Pre-Clinical Students:来源为 Pressbooks at Virginia Tech,ISBN 978-1-949373-80-6,可访问链接
https://pressbooks.lib.vt.edu/neuroscience/。 - Microbiology, Pharmacology, and Immunology for Pre-Clinical Students:来源为 Pressbooks at Virginia Tech,ISBN 978-1-962841-04-7,可访问链接
https://pressbooks.lib.vt.edu/micropharmimmuno/。
这些教材均为公开可用的医学教育资源,内容涵盖流行病学、神经科学、微生物学、药理学和免疫学等核心医学领域。





