Awesome-Scientific-Datasets-and-LLMs
收藏资源简介:
这是一个精选的资源合集,专注于收集、整理和索引与科学数据集及大型语言模型相关的学术论文、数据集和其他资源。合集覆盖了多个科学领域(如化学、物理、多组学、医学等),并参考了相关的综述论文进行组织,旨在为研究人员提供全面的数据集和模型资源索引。
This is a curated resource collection dedicated to collecting, organizing, and indexing academic papers, datasets, and other relevant materials related to scientific datasets and large language models. Spanning multiple scientific disciplines such as chemistry, physics, multi-omics, medicine, and others, this collection is structured with reference to relevant review papers, aiming to provide researchers with a comprehensive index of datasets and model-related resources.
数据集详情总结:Awesome-Scientific-Datasets-and-LLMs
该页面是一个关于科学数据集与大型语言模型(Sci-LLMs) 的资源合集,旨在为科研人员提供系统性的数据集、模型和论文索引。
内容概览
该合集围绕科学领域的大语言模型,组织为三个主要部分:
1. 科学预训练、SFT、推理与智能体数据集(🧪 Scientific Pretraining, SFT, Reasoning, and Agent Datasets)
按学科细分,收录了多个高质量数据集,涵盖生命科学、化学、物理、天文学、材料科学、地球科学和通用科学。以生命科学子集为例,包含以下代表性数据集:
- MIRAGE(农业,VQA,2025.06,37,512条)
- CROP(农业,文本QA,2024.09,211,909条,中英双语)
- ToT‑Biology(通用生物学,文本QA+CoT,2025.01,23,000条)
- Open-PMC-18M(医疗健康,图像-文本,2025.06,25,000,000条)
- GMAI-VL-5.5M(医疗健康,多模态VQA,2024.11,5.5M条)
- MedTrinity-25M(医疗健康,图像-文本/VQA,2024.08,25,000,000条)
每个数据集表格均列明了领域、模态、用途、类型、发布年份、语言、来源、标注方式、标注工具、规模等关键属性。
2. 科学评估数据集(📝 Scientific Evaluation Datasets)
同样按生命科学、化学、物理等学科分类,提供用于评测科学LLM性能的标准数据集。
3. 科学模型(🤖 Scientific Models)
收录了多个科学领域的专用大语言模型,包括通用型、物理、化学、材料科学、生命科学、天文学、地球科学等方向。
相关资源
- 配套论文:A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers
- 姊妹项目:Awesome-Agent-Scientists(聚焦AI智能体在科学研究中的进展)
发展趋势图示
页面通过三张图表展示了领域发展态势:
- 科学LLM出版物趋势(2018-2025):arXiv和PubMed上提及“language model”的论文数量快速增长
- Sci-LLMs发展范式(2018-2025):从迁移学习→扩展时代的知识整合→指令跟随→自主科研智能体四个范式
- Sci-LLMs时间线(2019-2025):按六个科学领域分类,展示了代表性模型的时间分布
引用与联系方式
- 使用该资源请引用论文:
@article{hu2025survey, ...} - 联系方式:huming@pjlab.org.cn
- CC邮箱:clma24@m.fudan.edu.cn, litianbin@pjlab.org.cn




