遇见数据集

trillionlabs/TheBioCollection

收藏
Hugging Face2026-07-20 更新2026-07-22 收录
官方服务:

资源简介:

TheBioCollection是一个包含526亿令牌的预训练规模生物学语料库,旨在将异构生物资源转化为适合大语言模型训练的数据。它通过一个构建流程创建,该流程收集跨生物领域的资源,通过去重、实体标记和增强进行精炼,用工具计算的生物学属性进行丰富,并将其呈现为具有可编程验证答案的指令形式数据。该语料库涵盖广泛的生物领域,包括小分子、蛋白质、基因组序列、细胞和通路。

TheBioCollection is a 52.6B-token pretraining-scale corpus for biology that transforms heterogeneous biological resources into LLM training-friendly data. It is built through a construction pipeline that collects resources across biological domains, refines them through deduplication, entity tagging and augmentation, enriches them with tool-computed biological properties, and render them as instruction-form data with programmatically verifiable answers. The corpus spans broad biological domain across small molecules, proteins, genomic sequences, cells, and pathways.

提供机构:
trillionlabs
搜集汇总
数据集介绍
trillionlabs/TheBioCollection 数据集图片
构建方式
TheBioCollection是一个面向生物学领域的大规模预训练语料库,包含526亿个token。其构建流程首先从多个异构生物学资源中收集数据,涵盖小分子、蛋白质、基因序列、细胞和通路等广泛领域。随后,通过去重、实体标注与增强等步骤对数据进行精炼,并利用工具计算的生物学属性对其进行丰富。最终,将数据转化为带有程序化可验证答案的指令形式数据,形成包含自由文本流(33.8B tokens)和指令流(18.9B tokens)两大组成部分的语料库。
特点
该数据集的特点在于其跨领域的全面覆盖与高质量的结构化设计。自由文本流保留了原始生物学文献的丰富信息,而指令流则通过任务导向的格式提升了模型的可训练性。数据集中每个条目均包含'text'字段与'record_type'标识,便于区分两种数据来源。经评估,在该语料库上训练的Gravity-bio-16B-A3B模型在所有生物学领域的平均性能上相较于基线模型提升了26.7%,突显了其对生物语言模型训练的显著增强效果。
使用方法
数据集以Zstandard压缩的JSON行格式存储,提供两个配置:'free_text_stream'和'instruction_stream'。用户可通过Hugging Face数据集库加载指定配置,例如使用'load_dataset'函数或直接读取压缩文件。每个JSON对象包含'text'内容与'record_type'元数据。该语料专用于生物学语言模型的预训练与研究,在应用前应进行充分验证,并不适用于临床、诊断或治疗决策场景。评估套件及代码可在配套的TheBioCollection-Eval仓库中获取。
背景与挑战
背景概述
TheBioCollection数据集由Lunit、Trillion Labs等机构于2026年联合构建,旨在解决生物学领域大语言模型训练数据的稀缺与异质性难题。该数据集整合了小分子、蛋白质、基因组序列、细胞及信号通路等多个生物学子领域的异构资源,通过去重、实体标注、工具计算的生物学属性增强及指令化转换等流程,构建了规模达526亿词元的预训练语料库。其发布显著推动了生物大语言模型的发展,在分子设计、蛋白质功能预测、基因组定位等任务上取得了性能翻倍的效果,为科学基础模型研究提供了关键数据基石。
当前挑战
该数据集面临的核心挑战在于生物学知识的跨模态融合与结构化表达。首先,生物学领域涵盖从分子到通路的多层次、异质性数据,如何将序列、结构、功能等不同类型的信息统一转化为适合语言模型训练的指令形式,并确保程序化验证答案的准确性,是一大技术难点。其次,构建过程中需处理海量数据的去重与实体标注,避免信息冗余与噪声干扰,同时利用生物计算工具自动计算的属性需经过严格质控,以防错误传播。此外,数据覆盖范围的全面性与领域平衡性也需精细权衡,以避免模型在各子域上的性能偏差。
常用场景
经典使用场景
TheBioCollection作为面向生物学领域的大规模预训练语料库,最经典的使用场景是为大型语言模型提供跨生物领域的统一训练数据。该数据集融合了小分子、蛋白质、基因组序列、细胞与通路等多个维度的异构生物学资源,通过实体标注、工具计算属性增强和指令格式化处理,为模型学习生物实体间的语义关联与结构规律奠定了数据基础。研究者可基于其自由文本流和指令流两种配置,分别进行纯文本预训练与指令微调,从而模型在分子重建、蛋白质功能预测、基因组调控元件定位以及细胞类型识别等任务上获得显著性能提升。
解决学术问题
该数据集有效解决了生物学领域预训练语料稀缺且碎片化的学术难题。传统生物数据集多聚焦单一模态或特定任务,缺乏跨尺度的统一表示,导致模型难以捕捉从分子到细胞通路的多层级生物学规律。TheBioCollection通过构建系统化的数据流水线,将分散在不同数据库中的生物资源转化为格式统一、富含语义标签的训练语料。这一工作不仅弥补了生物大语言模型在预训练阶段的数据短板,更为跨模态生物学知识融合、分子-蛋白质相互作用推理以及多任务联合学习等研究方向提供了标准化基准,推动了生物学人工智能从专用模型向通用基础模型的范式演进。
衍生相关工作
围绕TheBioCollection已衍生出多项具有影响力的研究工作。最直接的工作是配套发布的TheBioCollection-Eval评测套件,为生物语言模型提供了跨领域标准化评估基准。在此基础上,研究者基于该语料库中间训练了Gravity-bio-16B-A3B模型,其在分子重建、功能蛋白设计、基因组定位和通路识别等20余项任务上的整体性能较基础模型提升超过一倍(平均分数从0.239跃升至0.506)。该数据集还催生了生物学指令微调范式的探索,如利用其指令流部分训练模型执行分子属性问答与结构生成任务。此外,数据集构建中提出的实体标注增强、工具计算属性注入等方法论,已被后续多项生物多模态预训练工作借鉴,推动了生物学知识图谱增强型语言模型的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务