遇见数据集

dnagpt/biopaws-2

收藏
Hugging Face2026-06-28 更新2026-07-22 收录
官方服务:

资源简介:

BioPAWS-2是首个用于生物基础模型的聊天形式指令调优数据集和基准测试,它将整个生物序列分析领域(包括分类、回归、检索、结构、变异效应、跨模态、推理和多模态任务)重新表达为一个统一的聊天形式指令调优语料库。该数据集同时作为训练资源(SFT语料库)和基准测试:任何模型(如具有自定义头的专用蛋白质/DNA语言模型、零样本回答的通用LLM,或在此语料库上微调的LLM)都可以在一个共同轴上进行训练和评估。数据集包含约306K个示例,覆盖22个任务和9个任务家族,采用统一的聊天格式,设计为可扩展,并支持双重评估协议(零样本QA和微调后评估)。任务家族包括配对同源性、蛋白质功能、DNA分类、变异效应、结构分析、跨模态、推理链、生物医学QA和多模态任务。每个示例以JSON聊天记录形式存储,包含指令、候选标签和答案,适用于分类和回归任务。数据集整合了多个来源的数据,如BioPAWS、LLaMA-Gene、ProteinGym、UniProt、BixBench等,每个记录带有自己的许可和来源字段。

BioPAWS-2 is the first chat-form instruction-tuning dataset and benchmark for biological foundation models, re-expressing the entire landscape of biological sequence analysis — including classification, regression, retrieval, structure, variant effect, cross-modal, reasoning, and multimodal tasks — as a single chat-form instruction-tuning corpus. It serves simultaneously as a training resource (SFT corpus) and a benchmark: any model, such as a specialized protein/DNA language model with a custom head, a general-purpose LLM answering zero-shot, or an LLM fine-tuned on this corpus, can be trained and evaluated on one common axis. The dataset contains approximately 306K examples across 22 tasks and 9 task families, using a uniform chat format and designed for extensibility, with a dual evaluation protocol (zero-shot QA and fine-tune-then-evaluate). Task families cover pairwise homology, protein function, DNA classification, variant effect, structure analysis, cross-modal tasks, reasoning chains, biomedical QA, and multimodal tasks. Each example is stored as a JSON chat record with instructions, candidate choices, and answers, suitable for classification and regression tasks. It consolidates data from multiple sources like BioPAWS, LLaMA-Gene, ProteinGym, UniProt, BixBench, etc., with each record carrying its own license and source fields.

提供机构:
dnagpt
搜集汇总
数据集介绍
dnagpt/biopaws-2 数据集图片
构建方式
BioPAWS-2通过将生物学序列分析的全景任务——涵盖分类、回归、检索、结构预测、变异效应分析、跨模态推理以及多模态理解——统一重构为对话形式的指令微调语料库。数据集整合了来自BioPAWS的同源配对、LLaMA-Gene指令语料、ProteinGym的深度突变扫描实验、UniProt衍生的蛋白质知识问答、Protein2Text-QA跨模态翻译、OPI-Struc结构推理、protein_catalogue逻辑推理、BixBench生物医学问答以及Vis-CheBI20分子图像识别等多源异构数据。每个样本均遵循标准化的JSON聊天记录格式,包含任务家族标识、模态类型、用户指令与助手回复、候选标签列表及评估指标等字段,确保了框架的通用性与可扩展性。
使用方法
使用者可直接对预训练语言模型进行零样本评估,以考察其内在生物学知识与指令遵循能力;亦可利用训练集对通用大模型进行LoRA参数高效微调,并在测试集上评测微调后的性能提升。专用蛋白质或DNA语言模型可沿用其原生头部训练协议,在相同数据划分上完成领域适配。数据集提供了标准化的train/val/test三部分划分,每个样本的messages字段明确包含user与assistant角色,便于直接输入对话模型。对于回归任务,数值已桶化为低/中/高三类并保留原始值于meta字段,支持Spearman相关系数计算。评估指标包括F1分数与Spearman相关系数,覆盖分类与回归两类场景。
背景与挑战
背景概述
BioPAWS-2是由Wang Liang于2026年创建的生物序列分析指令微调数据集与基准,旨在将蛋白质、DNA等生物学序列分析中的分类、回归、检索、变异效应、跨模态推理等任务统一为对话格式的指令微调语料。该数据集由多个研究机构共同参与构建,整合了BioPAWS、LLaMA-Gene、ProteinGym、UniProt等资源,涵盖306K条样本和22项任务,横跨9大任务家族。其核心创新在于首次实现了生物学基础模型的零样本测试与微调评估双模式,填补了生物领域缺乏统一对话式指令微调资源的空白,对生物信息学与语言模型交叉研究具有重要推动作用。
当前挑战
BioPAWS-2面临的主要挑战包括:第一,如何将传统生物学分析任务(如同源性比对、基因分类)转化为统一对话格式,同时确保标签枚举的全面性和答案的准确性;第二,多模态数据(如分子图像与文本描述)的对齐与整合,以及跨模态推理任务中不同数据源的一致性维护;第三,在构建过程中,需要从多个异构数据源(如ProteinGym的DMS评分、UniProt的QA)中提取并标准化信息,克服数据格式差异和许可兼容性问题;第四,评估协议需要同时支持零样本和微调两种模式,这对模型在不同任务集上的泛化能力和训练效率提出了更高要求。
常用场景
经典使用场景
BioPAWS-2作为首个对话式指令微调数据集与基准,在生物基础模型领域开辟了全新范式。研究者可借助其统一的聊天格式,对蛋白质/DNA语言模型进行端到端的监督微调,或将通用大语言模型在零样本条件下直接评估。该数据集覆盖序列分类、回归、检索、结构预测、变异效应分析、跨模态推理及多模态理解等九大任务家族,囊括22个具体任务,共计约30.6万条指令样本。其双模式评估协议——零样本问答与微调后评测——为模型能力提供了前所未有的纵向对比维度,使得不同架构的模型(从专用蛋白质模型到通用LLM)均可沿同一轴线进行公平、可复现的基准测试。这一设计不仅简化了生物学领域的模型选型流程,更推动了指令调优技术在基因组学与蛋白质工程中的系统性应用。
解决学术问题
BioPAWS-2直面生物序列分析领域长期存在的基准碎片化与评估标准不统一问题。传统基准如TAPE、PEER、FLIP仅支持带任务头的预训练模型评估,而ProteinGym局限于深度突变扫描得分,均无法兼容大语言模型的零样本能力与微调适应性。该数据集通过引入聊天格式的统一指令框架,首次将九大任务家族纳入可训练与可评估的双轨体系,解决了多模态融合(如DNA-蛋白质一致性推理)、链式思维推理(如蛋白质折叠逻辑推演)及结构化知识问答等深层次学术挑战。其变革性影响在于打破了生物信息学中模型与任务间的刚性绑定,使研究者能够系统探究模型在训练数据之外的泛化边界,并为生物基础模型的涌现属性量化分析提供了标准化工具。
实际应用
在实际应用中,BioPAWS-2助力生物科技企业加速蛋白质功能注释与药物靶点发现流程。例如,在抗体工程中,研究人员可利用该数据集的变异效应与结构分类任务,快速筛选出可能影响结合亲和力的关键突变位点,显著缩短候选分子优化周期。基因组学领域,其DNA功能元件识别(如启动子、剪接位点)能力可辅助临床基因诊断中的变异致病性解读,提升罕见病相关突变的风险分层精度。此外,结合多模态模块的分子图像识别与IUPAC命名生成,该数据集赋能药物化学团队从化学结构图像中自动提取化合物信息,推动实验室文档数字化与高通量虚拟筛选技术的深度融合。这些能力共同构建了从序列到功能、从结构到表型的全链条计算支撑体系。
数据集最近研究
最新研究方向
BioPAWS-2作为首个面向生物基础模型的聊天式指令微调数据集与基准,正引领着生物学序列分析领域向统一化、多模态与推理能力融合的前沿方向演进。该数据集将分类、回归、检索、变异效应及跨模态任务整合为单一对话格式的指令微调语料,突破了传统基准(如TAPE、ProteinGym)仅支持特定模型头或单模态评估的局限。其创新的双模式评估协议(零样本问答与微调后评估)首次量化了模型的可训练性指标Δ,为通用大语言模型与专业蛋白质/DNA语言模型提供了统一的竞争轴心。当前研究热点聚焦于利用其9大任务家族涵盖的同源性、功能注释、基因组分类及Chain-of-Thought推理能力,探讨生物基础模型在分子结构发现、变异解读与跨模态推理中的涌现特性,这一数据集的出现有望加速生物信息学向可泛化、可扩展的指令驱动范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务