遇见数据集

LiteFold/FLIP2

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

FLIP2是第二代蛋白质适应性景观推断基准,于2026年2月作为bioRxiv预印本发布,由NVIDIA、Microsoft、Caltech、Profluent和Duke等机构合作开发。它扩展了原始FLIP基准的范围,涵盖了七个新数据集,包括酶、蛋白质-蛋白质相互作用和光敏蛋白质等,旨在评估蛋白质语言模型和监督适应性预测器在实际蛋白质工程目标中的表现。数据集提供标准化的训练、验证和测试分割,以探究现实蛋白质工程分布变化(如基于序列相似性的分割、低数据机制、更高突变距离的外推以及保留的相互作用伙伴)下的泛化能力,而不是随机分割。每个数据集包含多个分割协议、序列、适应性标签和参考基线(例如每个分割的最佳零-shot pLM似然、pLM嵌入的岭回归等),所有数据均采用统一格式,与benchmark.protein.properties上的现有FLIP工具兼容。FLIP2旨在与ProteinGym(侧重于DMS景观和临床标签)一起,作为标准评估堆栈中面向蛋白质工程的一半。数据集包含训练集801,710行和测试集88,646行,列包括record_id、task_name、sequence、score_value等,并提供元数据表和引用信息。

FLIP2 is the second-generation Fitness Landscape Inference for Proteins benchmark, released as a bioRxiv preprint in February 2026 by a group spanning NVIDIA, Microsoft, Caltech, Profluent, and Duke. It expands the scope of the original FLIP benchmark to seven new datasets covering enzymes, protein-protein interactions, and light-sensitive proteins, aiming to evaluate protein language models and supervised fitness predictors for real-world protein engineering targets. The dataset provides standardized train, validation, and test splits that probe generalization under realistic protein engineering distribution shifts (such as sequence-similarity-based splits, low-data regimes, extrapolation to higher mutational distance, and held-out interaction partners) rather than random splits. Each dataset includes multiple split protocols, sequences, fitness labels, and reference baselines (e.g., best zero-shot pLM likelihood per split, ridge regression on pLM embeddings), all in a uniform format compatible with existing FLIP tooling at benchmark.protein.properties. FLIP2 is designed to sit alongside ProteinGym (which leans on DMS landscapes and clinical labels) as the protein-engineering-oriented half of the standard evaluation stack. The dataset contains 801,710 rows for training and 88,646 rows for testing, with columns such as record_id, task_name, sequence, score_value, etc., and includes metadata tables and citation information.

提供机构:
LiteFold
搜集汇总
数据集介绍
LiteFold/FLIP2 数据集图片
构建方式
FLIP2作为蛋白质适应性景观推断基准的第二代产品,由NVIDIA、微软、加州理工学院、Profluent和杜克大学组成的团队共同发布。其构建沿袭了原版FLIP的核心设计理念,但大幅扩展了范围。数据集囊括七个全新子集,覆盖酶、蛋白质-蛋白质相互作用及光敏感蛋白等类型。采用确定性哈希划分策略,基于记录ID的SHA-256值模10将数据分为训练集(桶1-9,共801,710行)和测试集(桶0,共88,646行),确保可复现的分配。每个数据点均包含完整的溯源信息,并提供标准化的序列、目标值、分数和标签字段,同时保留原始字段以支持向后兼容。
特点
该数据集的核心特点在于其精心设计的分布偏移评估体系。不同于传统的随机划分,FLIP2提供基于序列相似性、低数据量、远距离突变和保留相互作用伙伴等多种划分协议,专门用于测试蛋白质语言模型在有监督适应度预测中的泛化推广能力。每个数据集均附设多个划分方案、序列、适应度标签及基准基线(包括各划分下最优零样本pLM似然和基于pLM嵌入的岭回归结果),格式统一。作为蛋白质工程导向的评估标准,它与侧重深度突变扫描和临床标记的ProteinGym互补共存。
使用方法
数据集可通过HuggingFace的datasets库便捷加载,执行`load_dataset("LiteFold/FLIP2")`即可获取完整数据。用户可指定所需列,如仅加载通用浏览列,或通过筛选特定任务名称(如`task_name == "trpb"`)聚焦于感兴趣的子集。元数据表如`source_tables`和`column_mapping`可单独从Parquet文件加载,便于追溯原始数据来源。数据集完全兼容已有的FLIP工具链,访问地址为benchmark.protein.properties,为机器学习赋能蛋白质工程研究提供了标准化的数据入口。
背景与挑战
背景概述
在蛋白质工程与机器学习交叉领域,适应度景观推理是评估模型泛化能力的核心任务。FLIP2(第二代蛋白质适应度景观推理基准)由NVIDIA、Microsoft、Caltech、Profluent及Duke University的研究团队于2026年2月发布,旨在应对第一代FLIP基准(Dallago等,NeurIPS 2021)因局限于热稳定性、GB1结合与AAV衣壳活力数据而逐渐落后于领域发展的问题。该工作扩展至七大全新数据集,涵盖酶活性、蛋白质-蛋白质相互作用及光敏蛋白等实际工程目标,通过提供基于序列相似性、低数据量、远距离突变及排除交互伴侣等非随机划分的标准化训练-验证-测试分割,构建了评估蛋白质语言模型与监督式适应度预测器在真实分布偏移下泛化能力的严格框架。FLIP2与侧重深度突变扫描和临床标注的ProteinGym互补,共同构成面向蛋白质工程的标准评估栈,对推动计算蛋白质设计方法的可靠性验证具有重要影响力。
当前挑战
当前蛋白质适应度预测面临的核心挑战在于构建能真实模拟工程场景的评估体系。领域问题层面,现有基准多采用随机划分导致高估模型性能,而实际工程需应对序列相似性导致的分布偏移、低数据区域的外推、高突变距离下的变异效应预测以及特定交互伙伴的泛化——FLIP2通过七类数据集的非平凡分割设计直接回应这些缺口。构建过程中,团队面临多源数据标准化难题:需统一来自不同实验室、测定方法和数据格式的序列-适应度对(如酶活力、结合亲和力与光响应活性),并协调不同数据集间标签尺度差异;同时需设计可复现的确定性哈希拆分(SHA-256取模),平衡训练集与测试集的统计代表性,最终形成包含801710条训练样本与88646条测试样本的稳健基准,并嵌入对零样本似然、岭回归等参考基线的基准测试,确保评估结果的可比性与可扩展性。
常用场景
经典使用场景
在蛋白质工程与生物计算领域,FLIP2数据集作为第二代蛋白质适应度景观推理基准,其经典使用场景聚焦于评估蛋白质语言模型及监督式适应度预测器的泛化能力。该数据集精心设计了基于序列相似性的分割方案,涵盖低数据样本、高突变距离外推及交互伴侣留置等实际分布偏移情境,从而模拟蛋白质工程中常见的真实数据分布不均衡难题。相较于前代FLIP,FLIP2将测试范围从热稳定性、GB1结合及AAV衣壳存活率扩展至酶催化活性、蛋白质间相互作用及光敏蛋白等七大新领域,构建了更具挑战性与生态效度的评估框架。
实际应用
在实际应用层面,FLIP2数据集为蛋白质工程的前沿探索提供了强有力的技术支撑。在酶定向进化中,研究人员可借助其分割协议筛选出高质量序列变异体,显著提升催化效率;在抗体设计领域,该数据集通过评估蛋白质-蛋白质相互作用预测模型,加速了具有高亲和力的候选抗体识别进程。此外,光敏蛋白相关任务为合成生物学中的光遗传学工具优化提供了标准测试床,助力构建更精准的基因表达调控系统。制药企业亦可利用FLIP2的基准结果指导计算机辅助蛋白设计流程,降低湿实验筛选成本。
衍生相关工作
FLIP2数据集的发布催生了一系列具有里程碑意义的衍生研究。其与ProteinGym共同构成了蛋白质工程评估栈的双核心,推动学界开发了诸如基于几何变分自编码器的突变效应预测模型、融合语言模型与图神经网络的适应度预测架构,以及针对低数据场景的元学习策略。在方法创新方面,受FLIP2分割协议启发,研究者提出了动态锚点采样与对比学习增强的泛化训练范式;在工具开发领域,基于该数据集的标准接口涌现出自动化基准评估工具包,极大简化了模型对比验证流程。这些工作共同编织了一张连接计算预测与实验验证的知识网络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务