遇见数据集

dnagpt/bio2nl

收藏
Hugging Face2026-07-05 更新2026-07-22 收录
官方服务:

资源简介:

--- license: mit task_categories: - text-classification language: - en tags: - cross-domain-transfer - protein - foundation-models - structural-transfer pretty_name: bio2nl --- # bio2nl — data for *Asymmetric Structural Transfer Between Natural Language and Biological Foundation Models* Datasets accompanying the bio2nl study of directional cross-domain structural transfer. Code: https://github.com/maris205/bio2nl ## Contents ### `cpt_corpus/` — iso-token continued-pretraining corpora Each file is exactly **50M GPT-2 tokens**, differing only in sequence content (the iso-token ablation). Proteins are rendered as space-separated residues `<protein> M K V ... </protein>`. | file | content | |---|---| | `cpt_protein.txt` | real Swiss-Prot proteins (G2, main) | | `cpt_shuffled.txt` | residue-shuffled proteins (G3; same AA freq/length, destroyed structure) | | `cpt_randomaa.txt` | random amino acids from background frequency (G4) | | `cpt_text.txt` | OpenWebText English (G1, control) | | `sprot.fasta` | full Swiss-Prot source (575,503 proteins) | | `manifest.json` | exact token counts per corpus | ### `eval_nl/` — synthetic structural evaluation tasks - `dyck_L{40,60}_t3_*.jsonl` — nested-bracket well-formedness (hard, non-saturating long-range structure) - `longrange_d{8,16,24}_*.jsonl` — subject–verb agreement across distractors ## Related Protein-homology pairs use the existing [`dnagpt/biopaws`](https://huggingface.co/datasets/dnagpt/biopaws) release. PAWS-X, GLUE (CoLA/RTE), OpenWebText are downloaded from their standard sources.

bio2nl dataset is for the study of directional cross-domain structural transfer between natural language and biological foundation models. It includes two main components: iso-token continued-pretraining corpora (cpt_corpus/) with files containing real Swiss-Prot proteins, residue-shuffled proteins, random amino acids, and OpenWebText English text, each exactly 50M GPT-2 tokens; and synthetic structural evaluation tasks (eval_nl/) such as nested-bracket well-formedness and subject-verb agreement across distractors. The dataset supports cross-domain transfer and protein-related NLP applications, released under the MIT license in English.

提供机构:
dnagpt
搜集汇总
数据集介绍
dnagpt/bio2nl 数据集图片
构建方式
bio2nl数据集源自一项关于自然语言与生物基础模型之间非对称结构迁移的研究,其构建核心在于通过iso-token持续预训练语料库实现跨域结构对齐。数据集的语料库基于Swiss-Prot蛋白质序列,并设计了四种等长(均为5000万GPT-2词元)但内容不同的语料变体:真实蛋白质序列、残基打乱序列(破坏结构但保留氨基酸频率与长度)、随机氨基酸序列(基于背景频率生成)以及作为对照的OpenWebText英文文本。此外,数据集包含完整的Swiss-Prot源文件及精确的词元计数清单,确保实验的可复现性。
使用方法
使用bio2nl数据集时,研究者可基于四种语料变体分别对GPT-2等语言模型进行持续预训练,通过对比不同语料训练后的模型在下游自然语言任务(如GLUE、PAWS-X)及合成结构任务上的表现,量化蛋白质序列中结构信息的迁移效果。评估阶段需加载提供的Dyck及长距离一致性任务的JSONL文件,直接调用标准指标计算准确率。数据集兼容常见的文本分类框架,且代码仓库提供了完整的训练与评估流程,便于快速上手与结果复现。
背景与挑战
背景概述
在大规模预训练语言模型与生物序列模型交叉融合的前沿领域,跨模态知识迁移成为突破生物信息学瓶颈的关键范式。bio2nl数据集由Maris等人于近年创建,旨在系统探究自然语言与生物基础模型之间的非对称结构迁移现象。该数据集围绕蛋白质序列的结构表征展开,通过等长度、等词频的对比语料设计,精准区分蛋白质真实结构、随机序列及自然语言文本对模型能力的影响,为理解跨域知识传递机制提供了标准化评测基准。其核心研究问题直指生物序列模型向语言模型迁移时,高层次结构特征是否可被有效编码,这一方向对蛋白质工程、药物发现及可解释人工智能均有深远影响。
当前挑战
该数据集面临的首要挑战是解决生物序列与自然语言之间本质性的领域鸿沟——如何量化蛋白质残基的局部相互作用与语言句法的抽象层级之间的结构等价性。在构建过程中,必须确保语料在词元数量、统计分布上严格可控,同时保留蛋白质序列的生物学真实性。具体难题包括:一是设计等词元约束下能清晰分离结构信号与背景噪声的合成评估任务(如嵌套括号匹配、长距离依赖检验),避免模型利用词汇统计捷径而非真正理解结构特性;二是保证对比语料(如残基随机化版本)既破坏生物语义又维持氨基酸频率恒定,以剥离纯粹的统计学习效应。
常用场景
经典使用场景
在计算生物学与自然语言处理的交叉研究领域,bio2nl数据集被精心构建以探索生物基础模型与自然语言模型之间的非对称结构迁移现象。该数据集的核心设计围绕等标记持续预训练语料库展开,通过控制蛋白质序列的语义内容与结构完整性,为研究者提供了四组严格对照的文本语料,包括真实蛋白质序列、残基打乱的序列、随机氨基酸序列以及自然语言文本。这一独特构造使其成为评估跨模态表征对齐与结构信息迁移效率的理想基准,尤其适用于验证蛋白质语言模型是否能够从自然语言中获益,或反之,自然语言模型能否通过接触蛋白质结构来增强对长程依赖关系的建模能力。
解决学术问题
bio2nl数据集瞄准了一项重要的学术难题:不同模态的基础模型之间是否存在可迁移的结构性知识,以及这种迁移的方向性如何影响模型性能。通过提供合成结构性评估任务,如嵌套括号的良构性判定和跨干扰项的主谓一致性检测,该数据集有效揭示了模型在捕获长程层级结构与局部语法约束方面的能力差异。这直接回应了关于蛋白质序列中残基间远距离相互作用与自然语言中远距离句法依赖是否共享类似计算原理的争论,为非对称迁移学习理论提供了实证基础,推动了跨领域基础模型可解释性与泛化性研究的深化。
实际应用
在实际应用层面,bio2nl数据集所承载的结构迁移机制为多个场景带来了创新可能。在药物发现领域,利用经过自然语言辅助预训练的蛋白质语言模型,可提升对蛋白质折叠与功能位点的预测精度;在生物序列设计任务中,迁移自语言模型的长程依赖建模能力有助于生成结构上更稳定的新型蛋白质。此外,该方法可延伸至自然语言处理中罕见语法结构的理解,通过引入生物序列的结构先验来改善模型对复杂句法的鲁棒性。这些应用充分体现了跨领域基础模型知识共享的现实价值。
数据集最近研究
最新研究方向
当前,bio2nl数据集的核心研究方向聚焦于探究自然语言模型与蛋白质基础模型之间的非对称结构迁移能力,尤其在跨领域表征对齐与结构信息传递的前沿领域引发广泛关注。通过精心设计的iso-token持续预训练语料库(涵盖真实蛋白质序列、打乱序列及随机氨基酸等对照),该数据集巧妙剥离了序列内容与结构信息的混淆效应,为验证结构先验在跨模态迁移中的关键作用提供了严密的实验框架。同时,结合嵌套括号语法判断与长距离主谓一致等合成结构评估任务,从计算语言学视角揭示了生物序列中长程依赖解析的深层机制。这一工作不仅推动了蛋白质语言模型向更高阶语义理解迈进,也为多模态基础模型间的知识迁移树立了方法论标杆,在AI与生命科学交叉领域具有里程碑式的探索价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务