多模态蛋白理解与设计指令数据集
收藏官方服务:
资源简介:
本数据集以指令-序列-答案的流式文本序列为基本单元,融合了非结构化自然语言与结构化生物标记。 1、字段构成中,每条记录包括: 1)指令:自然语言描述的任务节点; 2)蛋白质序列:由20种标准氨基酸单字母组成的字符串,作为输入或输出项; 3)目标答案:可为自然语言文本、层级分类编码或全新设计的蛋白质序列; 2、统一序列化:文本采用标准子词分词器,蛋白质氨基酸残基采用单字符独立token化,二者纳入同一离散词汇表,不再引入额外的跨模态编码器,从而使得一条多模态样本可直接被标准Transformer架构处理。
提供机构:
上海人工智能创新中心创建时间:
2026-07-02
搜集汇总
数据集介绍

背景与挑战
背景概述
本数据集以“指令-序列-答案”流式文本为基本单元,融合自然语言指令、蛋白质序列(20种标准氨基酸单字母编码)及目标答案(可为文本、分类编码或新序列)。数据采用统一序列化方法,将文本子词与氨基酸单字符token纳入同一词汇表,使多模态样本可直接由标准Transformer处理,无需额外跨模态编码器。
以上内容由遇见数据集搜集并总结生成



