遇见数据集

多模态蛋白理解与设计指令数据集

收藏
上海市数据产品知识产权管理平台2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

本数据集以指令-序列-答案的流式文本序列为基本单元,融合了非结构化自然语言与结构化生物标记。 1、字段构成中,每条记录包括: 1)指令:自然语言描述的任务节点; 2)蛋白质序列:由20种标准氨基酸单字母组成的字符串,作为输入或输出项; 3)目标答案:可为自然语言文本、层级分类编码或全新设计的蛋白质序列; 2、统一序列化:文本采用标准子词分词器,蛋白质氨基酸残基采用单字符独立token化,二者纳入同一离散词汇表,不再引入额外的跨模态编码器,从而使得一条多模态样本可直接被标准Transformer架构处理。

创建时间:
2026-07-02
搜集汇总
数据集介绍
多模态蛋白理解与设计指令数据集 数据集图片
背景与挑战
背景概述
本数据集以“指令-序列-答案”流式文本为基本单元,融合自然语言指令、蛋白质序列(20种标准氨基酸单字母编码)及目标答案(可为文本、分类编码或新序列)。数据采用统一序列化方法,将文本子词与氨基酸单字符token纳入同一词汇表,使多模态样本可直接由标准Transformer处理,无需额外跨模态编码器。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务