遇见数据集

genolator-v1-qa

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

Genolator V1 Multimodal Gene Function QA 是一个用于人类基因功能问答的多模态数据集。该数据集旨在训练和评估 Genolator V1 模型,该模型通过将基因的三种模态嵌入(编码DNA序列、氨基酸序列和预测的3D蛋白质结构)投影到生物医学 Llama-3 的标记嵌入空间,从而在不接触基因名称或原始序列的情况下回答关于基因的问题。 数据集包含 417,835 个问答对,覆盖 17,732 个基因(MANE Select 1.4 版本,代表转录本)。数据按基因划分,训练集、验证集和测试集分别占比 80%、10% 和 10%,且基因不重叠。每个样本包含 prompt(问题,不含基因名称或序列)、response(基于GO slim本体的答案)、kind(问题类型:confirmation、denial 或 generic)、go_aspect(GO方面:molecular_function, cellular_component, biological_process)、以及三种序列和对应的嵌入:cdna_seq_embedding(Evo2 7B 生成的4096维嵌入)、aa_seq_embedding(ESM-2生成的2560维嵌入)、pst_embedding(PST结构嵌入,1280维)。所有嵌入完整且无缺失。 问题分为三类:confirmation(确认基因已注释的GO术语)、denial(否认基因未注释的GO术语,构成平衡的二元任务)、generic(开放性问题,描述可能的功能、过程或定位)。答案由GPT-4.1生成,并由两位研究者独立审查了56个基因的样本。 数据集适用于需要模型仅通过多模态嵌入推理基因功能的任务,不适合需要识别基因名称的场景。注意:答案为模型生成,可能不完整;denial项基于证据缺失而非生物学否定;覆盖仅限于MANE Select的蛋白质编码基因;结构为AlphaFold预测;generic答案较长,需语义评估。

Genolator V1 Multimodal Gene Function QA is a multimodal dataset for human gene function question answering. The dataset is designed to train and evaluate the Genolator V1 model, which projects three modalities of gene embeddings (encoding DNA sequence, amino acid sequence, and predicted 3D protein structure) into the token embedding space of biomedical Llama-3, enabling it to answer questions about genes without accessing gene names or raw sequences. The dataset contains 417,835 question-answer pairs covering 17,732 genes (MANE Select v1.4, representative transcripts). Data is split by gene into training, validation, and test sets with 80%, 10%, and 10% ratios respectively, without gene overlap. Each sample includes a prompt (question, without gene name or sequence), response (answer based on GO slim ontology), kind (question type: confirmation, denial, or generic), go_aspect (GO aspect: molecular_function, cellular_component, biological_process), and three types of sequences with corresponding embeddings: cdna_seq_embedding (4096-dim from Evo2 7B), aa_seq_embedding (2560-dim from ESM-2), pst_embedding (1280-dim PST structure embedding). All embeddings are complete without missing values. Questions are categorized into three types: confirmation (confirming annotated GO terms), denial (denying unannotated GO terms, forming a balanced binary task), and generic (open-ended questions describing possible functions, processes, or localization). Answers are generated by GPT-4.1 and independently reviewed by two researchers for a sample of 56 genes. The dataset is suitable for tasks requiring models to infer gene function solely from multimodal embeddings, and is not suitable for scenarios requiring gene name recognition. Note: answers are model-generated and may be incomplete; denial items are based on absence of evidence rather than biological negation; coverage is limited to protein-coding genes in MANE Select; structures are AlphaFold predictions; generic answers are longer and require semantic evaluation.

创建时间:
2026-08-17
原始信息汇总

Genolator V1 多模态基因功能问答数据集

概述

Genolator V1 是一个用于训练和评估多模态大语言模型(Genolator V1)的人类基因功能问答数据集。数据集的核心设计理念是:每个问答对不包含任何基因名称、符号或原始序列信息,模型必须仅通过提供的三种模态嵌入(编码DNA序列、氨基酸序列、预测的3D蛋白质结构)来回答关于"给定蛋白质"或"给定序列"的问题,而无法依赖对已知基因名称的记忆。

数据集规模

划分 行数 基因数 文件大小
训练集 345,927 14,186 6.7 GiB
验证集 36,521 1,773 0.71 GiB
测试集 35,387 1,773 0.68 GiB
总计 417,835 17,732 8.1 GiB

数据集采用基因不重叠划分,即每个基因仅出现在一个划分中,基因级比例精确为80%/10%/10%。

数据列说明

列名 类型 描述
gene_name string HGNC基因符号,仅作为元数据,不提供给模型
prompt string 问题文本,不含基因名称、符号或原始序列
response string 基于GO slim本体论的目标答案
kind string 问题类型:confirmationdenialgeneric
go_aspect string GO方面:molecular_functioncellular_componentbiological_process
dna_seq string MANE Select转录本的编码序列(CDS),仅含ACGT
cdna_seq string 含UTR的完整转录本序列,包含dna_seq作为子串
aa_seq string 编码蛋白质的氨基酸序列
cdna_seq_embedding list<float>[4096] Evo2 7B对cdna_seq的嵌入,均值池化
aa_seq_embedding list<float>[2560] ESM-2对aa_seq的嵌入,均值池化
pst_embedding list<float>[1280] PST结构信息嵌入,均值池化
group int64 仅训练集,轮次旋转子集(1–3)

所有嵌入列在三个划分中均完整且格式正确,每行嵌入维度精确,无空值或非有限值。序列列在同一基因的所有问答行中重复,这是文件体积相对行数较大的原因。

三类问题

数据集由三种问题类型 × 三个GO方面组合成九个子数据集,通过kindgo_aspect列区分:

  • confirmation(确认类):询问基因已注释的GO术语,正确答案为肯定。
  • denial(否定类):询问基因未注释的GO术语,正确答案为否定,与confirmation构成平衡的二元任务。
  • generic(通用类):开放式问题,邀请描述可能的功能、过程或定位,答案采用描述性表述而非命名实体。

类别组成

划分 confirmation denial generic molecular_function cellular_component biological_process
训练集 115,113 115,113 115,701 106,586 124,712 114,629
验证集 15,965 15,417 5,139 11,832 12,494 12,195
测试集 15,463 14,943 4,981 11,363 12,480 11,544

验证集和测试集中每个基因和GO方面各有一个generic项,是confirmationdenial数量的约三分之一。训练集则实现了类别平衡。

构建方法

  1. 基因与注释:基于MANE Select 1.4版本(GRCh38),每个典型蛋白质编码基因一个代表性转录本,使用Gene Ontology术语注释。
  2. 问题生成:使用GPT-4.1(Azure AI Foundry托管),为每个GO方面设计专用系统提示词和至少六个手工制作的少样本示例,全程不提供基因名称、符号、DNA或氨基酸序列,防止标识符泄漏到问答中。
  3. 质量评估:随机选取56个基因的QA样本由两名研究人员独立盲审,使用自托管Arize Phoenix跟踪生成过程。
  4. 嵌入计算
    • DNA嵌入(4096维):Evo2 7B基因组基础模型,取blocks.28.mlp.l3层,均值池化。
    • 氨基酸嵌入(2560维):通过ESMFold 3B访问ESM-2,超过1000残基的序列分段推断后拼接并均值池化。
    • 结构嵌入(1280维):Protein Structure Transformer(PST),基于AlphaFold预测结构,均值池化。
  5. 相似性感知划分:将三种嵌入拼接成多模态表示,使用KMeans(k=3)在余弦相似度下聚类,使结构性和功能性相似的基因落入同一簇,映射到训练/验证/测试划分,比例约80/10/10。

加载方式

支持通过datasets库直接加载(默认加载全部三个划分),训练集可流式加载以避免占用磁盘空间,也可通过PyArrow直接读取parquet文件以选择所需列。train.parquet按20,000行行组写入(18个行组),批量读取内存有界;验证集和测试集各为单个行组。

预期用途与局限性

预期用途:专门用于训练和评估仅通过投影嵌入接收基因信息的语言模型。

局限性

  • 所有答案由GPT-4.1模型生成,仅经56基因的盲审抽查,非穷尽式人工整理。
  • denial项基于注释缺失,而非生物学上的事实否定,应理解为"未注释"而非"不存在"。
  • 覆盖范围仅限于MANE Select的典型转录本,不含异构体、非编码基因或非典型转录本。
  • 结构嵌入来自AlphaFold预测,带有预测方法的不确定性。
  • generic答案较长且具描述性,评估需采用语义度量,精确匹配评分无意义。

来源与许可

衍生自MANE Select 1.4、Gene Ontology注释、AlphaFold蛋白质结构数据库,以及GPT-4.1生成的问答文本。嵌入由Evo2 7B、ESM-2和PST计算。

联系方式

数据集创建者为Martin Danner,来自亚琛人类遗传学与基因组医学中心(mdanner@ukaachen.de)和scieneers GmbH(martin.danner@scieneers.de)。

搜集汇总
数据集介绍
genolator-v1-qa 数据集图片
构建方式
该数据集旨在为多模态基因功能问答任务提供训练与评估基础。其构建基于MANE Select 1.4注释的17,732个人类基因,并整合了Gene Ontology注释、AlphaFold预测的蛋白质结构以及GPT-4.1生成的问题-答案对。每个样本均包含基因的编码DNA序列、全长cDNA序列、氨基酸序列及对应的Evo2、ESM-2、PST预计算嵌入向量。为确保评估的严谨性,数据划分采用基因级别的不相交原则,并依据嵌入向量的余弦相似度进行聚类,以最小化同源基因间的信息泄露。最终形成训练集345,927条、验证集36,521条及测试集35,387条,涵盖确认、否定与开放三类问题及三种GO方面。
特点
该数据集最显著的特点在于其多模态融合与脱敏设计。所有问题与答案均不包含基因名称、符号或原始序列,仅以“给定蛋白质”或“给定序列”指代,迫使模型必须依赖提供的嵌入向量进行推理,而非依赖先验知识。数据集包含三种问题类型:确认型、否定型和开放型,分别对应基因注释存在、缺失及开放式功能描述,形成了平衡的二元分类与生成任务。嵌入向量层面,cDNA序列由Evo2 7B生成4096维表示,氨基酸序列由ESM-2生成2560维表示,蛋白质结构由PST生成1280维表示,三者均经过均值池化处理,确保所有样本的嵌入维度一致且无缺失值。此外,训练集被划分为三个类别平衡的子集,以支持高效轮转训练。
使用方法
该数据集可通过Hugging Face的datasets库直接加载,支持全量或流式读取,便于处理6.7 GiB的训练集。对于需要特定嵌入的任务,亦可直接读取Parquet文件并按列迭代,以降低内存消耗。推荐使用方式为微调一个能够将多模态嵌入投影到生物医学语言模型(如Llama-3)嵌入空间的下游模型,从而在推理时仅凭嵌入回答基因功能相关问题,避免泄露基因标识。由于数据集旨在模拟无标识问答场景,评估时应采用语义相似度或人工评测,而非精确匹配,尤其是对于开放型问题。该数据集亦可用于验证模型在跨模态信息融合与抗遗忘能力上的表现,适用于计算生物学与多模态学习领域的基准测试。
背景与挑战
背景概述
Genolator V1多模态基因功能问答数据集是2025年由亚琛工业大学人类遗传学与基因组医学中心的研究团队创建的,旨在支持多模态大语言模型在基因功能解析中的创新应用。该数据集的核心研究问题在于,如何使模型在完全隔绝基因名称和原始序列的情况下,仅凭借编码DNA序列、氨基酸序列及预测的三维蛋白结构嵌入,精准回答关于人类基因功能的问题。这一设计打破了传统基因注释依赖命名实体记忆的局限,推动了蛋白质功能解读向结构感知和序列感知的深度融合方向演进。数据集一经发布,便为基因功能预测领域提供了一种全新的评估范式,其影响力体现在促进多模态生物信息学模型的发展以及可解释性基因功能问答的探索上。
当前挑战
该数据集直面基因功能注释中长期存在的多重挑战。领域层面,基因功能预测高度依赖标注知识库,而现有注释的不完整性导致负面样本构建存在偏差,使模型难以区分‘未注释’与‘不存在’的生物学事实。构建过程中,为确保问题不含任何基因标识,生成流程需严格屏蔽命名实体,同时兼顾三类问题(确认、否认、泛化)的平衡性与语义丰富度,这依赖于精心设计的提示策略与人工审查。此外,跨模态嵌入的整合面临计算瓶颈,如长序列处理、三维结构预测的不确定性,以及同源基因间序列相似性带来的数据泄漏风险,研究者通过基于相似性感知的聚类划分策略加以缓解,体现了数据集构建的精细考量。
常用场景
经典使用场景
Genolator V1 QA数据集作为多模态基因功能问答的基准资源,其核心应用场景聚焦于引导与评估大型语言模型在纯粹嵌入表征条件下的基因功能推断能力。数据集通过巧妙剔除提示中的基因名称、符号及原始序列,迫使模型仅依赖编码DNA、氨基酸序列及预测三维结构的多模态嵌入进行推理,从而为验证模型能否从分子特征中抽象出功能语义提供了严苛的测试平台。该数据集特别适用于训练和评测那些旨在融合基因组、蛋白质组与结构生物学信息的神经模型,推动语言模型从记忆式检索向真正的生物物理理解转型。
解决学术问题
该数据集精准解决了基因功能注释中存在的可泛化性挑战与信息泄露顽疾。传统方法往往依赖基因标识符检索已知知识,难以评估模型对未知或同源基因的泛化能力。Genolator V1通过基因不相交的数据划分与相似性感知的聚类分割,有效阻隔了同源基因间的信息渗透,确保了评估的公正性。同时,数据集涵盖确认、否认与开放生成三类问题,协同三大基因本体论层面,系统性地检验模型对分子功能、细胞组分及生物学过程的理解深度,为多层次功能预测提供了可量化的学术基准,助力解析序列-结构-功能间的复杂对应关系。
衍生相关工作
Genolator V1数据集的问世催生了众多衍生研究脉络。其提出的多模态嵌入投影到语言模型令牌空间的架构,直接激发了后续工作在基因功能问答、蛋白质相互作用预测及变异效应解析等方向的扩展。研究者可能借鉴其问题生成范式,构建面向其他物种或非编码区域的类似QA资源;其相似性感知划分策略亦成为评估生物序列模型泛化能力的重要参考。此外,该数据集对否定样本中“未注释”与“不发生”的严谨区分,引导了后续关于注释不完整性对模型评估影响的方法论探讨,推动了更稳健的生物医学自然语言处理评价体系的建立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务