遇见数据集

LORE-examples

收藏
Hugging Face2026-07-24 更新2026-07-27 收录
官方服务:

资源简介:

LORE Examples是一个为MIMIC多模态生物模型设计的小型示例数据集,包含从LORE中提取的匹配多模态样本。该数据集旨在让用户无需准备自有数据即可尝试在DNA、RNA和蛋白质三种模态上进行推理、嵌入和生成任务。每个样本对应一个生物实体(一个转录本和/或其蛋白质),包含多个共观测的模态。样本来自MIMIC训练数据的保留(验证)分割,因此属于分布内数据,且长度受限于模型的上下文窗口。数据集提供两种并行视图配置:raw配置包含原始模态值(如核苷酸/氨基酸字符串、逐位置轨迹等),tokenized配置包含预处理的token ID列表。涵盖的模态分为三类:核酸模态(如RNA/DNA序列、剪接区域、进化保守性评分等)、蛋白质模态(如氨基酸序列、3D结构、溶剂可及表面积等)和文本模态(如功能描述、生物医学文献、生物分类等)。部分测定轨迹(如ATAC-seq、CAGE、RASP2、蛋白质丰度)是上下文条件性的,需要搭配自由文本的context字段使用。每个样本还包含kind(rna/protein/both)、uniprot_id和genome_feature_id等锚点标识。数据集适用于多模态生物数据特征提取、模型测试和验证等场景。

LORE Examples is a small example dataset designed for the MIMIC multimodal biological model, containing matched multimodal samples extracted from LORE. This dataset aims to allow users to try inference, embedding, and generation tasks across three modalities—DNA, RNA, and protein—without preparing their own data. Each sample corresponds to a biological entity (a transcript and/or its protein) and includes multiple co-observed modalities. The samples are sourced from the reserved (validation) split of MIMIC training data, making them in-distribution, with lengths limited by the models context window. The dataset offers two parallel view configurations: the raw configuration contains raw modality values (such as nucleotide/amino acid strings, per-position traces, etc.), and the tokenized configuration contains preprocessed token ID lists. The covered modalities are divided into three categories: nucleic acid modalities (e.g., RNA/DNA sequences, splicing regions, evolutionary conservation scores, etc.), protein modalities (e.g., amino acid sequences, 3D structures, solvent accessible surface area, etc.), and text modalities (e.g., functional descriptions, biomedical literature, biological classifications, etc.). Some assay traces (e.g., ATAC-seq, CAGE, RASP2, protein abundance) are context-dependent and require the use of the free-text context field. Each sample also includes anchor identifiers such as kind (rna/protein/both), uniprot_id, and genome_feature_id. The dataset is suitable for scenarios such as multimodal biological data feature extraction, model testing, and validation.

创建时间:
2026-07-14
搜集汇总
数据集介绍
LORE-examples 数据集图片
构建方式
LORE-examples数据集源自LORE语料库的验证集划分,专为MIMIC多模态生物基础模型设计。其构建过程基于每个分子实体(转录本及其对应蛋白质)的共观测模态,从模型训练数据的留出集中抽取符合上下文窗口长度分布的样本。数据集以两种并行配置呈现:'raw'配置存储模态名称到原始数值(如核苷酸序列、氨基酸序列、逐位点注释)的映射,内置分词器在调用模型接口时自动处理;'tokenized'配置则直接提供预分词的整数ID列表,避免BioBERT文本分词器与ESM3结构编码器等重量级模块的重复运行。每条记录均包含'kind'(RNA/蛋白质/双模态)、'uniprot_id'与'genome_feature_id'等标识锚点,确保两种视图覆盖完全相同的行与模态。
特点
该数据集的显著特色在于其多模态对齐的精细粒度与条件性设计。模态划分为核酸、蛋白质与文本三大轨道,核酸轨道涵盖RNA/DNA序列及ATAC-seq染色质可及性、CAGE转录起始信号、RASP2 RNA结构反应性等细胞状态或实验条件依赖的追踪信号;蛋白质轨道除氨基酸序列与ESM3三维结构外,还整合了DSSP二级结构、SASA溶剂可及面积、MaSIF表面理化属性(电荷、氢键、疏水性)以及PaxDb蛋白质丰度等衍生特征。所有条件性模态均需配合'context'文本字段(如细胞系描述、实验条件说明)进行推理,该字段本身作为文本轨道的一个独立模态存在。此外,'corpus'与'gene_family_txt'模态提供了生物医学文献摘要与物种分类谱系等自由文本语境,使模型能够理解语义条件对分子表征的影响。
使用方法
使用LORE-examples进行推理时,用户可通过HuggingFace Datasets库加载数据集,默认获取'raw'配置。首先调用MIMIC模型的load_pretrained接口加载预训练权重,再通过model.input()方法传入过滤掉锚点列与空值的样本字典。对于'raw'数据,分词操作在input内部自动完成;若加载'tokenized'配置,则直接传入预分词后的整数ID列表以节省计算开销。调用model.embed()可获得每个样本的全尺寸嵌入张量与模态标识符。该数据集尤其适用于验证MIMIC模型的多模态融合能力,用户亦可将其作为模板,参照相同的数据结构构建自定义的多模态分子数据集,用于迁移学习或对比分析。
背景与挑战
背景概述
LORE-examples数据集由PolymathicAI团队于近期创建,旨在为多模态生物学基础模型MIMIC提供一组经过精挑细选的匹配多模态示例。该数据集的核心研究问题在于如何高效地整合DNA、RNA与蛋白质三种生物模态的信息,以支持统一的特征提取、嵌入与生成任务。作为MIMIC模型验证集的一个子集,LORE-examples涵盖了核酸序列、蛋白质结构、文本注释等多种异构数据,为跨模态学习提供了标准化的测试基准。其在多模态生物学AI领域的影响力日益显现,为评估和推广MIMIC模型的可复现性与易用性做出了关键贡献。
当前挑战
LORE-examples所解决的领域挑战在于生物学数据模态的复杂异构性:DNA、RNA与蛋白质在序列长度、空间结构及生物学功能上差异巨大,传统单模态模型难以实现统一的表征学习。构建过程中,团队面临了数据对齐的困难,需确保每个样本在不同模态下的观测值严格对应同一生物实体,并处理因测序技术差异导致的缺失值与格式不统一。此外,跨模态tokenization的兼容性也是一大挑战,例如将蛋白质结构转化为ESM3的离散编码,同时维持与核酸序列在语义上的连贯性,这对数据预处理流水线的鲁棒性提出了极高的要求。
常用场景
经典使用场景
LORE-examples数据集为多模态生物学基础模型MIMIC提供了珍贵的配对示例集合,每个样本均整合了DNA、RNA与蛋白质三种分子模态的共观测数据。研究者可通过该数据集调用模型的input接口,快速完成从原始序列到嵌入表示的推理流程,涵盖核酸序列、蛋白质氨基酸序列、三维结构及多种功能注释轨道。其经典应用在于验证跨模态表征学习算法在生物实体上的对齐效果,尤其适合测试模型对编码区与非编码区、蛋白丰度与细胞状态条件信号的联合建模能力。
衍生相关工作
该数据集衍生的关键工作包括MIMIC多模态基础模型的开发与验证,该模型首次实现了核酸-蛋白质-文本三模态的统一序列建模。基于其tokenized配置,研究者可绕过繁重的分词步骤直接评估模型瓶颈,催生了如上下文条件注意力增强、模态缺失鲁棒训练等改进方案。数据集中的cell-state条件信号(ATAC-seq、CAGE等)还推动了条件生成模型在单细胞转录组预测中的应用,并成为评估RNA结构预训练方法与蛋白质语言模型对齐质量的常用基准集。
数据集最近研究
最新研究方向
LORE-examples数据集作为MIMIC多模态基础模型的核心验证样本集,在当前基因组学与蛋白质组学交叉领域的前沿研究中展现出独特价值。该数据集巧妙整合了DNA、RNA与蛋白质三大生物分子的多模态观测数据,涵盖核酸序列、蛋白结构、进化保守性评分及细胞状态条件性信号等二十余种特征模态,为构建生物分子联合表征模型提供了弥足珍贵的标注一致的基准资源。尤其在单细胞多组学与人工智能驱动的蛋白质设计这一热点方向,LORE-examples所承载的跨模态对齐能力正在推动研究者突破传统单一模态分析的桎梏,为揭示基因表达调控与蛋白质功能网络之间的深层耦合机制开辟了新路径。其开源的MIT许可协议和与MIMIC模型的深度适配,极大降低了多模态生物学研究的技术门槛,加速了基础科学发现向合成生物学与精准医学应用的转化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务