遇见数据集

polymathic-ai/LORE-examples

收藏
Hugging Face2026-07-14 更新2026-07-22 收录
官方服务:

资源简介:

LORE Examples 是一个小型匹配多模态示例数据集,源自LORE,专为MIMIC模型设计。该数据集提供了足够的跨DNA、RNA和蛋白质模态的示例,使用户能够尝试推理、嵌入和生成任务,而无需自行准备数据。每个示例代表一个单一的生物实体(如转录本和/或其蛋白质),包含多个共观察模态。数据行来自MIMIC训练数据的验证分割(即保留集),因此它们处于分布内,并且长度受模型上下文窗口限制。数据集提供两种配置:raw(原始视图,包含模态名称到原始值的映射,如核苷酸/氨基酸字符串)和tokenized(标记化视图,包含预标记的令牌ID列表),两者覆盖相同的行和模态,但标记化视图跳过了运行重型标记器(如BioBERT文本和ESM3结构)的步骤。数据集支持多种模态,包括核酸轨道(如RNA序列、剪接区域)、蛋白质轨道(如氨基酸序列、3D结构)和文本轨道(如上下文描述、生物医学文献)。数据集用于MIMIC模型的输入、嵌入和生成操作,并附有使用示例代码。

A small set of matched multimodal examples from LORE, for the MIMIC model — enough to try inference, embedding, and generation across DNA, RNA, and protein modalities without wiring up your own data. Each example is a single biological entity (a transcript and/or its protein) with several co-observed modalities. Rows are drawn from the held-out (validation) split of MIMICs training data, so they are in-distribution and length-bounded to the models context window. The dataset offers two configurations: raw (with modality names mapping to raw values like nucleotide/AA strings) and tokenized (with pre-tokenized token-id lists), both covering the same rows and modalities, but the tokenized version skips running heavy tokenizers like BioBERT text and ESM3 structure. It includes various modalities such as nucleic tracks (e.g., RNA sequence, splice regions), protein tracks (e.g., amino acid sequence, 3D structure), and text tracks (e.g., context descriptions, biomedical literature). The dataset is intended for input, embedding, and generation with the MIMIC model, and comes with usage code examples.

提供机构:
polymathic-ai
搜集汇总
数据集介绍
polymathic-ai/LORE-examples 数据集图片
构建方式
LORE-examples数据集源自LORE大规模生物多模态语料库的验证集划分,专为MIMIC模型设计。其构建核心在于为每个生物实体(如转录本及其编码蛋白)提供多种共观测模态的配对数据。数据以两种配置形式呈现:'raw'配置存储原始模态值(如核苷酸序列、氨基酸序列、位点注释等),'tokenized'配置则存储经分词器预处理后的token ID列表,后者避免了在推理时重复运行BioBERT、ESM3等重型分词器。两种配置共享相同的行索引与模态体系,确保数据一致性。
使用方法
用户可通过HuggingFace Datasets库加载数据,默认使用'raw'配置。调用MIMIC模型的input()方法时,原始数据会自动完成分词与特征提取;'tokenized'配置则跳过此步骤,适合需加速或资源受限的场景。典型使用流程为:加载数据集后筛选非空模态,传入model.input()获取多模态表征,再调用embed()或generate()进行下游分析。示例代码展示了如何通过锚定列(kind、uniprot_id等)与模态键实现灵活的数据切片与推理管道。
背景与挑战
背景概述
LORE-examples数据集由PolymathicAI团队于近期创建,旨在为多模态生物学基础模型MIMIC提供标准化的推理与评估样例。该数据集聚焦于同一生物实体(转录本及/或其蛋白质)在DNA、RNA与蛋白质模态下的协同观测,核心研究问题在于如何通过多模态对齐实现跨分子层次的统一表征学习。作为MIMIC模型验证分割的子集,它填补了多模态基因组学数据缺乏标准化基准的空白,尤其推动了从序列、结构到功能注释的联合建模范式的发展,对计算生物学与AI辅助药物发现领域具有奠基性影响。
当前挑战
当前核心挑战在于多源异质模态的高效对齐与信息融合:一方面,需解决不同测序技术(如ATAC-seq、CAGE)产生的长程依赖性、缺值及条件依赖性(如细胞状态上下文)问题,要求模型兼具序列理解与条件推理能力;另一方面,数据构建中面临原始模态(如核苷酸序列、蛋白质结构)与预计算特征(如MaSIF表面属性)的异构编码难题,尤其在token化过程中需平衡计算效率(如ESM3结构tokenizer的负载)与模态完整性,确保上下文窗口内的信息不损失关键生物语义。
常用场景
经典使用场景
LORE-examples数据集专为多模态生物序列的嵌入与生成任务而设计,尤其在DNA、RNA与蛋白质三种生物分子之间搭建了统一的表征桥梁。其经典使用场景聚焦于利用预训练的MIMIC模型对匹配的多模态生物样本进行推理、嵌入提取与序列生成。用户可通过加载raw或tokenized两种视图,直接输入原始核酸/氨基酸序列及其配套的细胞状态、结构注释与保守性评分,借助模型的无缝接口实现跨模态的表征学习,从而在统一的框架内对不同分子层次的生物学信息进行联合建模。
解决学术问题
该数据集有效解决了生物信息学领域中长期存在的多模态数据割裂与异构特征融合难题。传统方法通常将DNA、RNA与蛋白质作为独立对象分别建模,忽视了它们之间固有的共现关系与功能耦合。LORE-examples通过提供严格匹配的多模态样本,使研究者能够系统性地探索编码序列、剪接模式、蛋白结构与功能注释之间的内在关联,推动了从单纯序列分析向多层次分子表征的范式转变,为理解基因表达调控、可变剪接与蛋白质功能预测等核心问题提供了关键的数据支撑。
实际应用
在实际应用中,LORE-examples可广泛服务于精准医疗与药物发现领域。例如,通过嵌入癌症样本中的RNA-seq与ATAC-seq信号,可解析肿瘤特异性的染色质开放区域与异常剪接事件;结合蛋白质结构与丰度信息,助力识别潜在的药物靶点与突变效应。此外,该数据集支持的细胞状态条件化建模能力,使其能够适用于单细胞多组学数据的整合分析,为组织特异性基因调控网络的构建与功能基因组注释提供高保真度的参考基准。
数据集最近研究
最新研究方向
近年来,多模态生物序列表征学习成为基因组学与蛋白质组学交叉领域的前沿热点。LORE-examples数据集作为MIMIC模型的标准验证样本,开创性地将DNA、RNA与蛋白质的核酸序列、结构注释、进化保守性、染色质可及性及表面理化性质等多元模态在同一生物学实体上实现对齐融合。其独特之处在于支持细胞状态条件性输入,能够对特定组织或细胞系背景下的ATAC-seq、CAGE等动态表观基因组信号进行建模,推动了对基因调控机制与蛋白质功能在跨模态空间中的统一理解。该数据集的发布顺应了以统一基础模型驱动生物医学发现的浪潮,为开发可泛化至未注释基因或非模式物种的生成式推断框架提供了标准化基准,显著提升了从序列到结构、从转录到翻译的全尺度生物学推理能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务