遇见数据集

multimolecule/ipknot_plus_plus-mafft

收藏
Hugging Face2026-06-09 更新2026-06-14 收录
官方服务:

资源简介:

IPknot++是一个RNA二级结构预测的基准数据集,随IPknot++论文发布,主要用于外部评估而非训练。它包含三个变体:ipknot_plus_plus(覆盖bpRNA-1m和Rfam 14.5目标的单序列结构,无对齐)、ipknot_plus_plus-ref(Rfam 14.5目标带Rfam参考对齐,用于共同结构预测)和ipknot_plus_plus-mafft(Rfam 14.5目标带MAFFT对齐,用于共同结构预测)。数据集提供id、序列和二级结构(点括号表示)等列,对齐变体还包含aligned_ids和aligned_sequences列。常见用途是在SPOT-RNA风格分割上训练模型后,用IPknot++评估泛化能力。

IPknot++ is a benchmark dataset for RNA secondary structure prediction, published concurrently with the IPknot++ research paper, and is designed exclusively for external model evaluation rather than training. It includes three variants: 1. ipknot_plus_plus: single-sequence structure prediction tasks covering bpRNA-1m and Rfam 14.5 datasets, with no sequence alignments provided; 2. ipknot_plus_plus-ref: tasks sourced from Rfam 14.5, paired with Rfam reference alignments for consensus secondary structure prediction; 3. ipknot_plus_plus-mafft: tasks sourced from Rfam 14.5, paired with MAFFT-generated alignments for consensus secondary structure prediction. The dataset provides core columns including id, sequence, and secondary structure (represented via dot-bracket notation), while the alignment-enabled variants additionally contain aligned_ids and aligned_sequences columns. A common use case is to evaluate the generalization performance of models trained on a SPOT-RNA-style dataset split using the IPknot++ benchmark.

提供机构:
multimolecule
搜集汇总
数据集介绍
multimolecule/ipknot_plus_plus-mafft 数据集图片
构建方式
IPknot++ 是伴随 IPknot++ 论文发布的一个 RNA 二级结构预测基准数据集,专门用于外部评估而非模型训练。其构建以 RNA 序列的二级结构预测为核心,提供了三种变体:ipknot_plus_plus 为无比对信息的单序列结构数据;ipknot_plus_plus-ref 采用 Rfam 14.5 靶标与 Rfam 参考比对,用于共同结构预测;ipknot_plus_plus-mafft 则基于相同的 Rfam 14.5 靶标,但使用 MAFFT 工具生成多序列比对。后两者共享相同的 id、sequence 和 secondary_structure 字段,区别仅在于 aligned_sequences 的比对方式。所有变体均未划分训练集与验证集,仅以单一的 test 拆分发布。
特点
该数据集的特点在于其聚焦于 RNA 二级结构预测中的伪结(pseudoknot)问题,尤其适用于长序列的评估。三种变体覆盖了不同的比对策略,使研究者能够灵活对比单序列与多序列比对方法对预测性能的影响。其中,ipknot_plus_plus 包含来自 bpRNA-1m 和 Rfam 14.5 的靶标,而 ipknot_plus_plus-ref 与 ipknot_plus_plus-mafft 仅涵盖 Rfam 14.5 的子集。数据集的 schema 设计了 id、sequence、secondary_structure 等核心字段,比对变体则额外提供 aligned_ids 与 aligned_sequences,便于直接用于基于比对的模型训练与评估。
使用方法
使用 IPknot++ 数据集时,推荐先在 SPOT-RNA 风格的数据集(如 bpRNA-spot)上训练或微调 RNA 二级结构预测模型,再利用该数据集的 test 拆分评估模型的泛化能力。对于 ipknot_plus_plus-mafft 变体,研究者可直接加载 aligned_sequences 字段中的 MAFFT 比对结果,用于共同结构预测任务;序列和二级结构信息分别存储在 sequence 与 secondary_structure 列中,采用无点括号表示法。由于该数据集以 Hugging Face datasets 库形式发布,用户可通过简单的数据集加载函数读取,无需额外处理,便于集成进现有 RNA 生物信息学工作流。
背景与挑战
背景概述
RNA二级结构预测是计算生物学中的一项核心任务,尤其对于包含伪结的复杂结构,其准确预测在RNA功能解析与药物设计中占据关键地位。由Kengo Sato与Yuki Kato于2021年发布的IPknot++基准数据集,是伴随同名论文《Prediction of RNA secondary structure including pseudoknots for long sequences》产生的专用外部评测集。该数据集由MultiMolecule团队在HuggingFace平台上以Unofficial形式重新整理发行,旨在为长序列RNA伪结预测提供一个标准化、可重复的评估基准。其影响力体现在,研究者常基于SPOT-RNA类划分(如bpRNA-spot)训练模型后,利用IPknot++检验模型的泛化性能,从而推动RNA结构预测算法的公平比较与持续进步。
当前挑战
该数据集所应对的核心领域挑战在于,长链RNA分子中伪结结构的复杂性与多层级相互作用使得传统预测方法精度有限,而现有训练集多侧重短序列或简单二级结构,缺乏对模型泛化至多样本、长序列场景的严格测试。构建过程中,IPknot++面临三重难题:首先需从bpRNA-1m与Rfam 14.5来源中精选出高置信度靶标,确保序列与结构的生物学准确性;其次,为同时提供单序列与多序列比对(MAFFT或Rfam参考比对)版本,需协调一致相同靶标的标识符、序列与结构,仅对齐数据存异,对数据整合精度要求极高;最后,原始发布未定义训练与验证分区,所有变体均以单测试集形式释放,限制了其用于模型调参的灵活性,考验用户如何合理设计交叉验证策略。
常用场景
经典使用场景
在核糖核酸(RNA)二级结构预测领域,ipknot_plus_plus-mafft数据集常被用作外部评估基准,以检验模型对包含伪结的复杂二级结构的预测能力。该数据集特别聚焦于源自Rfam 14.5数据库的目标序列,并通过MAFFT工具生成多序列比对信息,为研究者提供了评估模型在共同结构预测任务上泛化性能的标准化测试集。其经典用法是先在SPOT-RNA风格的训练拆分(如bpRNA-spot数据集)上对模型进行训练或调优,随后利用该数据集进行独立评测,从而客观衡量模型在未见数据上的表现。
实际应用
在实际应用中,ipknot_plus_plus-mafft数据集主要服务于RNA二级结构预测工具的研发与验证,这些工具在生物医学领域具有广泛用途。例如,研究人员可利用该数据集优化算法,以应用于非编码RNA的结构解析、药物靶点识别以及基于RNA的合成生物学设计。由于RNA二级结构直接参与基因调控和细胞功能,该数据集所验证的预测模型能够辅助科研人员快速鉴定RNA分子中的关键结构基序,进而为疾病诊断和治疗策略的开发提供有力支持。
衍生相关工作
基于ipknot_plus_plus-mafft数据集的评估框架,衍生了一系列经典研究工作。最具代表性的是IPknot++算法本身,它由Kengo Sato和Yuki Kato提出,用于预测长序列RNA中的伪结结构。此外,该数据集常与BPRNA、Rfam等资源结合,被用于对比不同预测方法的性能,如经典的RNAfold、MXfold2以及基于深度学习的SPOT-RNA模型。这些工作不仅验证了多序列比对信息对结构预测的增强效果,还激发了后续研究者在共同结构预测、序列比对与结构整合等方向的深入探索,形成了一条清晰的研究脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务