遇见数据集

multimolecule/ipknot_plus_plus

收藏
Hugging Face2026-06-09 更新2026-06-14 收录
官方服务:

资源简介:

IPknot++是一个用于RNA二级结构预测的基准数据集,随IPknot++论文发布。该数据集旨在作为外部评估集,而非训练分割,通常用于在SPOT-RNA风格的分割(如bpRNA-spot)上训练或调优RNA二级结构预测模型后,评估模型的泛化能力。原始发布未定义训练和验证分区,因此每个变体都作为单一的测试分割发布。数据集包含三个变体:1) ipknot_plus_plus:单序列结构,无多序列对齐,覆盖bpRNA-1m和Rfam 14.5目标;2) ipknot_plus_plus-ref:Rfam 14.5目标,带有Rfam参考对齐,用于共同结构预测;3) ipknot_plus_plus-mafft:Rfam 14.5目标,带有MAFFT对齐,用于共同结构预测。对齐变体覆盖相同的Rfam 14.5目标集,ID、序列和二级结构相同,仅aligned_sequences不同。数据集列包括ID、序列和二级结构(点括号表示),对齐变体额外包含对齐ID和序列列。数据集基于源数据集multimolecule/bprna和multimolecule/rfam构建,采用CC-BY-4.0许可证。

IPknot++ is a benchmark dataset for RNA secondary structure prediction, released alongside the IPknot++ paper. This dataset is intended as an external evaluation set rather than a training split, and is typically used to assess the generalization ability of RNA secondary structure prediction models after training or fine-tuning on SPOT-RNA-style splits (e.g., bpRNA-spot). The original release did not define training and validation partitions, so each variant was released as a single test split. The dataset includes three variants: 1) ipknot_plus_plus: single-sequence structure without multiple sequence alignment (MSA), covering bpRNA-1m and Rfam 14.5 targets; 2) ipknot_plus_plus-ref: Rfam 14.5 targets with Rfam reference alignments, used for consensus structure prediction; 3) ipknot_plus_plus-mafft: Rfam 14.5 targets with MAFFT alignments, used for consensus structure prediction. The alignment variants cover the same set of Rfam 14.5 targets, with identical IDs, sequences, and secondary structures, differing only in the aligned_sequences column. The dataset columns include ID, sequence, and secondary structure (dot-bracket notation), while the alignment variants additionally contain aligned ID and aligned sequence columns. This dataset is built based on the source datasets multimolecule/bprna and multimolecule/rfam, and is released under the CC-BY-4.0 license.

提供机构:
multimolecule
搜集汇总
数据集介绍
multimolecule/ipknot_plus_plus 数据集图片
构建方式
IPknot++ 数据集源自 Kengo Sato 与 Yuki Kato 在 RNA 二级结构预测领域的研究成果,设计初衷在于作为外部评测基准,而非训练切分。该数据集衍生自 bpRNA 与 Rfam 两大来源,共包含三个子版本:无序列比对的单序列版本、基于 Rfam 参考比对的标准版本以及采用 MAFFT 工具生成的比对版本。其中,后两个版本共享相同的 RNA 靶标序列与点括号二级结构,仅比对序列列存在差异。原始版本未划分训练与验证集,因而将所有数据统一整合为单一份测试集。
特点
IPknot++ 数据集具备鲜明的结构与功能特性。首先,其以评估 RNA 二级结构预测模型的泛化能力为核心目标,特别强调对含有伪结的复杂二级结构的预测能力。各子版本之间的设计精巧统一:单序列版本提供基础序列与结构信息;比对版本则额外包含多条对齐的序列及其标识,便于研究者深入挖掘序列保守性对结构预测的影响。该数据集所覆盖的靶标序列长度跨度大,能够有效检验长序列预测模型的鲁棒性与准确性。
使用方法
应用于 IPknot++ 数据集时,建议研究人员首先在 SPOT-RNA 风格划分的数据集(如 bpRNA-spot)上训练模型,再利用该数据集的测试集评估模型在未知靶标上的泛化性能。对于无比对需求的场景,可选用单序列版本,直接解析 id、sequence 与 secondary_structure 三列。若希望利用共进化信息,则可选用参考比对或 MAFFT 对齐版本,提取 aligned_ids 与 aligned_sequences 列进行结构预测。数据集的三个变体均以 HuggingFace datasets 格式提供,可直接通过 load_dataset 接口加载,极大降低了使用门槛。
背景与挑战
背景概述
IPknot++基准数据集由Kengo Sato与Yuki Kato于2021年发布,旨在推动包含假结结构的RNA二级结构预测研究。该数据集源自研究者对长序列RNA折叠机制的深入探索,其构建基于bpRNA-1m与Rfam 14.5两个广泛使用的源数据库,并提供了三种变体,分别对应无比对、Rfam参考比对及MAFFT比对策略。尽管该数据集本身不设训练或验证划分,仅作为外部测试集使用,但其独特的设计与严谨的发布规范,使其成为评估RNA二级结构预测模型泛化能力的重要标杆,在生物信息学领域产生了深远影响。
当前挑战
该数据集面临的核心挑战在于高精度预测含假结的RNA二级结构,这一领域问题因假结拓扑复杂性及长程相互作用而极具难度。此外,构建过程中需确保不同变体间的数据一致性,如无比对版本与比对版本共享相同靶点序列与二级结构,但比对信息差异要求严格的数据质量控制。同时,源数据库如bpRNA-1m与Rfam的异构性增加了数据整合的复杂性,而缺乏官方划分的训练与验证集,也使得模型评估难以标准化,对研究者的数据处理与公平比较能力提出了更高要求。
常用场景
经典使用场景
IPknot++ 是 RNA 二级结构预测领域中一个极具权威性的基准评估数据集,专为评估模型在包含假结的复杂二级结构预测任务上的泛化能力而设计。该数据集源自 Sato 与 Kato 于 2022 年发布的研究工作,它不包含预定义的训练或验证划分,而是以单一的测试集形式呈现,旨在作为外部验证标准。经典的使用范式通常是,研究者在 SPOT-RNA 风格的数据划分(如 bpRNA-spot)上训练或微调 RNA 二级结构预测模型,随后直接在该数据集上测试模型的泛化性能,从而客观衡量模型对未知、独立序列的预测鲁棒性。
实际应用
在 RNA 结构生物学与生物信息学实践中,IPknot++ 扮演着衡量模型落地潜能的试金石角色。许多旨在设计新型 RNA 药物、非编码 RNA 功能预测或 CRISPR 相关 RNA 工具体系的研究,均依赖准确的长链 RNA 二级结构信息。该数据集收集的序列跨度大且包含复杂假结,能够真实模拟生物体内 RNA 折叠的多样性。因此,研究人员利用它来筛选和验证具备高鲁棒性与高准确度的预测工具,确保这些工具在未知临床序列或新型病毒 RNA 结构解析中依然可靠,为从基础调控机制解析到靶向 RNA 疗法开发等实际任务奠定坚实的算法基础。
衍生相关工作
该数据集自发布以来,已催生出多项推动 RNA 结构预测边界的关键研究工作。例如,基于深度学习的模型如 UFold 和 MXfold2 等,均将 IPknot++ 作为重要的外部测试集来报告其最终性能,验证模型对假结预测能力的优劣。此外,围绕该数据集衍生出了如 ipknot_plus_plus-ref 和 ipknot_plus_plus-mafft 两个变体版本,分别提供 Rfam 参考比对序列与 MAFFT 多序列比对结果,为研究多重比对信息如何辅助一致结构预测开辟了新方向。这些衍生工作共同构筑了从单序列预测到多序列一致结构建模的完整技术生态,深刻影响了 RNA 二级结构预测领域的发展轨迹。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务