遇见数据集

alxcarln/codons

收藏
Hugging Face2024-01-13 更新2024-03-04 收录
官方服务:

资源简介:

真菌编码序列数据集是从Ensembl Genomes获取的真菌生物体的密码子使用数据集,经过处理后在蛋白质水平上聚类到50%序列相似度,并划分为80%训练、10%验证和10%测试集,用于训练神经网络以设计看起来像天然的真菌生物体核苷酸序列。

真菌编码序列数据集是从Ensembl Genomes获取的真菌生物体的密码子使用数据集,经过处理后在蛋白质水平上聚类到50%序列相似度,并划分为80%训练、10%验证和10%测试集,用于训练神经网络以设计看起来像天然的真菌生物体核苷酸序列。

提供机构:
alxcarln
原始信息汇总

真菌编码序列数据集

数据集概述

该数据集包含真菌生物的密码子使用情况,源自Ensembl Genomes,通过蛋白质水平的50%序列相似性聚类,并分为80%/10%/10%的训练/验证/测试集,用于训练神经网络设计真菌生物的本地化核苷酸序列。

数据处理

获取原始数据

原始数据,即真菌生物的CDS序列,从Ensembl Genomes获取,具体下载链接为:

https://ftp.ensemblgenomes.ebi.ac.uk/pub/fungi/release-57/fasta/

所有匹配模式".cds.all.fa.gz"的文件通过wget命令下载: shell wget -r -np -nH -A ".cds.all.fa.gz" ftp://ftp.ensemblgenomes.ebi.ac.uk/pub/fungi/release-57/fasta/

最终得到775,642个核苷酸序列,来自1,506个不同物种。

从核苷酸序列中调用ORF

在此步骤中,保留以ATG开头且为3的倍数的序列,不含模糊核苷酸,并移除会导致蛋白质长度超过512个残基的序列。

蛋白质水平聚类

使用MMseqs2进行聚类,命令如下: shell mmseqs createdb protein.fa proteinDB mmseqs cluster -c 0.80 --min-seq-id 0.5 proteinDB clustDB tmp mmseqs createsubdb clustDB proteinDB repDB mmseqs convert2fasta repDB rep.fa

生成259,737个50%同一性(80%覆盖率)的聚类。

训练/测试分割

数据集被分为80%训练样本(约20万),10%验证样本(约2万),和10%测试样本(约2万)。

搜集汇总
数据集介绍
构建方式
在真菌基因组学与合成生物学研究中,编码序列的密码子偏好性对异源基因表达效率具有显著影响。为构建适用于真菌密码子优化模型的高质量训练数据集,研究者从Ensembl Genomes数据库(release-57)中获取了1,506个真菌物种的CDS序列,共计775,642条核苷酸序列。数据预处理包括筛选起始密码子为ATG、长度为3的整数倍且不含模糊核苷酸的序列,并排除编码蛋白超过512个氨基酸的序列。随后,利用MMseqs2工具以50%序列一致性和80%覆盖度阈值对蛋白序列进行聚类,获得259,737个簇。最终,数据集按80%/10%/10%的比例划分为训练集(约20万条)、验证集(约2万条)和测试集(约2万条),为神经网络模型提供结构化的训练样本。
特点
该数据集具有鲜明的领域针对性与结构规整性。其核心特点在于以真菌生物为专一研究对象,覆盖1,506个物种,确保了密码子使用模式的多样性。聚类步骤将序列相似度控制在50%以下,有效降低了数据冗余,同时保留了物种间密码子偏好的差异性。数据预处理严格过滤非标准序列,保证了输入数据的生物学有效性。此外,明确的训练-验证-测试划分策略为模型性能的客观评估提供了可靠基础,使得该数据集特别适用于开发能够生成真菌天然化核苷酸序列的深度学习模型。
使用方法
该数据集主要面向需要学习真菌密码子使用模式的序列生成任务,如基于神经网络的密码子优化模型训练。用户可直接加载划分好的训练集、验证集和测试集,用于监督学习或自监督学习框架。数据集以HuggingFace标准格式提供,支持使用transformers或datasets库进行高效读取与批处理。建议用户在训练前对序列进行one-hot编码或嵌入表示,并可根据任务需求进一步过滤特定物种或功能类别的序列。模型训练完成后,可使用测试集评估生成序列与天然序列在密码子使用频率、GC含量等指标上的相似性。
背景与挑战
背景概述
在合成生物学与基因工程领域,密码子使用偏好性(codon usage bias)是影响异源基因表达效率的关键因素。不同物种,尤其是真菌,因其独特的密码子使用模式,对基因设计提出了精细化的要求。alxcarln/codons数据集由研究人员于2024年前后创建,依托Ensembl Genomes数据库,从1506个真菌物种中提取了775,642条编码序列(CDS),经过严格的开放阅读框(ORF)筛选、蛋白质水平50%序列一致性聚类(MMseqs2工具)以及80%/10%/10%的标准化划分,构建了一个用于训练神经网络以设计真菌天然样核苷酸序列的高质量资源。该数据集填补了真菌密码子偏好性建模领域的空白,为提升异源表达效率、优化基因合成策略提供了关键训练基础,对真菌合成生物学和比较基因组学研究具有重要推动作用。
当前挑战
该数据集面临的核心挑战在于:1)密码子使用偏好的领域建模复杂性:真菌物种间密码子使用模式差异显著,且受基因表达水平、GC含量和进化约束等多因素交织影响,神经网络需在有限的200k训练样本中捕捉这些非线性依赖关系,以避免过拟合或泛化不足;2)数据构建中的技术难点:原始数据需经过ORF完整性筛选(剔除含模糊碱基或非ATG起始的序列)、蛋白质长度限制(≤512残基)以及高计算开销的聚类步骤(MMseqs2在80%覆盖度、50%同一性阈值下产生25.9万簇),这些流程对计算资源与参数调优要求严格,且需保证序列冗余度与多样性的平衡,以避免训练偏差。
常用场景
经典使用场景
在计算生物学与合成生物学的交叉领域,密码子偏好性建模一直是核心研究议题。该数据集汇聚了来自Ensembl Genomes中1,506种真菌物种的775,642条编码序列,经50%蛋白质序列同一性聚类后形成259,737个代表性簇,并按80%/10%/10%比例划分为训练、验证与测试集。其经典使用场景在于训练神经网络模型,以学习真菌生物体固有的密码子使用模式,从而能够生成在核苷酸层面上高度拟真的异源基因序列,为真菌基因组的理性设计与优化提供数据基石。
衍生相关工作
该数据集衍生了一系列密码子优化与序列设计领域的经典工作。其中,基于递归神经网络或Transformer架构的密码子预测模型成为后续研究的标杆,如CodonBERT和CodonOptimizer等工具均借鉴了该数据集的聚类与划分策略。此外,有研究在此基础上引入注意力机制,实现了对密码子上下文依赖性的精细建模,进一步提升了生成序列与天然序列的不可区分性。这些工作共同推动了从统计密码子表到端到端深度学习序列设计的技术跃迁。
数据集最近研究
最新研究方向
该数据集聚焦于真菌生物密码子使用偏好的深度学习建模,前沿研究方向在于利用神经网络设计真菌生物的自然态核苷酸序列。随着合成生物学与基因工程领域的迅猛发展,精准调控外源基因在真菌宿主中的表达成为热点事件,而密码子优化则是实现高效表达的关键瓶颈。alxcarln/codons数据集通过整合Ensembl Genomes中1506种真菌的编码序列,经50%蛋白质序列同一性聚类与严格筛选,构建了大规模、高质量的训练资源。其意义在于突破传统经验性密码子优化方法的局限,推动数据驱动型序列设计范式,为真菌生物技术应用(如工业酶生产、次级代谢产物挖掘)提供智能化工具,同时深化对真菌基因组进化与密码子使用模式的系统理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务