5' isoform-specific m6A quantification with CROWN-seq
收藏资源简介:
An updated version of 5' isoform-specific iternal m6A analyses of CROWN-seq. File structures: File Description [cell_line_replicate].TSS_m6A.txt.all.cov20.annot_exon.csv A file containing all the read counts for each TSS-A-site pairs. The distance between the A site and cap, as well as the distance between the A site and the 3' exon end, are included. NO filters are applied except for a minimum coverage of 20. See https://github.com/jhfoxliu/TSS_m6A about how the files were generated [cell_line_replicate]_merged.csv If mulitple replicates are available, the reads of the same TSS-A-site pair were merged to increase sequencing depth. [cell_line_replicate]_merged.cov50.csv Based on [cell_line_replicate]_merged.csv, only TSS-A-site pairs with at least 50 reads were selected. [cell_line_replicate]_merged.cov50.max_0.2.csv Based on [cell_line_replicate]_merged.cov50.csv, onlyt TSS-A-site pairs where at least one isoform exhibit minimum stoichiometry of 0.2 were selected. [cell_line_replicate]_merged.cov50.max_0.2.DRACH.csv Based on [cell_line_replicate]_merged.cov50.max_0.2.csv. This is the high-confidence TSS-m6A-site list. Only sites in DRACH motif were used. About the high-confidence TSS-m6A-site list [cell_line_replicate]_merged.cov50.max_0.2.DRACH.csv: Columns: chr Chromosome id TSS TSS position, 1-based, hg38. Target m6A site position, 1-based, hg38. strand Strand. A Number of A (i.e., non-converted) reads. Cov Number of all reads. dist_5p Distance to 5' end. dist_3p Distance to the nearest 3' exon end. level m6A level, equals A/Cov. seq The 2-nt long flanking sequence. DRACH If TRUE, the site is located in a DRACH motif. max_level The maximum m6A level of the site at 5' isoform level.
本数据集为CROWN-seq的5'异构体(isoform)特异性内部N6-甲基腺嘌呤(m6A)分析的更新版本。 ### 文件组织结构 | 文件名称 | 描述 | | ---- | ---- | | `[cell_line_replicate].TSS_m6A.txt.all.cov20.annot_exon.csv` | 包含所有转录起始位点-A位点(Transcription Start Site-A site,TSS-A-site)对的读取计数,同时记录了A位点与帽结构的距离,以及A位点与3'端外显子末端的距离。除最低覆盖度为20的筛选条件外,未施加其他过滤规则。有关此类文件的生成方式,请参阅 https://github.com/jhfoxliu/TSS_m6A。 | | `[cell_line_replicate]_merged.csv` | 若存在多个重复样本,则将同一TSS-A位点对的读取数据合并,以提升测序深度。 | | `[cell_line_replicate]_merged.cov50.csv` | 基于`[cell_line_replicate]_merged.csv`生成,仅保留至少包含50条读取的TSS-A位点对。 | | `[cell_line_replicate]_merged.cov50.max_0.2.csv` | 基于`[cell_line_replicate]_merged.cov50.csv`生成,仅保留至少有一个异构体的修饰化学计量比不低于0.2的TSS-A位点对。 | | `[cell_line_replicate]_merged.cov50.max_0.2.DRACH.csv` | 基于`[cell_line_replicate]_merged.cov50.max_0.2.csv`生成,此为高可信度的TSS-m6A位点列表,仅保留位于DRACH基序中的位点。 | ### 高可信度TSS-m6A位点列表(`[cell_line_replicate]_merged.cov50.max_0.2.DRACH.csv`)的字段说明 | 字段名 | 说明 | | ---- | ---- | | `chr` | 染色体编号 | | `TSS` | 转录起始位点(Transcription Start Site)位置,采用1-based坐标体系,对应hg38参考基因组。 | | `Target` | m6A位点位置,采用1-based坐标体系,对应hg38参考基因组。 | | `strand` | 基因组链方向 | | `A` | 未发生反转录转换的腺嘌呤(A)读取计数,即携带m6A修饰的读取数。 | | `Cov` | 总读取计数 | | `dist_5p` | 距5'端的距离 | | `dist_3p` | 距最近3'端外显子末端的距离 | | `level` | m6A修饰水平,计算公式为A/Cov。 | | `seq` | 长度为2个碱基的侧翼序列 | | `DRACH` | 布尔型字段,若取值为TRUE则表示该位点位于DRACH基序中。 | | `max_level` | 该位点在5'异构体水平上的最大m6A修饰水平。



