遇见数据集

TagGen: Underlying Data and Extended Data Figures

收藏
Zenodo2026-04-04 更新2026-05-26 收录
官方服务:

资源简介:

This archive contains the underlying data, extended data figures, benchmark results, simulation scripts, and figure-generation code accompanying: Chowdhury F, Swain T, Shirokikh R, Rudler DL, Fox AH, Cleynen A, Shirokikh NE. (2026)TagGen: High-Performance Barcode Generator and Demultiplexer for High-Throughput and Long-Read Sequencing Applications. The TagGen software is available at: https://github.com/Arnaroo/taggen Contents Extended Data Figures File Description Chowdhury_TagGen_Extended_Data_Figures.pdf Compiled document containing all five Extended Data Figures with legends Source Data for Manuscript Tables File Manuscript Reference Description tables/Table_3_performance_comparison.csv Table 3 Performance benchmarks: TagGen vs DNABarcodes generation times across barcode lengths 8--30 bp tables/Table_4_nanopore_resilience.csv Table 4 Barcode resolution under simulated nanopore error profiles (5--25% error, 10--30 bp barcodes) tables/Table_5_generation_times.csv Table 5 Recommended parameters for three use cases Barcode Generation Benchmarks (benchmarks/) Raw TagGen output files (TSV format) from all benchmark runs, including multiple replicates per configuration. These are the source data for Table 3 and Figure 2. Subdirectory Description TagGen_Hamming/ TagGen output for Hamming-distance configurations (8--30 bp, multiple distance thresholds, 3--10 replicates per configuration) TagGen_Levenshtein/ TagGen output for Levenshtein-distance configurations, including use case parameter sets DNABarcodes/ R scripts for running DNABarcodes benchmarks PRO/ PRO barcode generator output for comparison FreeBarcodes/ FreeBarcodes output for comparison scripts/ Benchmark automation scripts (bench_taggen.sh, bench_dnabc.R, run_bench.sh, etc.) Demultiplexing Simulation Scripts (simulation_scripts/) Python scripts implementing the demultiplexing benchmark pipeline described in the Methods section. These scripts were used to generate Figures 3--4, Extended Data Figures 4--5, and all demultiplexing accuracy results. File Description demux_test.py Main demultiplexing benchmark pipeline: generates barcodes with TagGen, simulates ONT reads with Badread, runs taggen-demux and minibar, computes accuracy metrics. Supports parameter sweeps across tag length, distance, read identity, search mode, and position mask taggen_demux_test.py Integration test suite for taggen-demux minibar_comparison.py Head-to-head comparison pipeline: taggen-demux vs minibar on simulated dual-ended reads minibar.py minibar demultiplexer (v0.25) for comparison benchmarks run_all_tests.py Master script: runs all 154 parameter combinations (5 phases) run_simulations.py Phase A--D simulation runner run_minibar_comparison.py minibar comparison runner run_usecase_sims.py Use case simulation runner (UC1--UC3) run_taggen_extended.py Extended parameter sweep runner rerun_demux_adaptive.py Re-run with adaptive threshold tuning rerun_demux_div3.py, rerun_demux_div4.py Re-runs with different distance constraints add_phase_b_l20_d8_hamming.py Additional Hamming-distance phase B runs build_supp_constrained.py Supplementary constrained parameter runs combine_results.py Aggregates results across phases into combined CSV generate_plots.py Generates Figure 4 panels (demultiplexing accuracy plots) generate_usecase_plots.py Generates use case comparison plots plot_figure5.py Generates Figure 5 (minibar comparison) plot_edf4.py Generates Extended Data Figure 4 (threshold tuning) plot_supplementary_v2.py Generates Extended Data Figure 5 (systematic Hamming evaluation) plot_threshold_comparison.py, plot_threshold_comparison_v2.py Threshold comparison analysis and plotting Simulation Results (simulation_results/) Raw output from all simulation runs, organised by phase: File / Directory Description results.csv Combined results across all main simulation phases results_adaptive.csv, results_adaptive2.csv Results with adaptive acceptance threshold results_div3.csv, results_div4.csv Results with div/3 and div/4 distance constraints results_supp_constrained.csv Supplementary constrained parameter results phaseA/ Phase A: End-mode accuracy vs tag length and read identity (n=96, Levenshtein, Figure 4A) phaseB/ Phase B: Hamming vs Levenshtein comparison (Figure 4B, Extended Data Figure 5B) phaseC/ Phase C: Position mask evaluation for 5'-tagged reads (Figure 4C) phaseD/ Phase D: Position mask evaluation for mid-read barcodes (Figure 4D) phaseSupp/ Supplementary: Scale tests (n=48 to n=384, Figure 4E, Extended Data Figure 5C) phaseSupp_constrained/ Supplementary: Constrained parameter sets tag_sets/ Generated barcode FASTA files used in simulations High-Resolution Figures Individual high-resolution PNG files for all manuscript figures. Main figures (figures/): File Manuscript Reference Figure_1_v5.png Figure 1: TagGen overview (algorithm, demux pipeline, error resilience, applications) Figure_2_performance_comparison.png Figure 2: Performance comparison between TagGen and DNABarcodes Figure_3_minibar_comparison_v2.png Figure 3: Comparison of taggen-demux and minibar demultiplexers Figure_4_nanopore_error_plots_v2.png Figure 4: Systematic evaluation across library configurations Figure_5_gui_screenshot_v2.png Figure 5: TagGen GUI and CLI interface screenshots Extended data figures (extended_data_figures/): File Manuscript Reference Extended_Data_Figure_1_length_scaling_v3.png Extended Data Figure 1: Generation time scaling with barcode length Extended_Data_Figure_2_core_scaling_v2.png Extended Data Figure 2: Parallel scaling behaviour Extended_Data_Figure_3_pool_scaling_v2.png Extended Data Figure 3: Candidate pool size effects Extended_Data_Figure_4_threshold_tuning_v3.png Extended Data Figure 4: Misassignment rates and acceptance threshold tuning Extended_Data_Figure_5_systematic_demux_evaluation_v2.png Extended Data Figure 5: Systematic evaluation using Hamming-distance-generated barcodes Reproducing the Results Prerequisites Python 3.8+ with NumPy, Pandas, Matplotlib, Seaborn Badread v0.4.1 (ONT read simulator) TagGen v1.2.0 minibar v0.25 (for comparison benchmarks) Running the Full Benchmark Suite cd simulation_scripts # Run all 154 parameter combinations (takes several hours) python run_all_tests.py # Or run individual phases: python run_simulations.py # Phases A-D python run_minibar_comparison.py # minibar comparison (Figure 3) python run_usecase_sims.py # Use case simulations # Combine results python combine_results.py # Generate figures python generate_plots.py python plot_figure5.py python plot_edf4.py python plot_supplementary_v2.py Running the Generation Benchmarks cd benchmarks/scripts # TagGen benchmarks (requires taggen on PATH) bash bench_taggen.sh # DNABarcodes benchmarks (requires R + Bioconductor) Rscript bench_dnabc.R License Data are available under the Creative Commons Attribution 4.0 International license (CC-BY 4.0). Simulation scripts are available under the MIT License. Contact For questions about this data, please contact: - nikolay.shirokikh@uwa.edu.au - alice.cleynen@cnrs.fr

提供机构:
Zenodo
创建时间:
2026-04-04
二维码
社区交流群
二维码
科研交流群
商业服务