Data files for Automated natural product dereplication via DEPT-135 spectral matching
收藏资源简介:
Overview on directory The data directory structure includes the following: raw/ - Original input data downloaded from NMRShiftDB2. nmrshiftdb2withsignals.sd: raw source SDF file used to build the library and validation subsets. README: source download pointer and retrieval note. processed/ - Cleaned and analysis-ready tabular datasets in Parquet format from main repository (https://github.com/enveda/nmr-dept-similarity). library_data.parquet: searchable reference library built from raw NMRShiftDB2 spectra. experimental_validation_set.parquet: curated query/validation set used for benchmarking retrieval methods. nmrshiftdb_dept135_like_spectra.parquet and full_nmrshiftdb_dept135_like_spectra.parquet: intermediate/full processed DEPT-like spectra tables used during preparation and analysis. multiple_spectra_overlap_set.parquet: overlap/consistency subset used for QC and overlap-focused analyses. cache/ - Cached auxiliary metadata used to avoid recomputation or repeated API calls. npclassifier_cache.json: cached NPClassifier annotations consumed by exploratory and class-based evaluation workflows. results/ - Method outputs, optimization summaries, and experiment-specific result tables. hungarian_match_cosine/, hungarian_match_jaccard/, gauss_kernel_cosine/, ppm_bins_typed_cosine/: baseline method result directories containing `ranked_top10.parquet` ranked candidate lists. optimization/: parameter sweep outputs. hungarian/: tolerance sweep summaries and per-threshold Hits@K tables. gaussian/: sigma sweep summaries, plots, and per-sigma Hits@K tables. peak_count/: retrieval-versus-peak-count performance curve. noise_robustness/: summary table for synthetic chemical-shift perturbation experiments. analog/: nearest-analog focused evaluation tables, including per-query and aggregate metrics (`query_tmax.parquet`, `metrics.parquet`, etc.). figures/ - Publication and supplementary figure outputs (PNG), including headline and diagnostic visualizations. Utility of the directory Download and unzip the contents in the data directory of the repository: https://github.com/enveda/nmr-dept-similarity Typical production flow for archived artifacts: 1. Place the raw source file in `data/raw/`. 2. Run preparation notebooks/scripts to populate `data/processed/`. 3. Run optimization/evaluation notebooks/scripts to populate `data/results/`. 4. Generate publication/supporting visuals in `data/figures/`.



