ArmLifeBank – Data Discoverability and Fragmentation Audit (v1.0)
收藏资源简介:
This dataset accompanies the paper: "ArmLifeBank: A FAIR-Compliant Data Platform for Armenian Biomedical and Multi-Omics Research". Overview -------- A pipeline-generated audit of PubMed articles with Armenia-country author affiliations (2020–2025), checking open-access full text for references to deposited datasets and data repositories. Comparison cohorts (Estonia, Georgia, Leipzig University) are included for benchmarking. Code repository: https://github.com/arakelyanaa/ArnLifeBank_paper Directory structure ------------------- armenia/ articles.csv — all validated Armenia-affiliated articles affiliations_validated.csv — affiliation strings confirmed as Armenian affiliations_excluded.csv — excluded (Colombia false-positives, etc.) affiliations_uncertain.csv — borderline affiliation strings article_repository_links.csv — per-article repository mentions repository_counts.csv — repository mention counts repository_counts_Armenia.csv — repository counts (named variant) yearly_repository_counts.csv — repository counts by year fragmentation_indices.csv — repository fragmentation metrics fragmentation_report.md — fragmentation analysis narrative fragmentation_armlifebank_indices.csv — fragmentation for ArmLifeBank subset fragmentation_armlifebank_report.md fragmentation_gp_code_indices.csv — GP-code fragmentation indices fragmentation_gp_code_report.md search_findability.csv — per-article findability via metadata search search_findability.md — findability analysis narrative extraction_diagnostics.csv — full-text extraction diagnostics run_summary.json — pipeline run parameters and summary counts report.md / report.docx — full pipeline report estonia/, georgia/, leipzig_university/ Same structure as armenia/ (comparison cohorts). Note: estonia and georgia lack the ArmLifeBank-specific fragmentation files. combined/ country_comparison.csv — fragmentation indices across all cohorts country_comparison_gp_code.csv — GP-code fragmentation comparison combined_report.md — cross-cohort narrative report discoverability_comparison.csv — discoverability scores by cohort reuse_citations.csv — citation/reuse records for DOI-bearing datasets reuse_country_comparison.csv — reuse metrics across cohorts reuse_summary.csv — reuse summary statistics reuse_report.md — reuse analysis narrative arm_index.csv — Armenia harvest index (PMID list) lha_index.csv — LHA harvest index (PMID list) discoverability/ arm_discoverability/ — ArmLifeBank dataset discoverability audit match_results.csv — per-record metadata match results results.json — full results as JSON summary.md — narrative summary lha_discoverability/ — LHA discoverability audit (same structure) Reproduction ------------ Install the pipeline code from the GitHub repository and run: pip install armlifebank armlifebank --country armenia --start-year 2020 --end-year 2025 --mode strict An NCBI API key is required (set NCBI_API_KEY environment variable). Full instructions: see README.md in the code repository. The work was partially supported by the Higher Education and Science Committee of the Ministry of Education, Science, Culture and Sports of the Republic of Armenia (MoESCS RA) under grant number 21AG-1F021. Contact ------- Arakelyan A. A. - arakelyanaa@gmail.com



