Synthetic Chronic Kidney Disease (CKD) Audit Dataset - 200 Encounters for QA Training and EHR Coding Validation
收藏资源简介:
This dataset contains a synthetic, fully de-identified electronic health record (EHR) sample representing 200 encounters for patients with chronic kidney disease (CKD). It was generated for quality assurance (QA) training, coding validation exercises, and workflow audits in healthcare data environments. The dataset mimics realistic variations in documentation, coding patterns, and lab values found in real-world EHR systems, but contains no real patient information. Data elements include: Demographics (Patient ID, Encounter ID, Coder name – all fictional) Clinical coding (ICD-10 CKD stage codes, diabetes & hypertension codes, combination codes) Laboratory values (eGFR, ACR) with dates Comorbidity indicators (diabetes, hypertension, dialysis, transplant status) Free-text note snippets with stage descriptions and linkage phrases The dataset was intentionally seeded with plausible inconsistencies to support QA scenarios: Under-specified CKD codes (e.g., N18.30) Missing combination codes for diabetes/HTN with CKD Dialysis status without N18.6 Lab-to-code mismatches (e.g., ESRD with high eGFR) Duplicate or missing secondary diagnoses Intended uses: Practice running automated data audits Train AI or rule-based systems to flag documentation/coding discrepancies Demonstrate data cleaning, merging, and report generation workflows Teach ICD-10 CKD coding guidelines in simulated settings Important:This is a synthetic dataset created entirely by AI-assisted generation and manual scenario design. It does not contain any identifiable or actual patient information.



