From Data to Decisions: Open Synthetic Datasets and Case Study Series for Applied Analytics and Data Science Education
收藏资源简介:
From Data to Decisions is an open-access, FERPA-compliant educational framework containing 11 enterprise-scale synthetic datasets (300,000 to 1,000,000 records each), narrative-driven business case studies, executive exhibits, data dictionaries, and scaffolded assignments for applied analytics and data science pedagogy. Designed for undergraduate and graduate courses in Business Analytics, Applied Data Science, and Machine Learning, this collection bridges the "Realism Gap" by deliberately embedding authentic enterprise challenges: structured Missing-Not-At-Random (MNAR) patterns, heavy-tailed distributions, ceiling/floor censoring, class imbalance, and real-world ethical dilemmas. 📂 Included Industry Domains & Datasets (11 Total): Supply Chain & Logistics: The Weakest Link (1,000,000 records) — Supplier risk classification & order cost forecasting. Retail & Customer Strategy: The Wrong List (800,000 records) — Customer tier segmentation & marketing alignment. Finance & Banking: The Model That Cried Safe (750,000 records) — Credit risk default modeling & structured missingness. Marketing Analytics: The Quiet Exodus (600,000 records) — Customer churn classification & Customer Lifetime Value (CLV) regression. Telecommunications: The Bandwidth Dilemma (550,000 records) — Subscriber retention & service quality modeling. Healthcare Operations: Silent Signals (500,000 records) — 30-day hospital readmission risk under HRRP penalty constraints. Freight Transportation: The Route Optimization (450,000 records) — Delivery delay prediction & logistics cost drivers. Manufacturing & Quality Assurance: The Zero-Defect Trap (400,000 records) — Process telemetry & multi-class quality prediction. Clinical Depression & Mental Health: The Clinical Horizon (400,000 records) — Recovery score modeling with 35% ceiling censoring. Energy & Public Utilities: The Retrofit Equation (350,000 records) — Energy efficiency allocation under equity constraints. Higher Education: The Label Maker (300,000 records) — Academic readiness early-warning system & algorithmic fairness. 🔄 Curricular Assets Included: 11 Comprehensive Data Dictionaries & Variable Codebooks. 7 Progressive Case Study Briefs spanning the full decision lifecycle (Problem Framing, Literature Scan, Data Quality Audit, EDA, Classification/Regression Modeling, Algorithmic Fairness/Ethics, and Executive Board Communication). Modular suggested tasks and classroom rubrics. GitHub Repository: https://github.com/leventbulut/synthetic-datasets



