Synthetic Diabetes Dataset for Machine Learning Classification (2025)
收藏资源简介:
This dataset contains synthetic data related to diabetes prediction generated for academic and research purposes. It includes variables such as age, gender, hypertension, heart disease, BMI, glucose levels, and other medical features that can be used to train and evaluate machine learning models. The dataset was designed to simulate realistic health profiles and support classification tasks (e.g., predicting diabetes status) while ensuring that no personally identifiable information (PII) is included. This dataset was created as part of an academic research project focused on applying machine learning algorithms—such as Logistic Regression and Support Vector Machine—to identify key factors influencing diabetes risk.
本数据集包含为学术及研究目的生成的糖尿病预测相关合成数据,涵盖年龄、性别、高血压、心脏病、身体质量指数(Body Mass Index,简称BMI)、血糖水平及其他可用于训练与评估机器学习模型的医学特征变量。 本数据集旨在模拟真实健康档案,支持糖尿病状态预测等分类任务,同时确保不包含任何个人可识别信息(PII)。 本数据集系某学术研究项目的成果之一,该项目聚焦于应用逻辑回归(Logistic Regression)、支持向量机(Support Vector Machine)等机器学习算法,以识别影响糖尿病患病风险的关键因素。



