Synthesized Medical Cost Personal Dataset
收藏资源简介:
该数据集包含1,339条医疗保险公司记录,旨在预测个人医疗费用(Charges)。数据集包括以下特征:年龄(数值型)、性别(分类型)、BMI(数值型)、子女数量(数值型)、是否吸烟(分类型)、地区(分类型)和医疗费用(数值型)。由于隐私问题,使用了与原始数据相似度为95%的合成数据。
This dataset contains 1,339 health insurance company records, designed to predict individual medical expenses (Charges). It includes the following features: age (numerical), gender (categorical), BMI (numerical), number of children (numerical), smoking status (categorical), region (categorical), and medical expenses (Charges, numerical). Due to privacy concerns, synthetic data with 95% similarity to the original dataset was utilized.
医疗保险费用贝叶斯分析数据集
概述
该数据集用于创建最优的医疗保险产品,通过利用历史数据来估计个人的医疗费用。这些数据有助于开发精确的定价模型、战略性保险规划和有效的投资组合管理。主要目标是使用各种预测变量准确预测保险费用。
数据集详情
- 记录数: 1,339条医疗保险公司记录
- 目标变量: 个人医疗费用("Charges")
- 特征:
- Age (数值型): 保险承包商的年龄
- Sex (类别型): 保险承包商的性别(男性或女性)
- BMI (数值型): 客户的体重指数(kg/m²)
- Children (数值型): 客户的孩子数量
- Smoker (类别型): 承包商是否吸烟
- Region (类别型): 受益人在美国的居住地区(东北/东南/西南/西北)
- Charges (数值型): 健康保险公司计费的个人医疗费用
注意: 由于隐私问题,使用了与原始数据相似度为95%的合成数据,以确保符合GDPR等法规的同时保持统计完整性。
所需库
以下R库用于分析: r c("dplyr", "MCMCpack", "coda", "R2OpenBUGS", "mixAK", "brms")
预处理
对原始数据集进行了多种修改,例如将分类变量转换为二进制,更改某些变量的格式等,以使数据集更易于处理。
使用的模型
线性模型
- 马尔可夫链蒙特卡罗采样技术
- OpenBUGS
- 频率学派广义线性模型(GLM)
- 贝叶斯广义线性模型(GLM)
- 正态混合马尔可夫链蒙特卡罗
非线性模型
- 马尔可夫链蒙特卡罗采样技术
- 贝叶斯广义加性模型(GAM)[非线性]
结论
详细的结论和结果在文件中展示,包括图表和其他相关信息。




