中国男性人口合成数据
收藏资源简介:
本项目旨在生成一个包含100万条数据的中国男性人口合成数据集。数据集设计基于真实人口统计数据,通过条件概率分布和随机采样技术生成,涵盖了年龄、身高、家乡、教育水平、收入、现居住地、房产状况、健康状况、婚姻状况、视力、个人资产、生活习惯(吸烟习惯、饮酒习惯、宗教信仰)以及个人评分(颜值评分、幽默感评分、身材评分、性吸引力评分)等多个特征。
This project aims to generate a synthetic dataset of Chinese male population with 1 million entries. The dataset is designed based on real demographic data and generated via conditional probability distributions and random sampling techniques. It covers multiple features including age, height, hometown, education level, income, current residence, housing status, health status, marital status, visual acuity, personal assets, lifestyle habits (smoking habit, drinking habit, religious belief), as well as personal ratings (appearance score, sense of humor score, physique score, sexual attractiveness score).
中国男性人口合成数据生成
数据集概述
- 数据量:100万条数据
- 生成方法:基于真实人口统计数据,通过条件概率分布和随机采样技术生成
- 数据格式:CSV、JSON、Parquet
数据特征
-
年龄:
- 基于全国人口年龄分布的抽样数据生成
- 年龄段分布:0-4岁至95-99岁
-
身高:
- 按年龄段定义身高的均值和标准差,结合正态分布模拟
- 年龄段:0-6岁、6-14岁、14-18岁、18-20岁、20-30岁、30-40岁、40-50岁、50-60岁、60岁及以上
-
家乡:
- 随机采样生成,包括“农村”、“县城”、“三线城市”、“二线城市”、“一线城市”五类
- 比例分布:农村30.0%、县城25.0%、三线城市20.0%、二线城市15.0%、一线城市10.0%
-
教育水平:
- 基于年龄与家乡对教育水平的影响,通过条件概率生成
- 教育水平包括“高中及以下”、“大专”、“本科”、“研究生及以上”四类
-
收入:
- 基于年龄与教育水平的组合,通过条件概率生成
- 收入档次包括“<5万”、“5-15万”、“15-30万”、“30-50万”、“50-100万”、“>100万”
-
现居住地:
- 结合家乡与教育水平,通过条件概率生成
- 现居住地包括“农村”、“县城”、“三线城市”、“二线城市”、“一线城市”五类
-
房产状况:
- 基于年龄、收入、现居住地,通过条件概率生成
- 房产状况包括“无房产”、“有房有贷款”、“有房无贷款”三类
-
健康状况:
- 模拟年龄与健康之间的关系,通过条件概率生成
- 健康状况包括“健康”、“亚健康”、“慢性病”、“重大疾病”四类
-
婚姻状况:
- 模拟年龄与婚姻之间的关系,通过条件概率生成
- 婚姻状况包括“未婚”、“离异无孩子”、“离异有孩子”、“已婚”四类
-
视力状况:
- 结合教育水平生成视力分布,通过条件概率生成
- 视力状况包括“不近视”、“近视低于400度”、“近视高于400度”三类
-
个人总资产:
- 结合年龄、收入、教育水平和现居住地,通过条件概率生成
- 个人总资产包括“<10万”、“10-50万”、“50-200万”、“200-500万”、“500-1000万”、“>1000万”
-
生活习惯:
- 吸烟习惯:随机生成,包括“不吸烟”、“偶尔吸烟”、“经常吸烟”三类
- 饮酒习惯:随机生成,包括“禁酒”、“偶尔喝”、“经常喝”三类
- 宗教信仰:随机生成,包括“无信仰”、“有宗教信仰”两类
-
个人评分:
- 颜值评分:随机生成,范围为1到5分
- 幽默感评分:随机生成,范围为1到5分
- 身材评分:随机生成,范围为1到5分
- 性吸引力评分:通过条件概率生成,范围为1到5分
项目特色
- 真实感:所有变量的分布均基于实际统计数据或合理假设,变量间的依赖关系通过条件概率建模
- 覆盖全面:涵盖年龄、身高、家乡、现居住地、教育水平、收入、房产状况、健康状况、婚姻状况、视力、个人资产、生活习惯及个人评分
- 灵活易用:提供多种格式的数据文件,便于加载和分析
适用场景
- 教学与研究:用于机器学习模型训练、统计分析和数据可视化课程的示例数据
- 模型测试:验证分类、回归、聚类等算法在复杂数据集上的性能
- 数据探索:进行人口特征的探索性分析或创建交互式可视化




