基于大模型的厨电领域健康问答数据集
收藏资源简介:
本数据集为基于大模型加工形成的厨电健康领域结构化问答数据,聚焦膳食规划、烹饪健康、慢病调理、特殊人群膳食、饮食安全等场景,具备高专业性、高实用性与高复用性。适用于非医疗诊断、非个性化健康干预的知识服务场景,仅提供基于营养学、烹饪科学共识的通用知识与操作指导。适用范围覆盖膳食营养、烹饪健康、慢病调理、特殊人群膳食、饮食安全垂直领域,适用于蒸制、烤制、炖煮、煎炸、煲汤、焖煮、消毒、清洁、保温等典型厨电场景,可支撑问答交互、知识科普、功能开发、模型训练、产品优化、行业研究等全链条使用。适用对象有智能厨电企业、AI 产品厂商、内容与知识服务平台等。其解决用户烹饪操作不规范、营养流失、高温产生有害物质等实操问题;解决普通家庭、减脂人群、慢病患者、老人、孕妇、婴幼儿等饮食选择与烹饪方式选择问题;解决智能产品回答不准确、不专业、无知识依据、易产生模型幻觉的问题;解决企业缺乏高质量垂直领域语料、模型训练成本高、内容合规风险大的问题;解决行业用户需求不清晰、场景覆盖不全、知识体系不标准的问题。 禁用场景:本数据严禁用于医疗诊断、疾病治疗、处方推荐、个性化体检分析、健康风险预测等医疗相关场景。1. 加工前的数据说明 本数据集原始数据为健康烹饪类的问题,全部来源于本公司内部平台“AI模型数据与训练平台”,覆盖膳食营养、烹饪健康、慢病调理、特殊人群膳食、饮食安全等真实场景。数据为公司内部自行产生,不涉及个人隐私或公共数据,无需进行匿名化处理。 2. 处理规则 数据清洗与扩展: 对原始文本进行正则清洗与标准化,剔除特殊字符、空格及标点数字乱码,并进行文本相似度去重。采用同义词替换与句式变换进行语义保持的扩展生成,经 Siamese BERT 计算语义相似度(阈值≥0.85),并基于长度比与编辑距离过滤低质量生成项,确保多样性与一致性平衡。 语义理解与多维度标注:基于 RoBERTa 预训练模型对问题进行深度语义表征与向量编码,利用多任务学习完成意图分类与烹饪实体抽取,自动匹配多级类目、厨电场景与回答类型;通过图注意力网络将实体对齐至烹饪营养知识图谱,完成实体消歧与上下位关系推理,为答案生成提供结构化知识支撑。 知识增强的答案生成:采用检索增强生成(RAG)框架,通过稠密向量召回技术从专业文档库与专家拟定问答库中检索 Top-K 相关段落作为模型上下文;对大模型进行低秩适配(LoRA)微调,解码阶段加入实体一致性约束、对比解码策略与安全规则审核,抑制模型幻觉,确保回答符合营养学共识,不提供医疗诊断,仅限饮食与烹饪指导。 多维度质量评估与筛选:构建完整性、专业性、实用性三维评分体系(权重 0.3/0.4/0.3),通过 XGBoost 集成模型自动计算质量得分。具体评分标准如下: 完整性(权重 0.3):问题和答案均完整,无字段缺失;答案长度满足预设下限,信息表达充分。 专业性(权重 0.4):营养学及烹饪知识准确无误,无科学性错误;引用权威文献或经内部营养专家审核通过的结论),术语规范,逻辑严谨。 实用性(权重 0.3):回答可直接用于用户实际烹饪或饮食场景,具备可操作性;包含明确的操作指引、用量建议或替代方案,避免空泛理论。 最终保留质量得分≥0.8 的数据,并由营养师团队抽样复核(覆盖率≥ 10%);通过提示学习零样本分类器与术语密度判定,自动标注回答类型与难度等级。 3. 内容描述 本数据集为厨电健康问答垂直领域结构化问答语料,每条数据包含问题类别、应用场景、问题、回答、回答类型等字段,知识边界清晰、内容合规。




