家庭食材多维标签与膳食知识数据集
收藏资源简介:
本数据资产主要应用于智能厨电、家庭健康管理及个性化膳食服务领域,具体用途与场景如下: 一、智能厨电食材识别与膳食推荐。本数据资产已集成于方太智能厨电系统。用户通过文字、语音或图像输入食材信息后,系统调用食材名称映射规则与多维标签知识库,精准识别食材并输出其宜忌人群、营养标签及摄入建议。 二、个人家庭膳食管理。用户可查询任意食材的营养标签与适宜人群,获取基于《中国居民膳食指南》的量化摄入建议。对于孕期、控糖、控脂等特殊需求用户,系统结合宜忌标签与特殊人群策略,自动过滤不适宜食材,生成个性化膳食搭配参考。 三、大模型检索增强生成。本数据资产可作为大语言模型的知识库,在回答“孕妇能不能吃猪肝”“立秋适合吃什么”等膳食咨询时,精准调用结构化标签与摄入建议规则,生成专业、可解释的回复,避免模型幻觉与不安全建议。 四、健康产业膳食数据服务。经用户授权,本数据资产可接入第三方健康管理平台或企业员工健康系统,为营养科普、团体膳食方案设计提供知识支撑。 本数据资产仅提供日常膳食参考,不构成医疗建议,不适用于疾病诊断、治疗或临床营养干预场景。一、加工前的数据说明 原始数据包含两类:一是公开权威知识,包括《中国食物成分表》《中国居民膳食指南》《中国居民膳食营养素参考摄入量》及《食疗本草》《随息居饮食谱》等中医食疗典籍;二是企业自研决策规则库,包括过敏原食材映射与同义词库、食材克重换算表、人群‑营养标签决策规则、食材同义词词林等,由内部团队基于公开语料与语义模型构建。上述数据均为公开文献或企业内部特征数据,不涉及任何个人隐私信息。 二、处理规则 本数据资产通过语义标准化、多维标签自动化标注、四级裁决算法三层体系构建。 1. 语义标准化:采用 Sentence‑BERT 对口语化食材描述进行向量编码,与自建同义词词林进行余弦匹配,阈值≥0.92 直接映射,0.75~0.92 进入主动学习流程。 2. 多维标签自动化标注:食材分类按决策树归入十大品类;依据 GB 7718 与图数据库递归推导过敏原信息,为四级裁决提供前置过滤依据;将 22 类人群划分为三层体系,通过阈值规则自动判定并归入适宜、限制、强制限制人群;采用 Apriori 关联规则、线性规划与逻辑回归输出量化摄入建议;基于 GB 28050 与 DRIs 用规则引擎生成营养标签;通过 BERT 与图卷积网络抽取并归并养生功效;依据节日食俗知识库做关键词匹配;依托二十四节气‑72 候映射库匹配推荐节气;按能量密度、GI 值与胃排空时间做 K‑means 聚类划分餐别;用朴素贝叶斯分类器识别口味;以 BiLSTM‑CRF 模型抽取加工状态。 3. 四级裁决算法:一级为过敏原哈希匹配强制拦截;二级覆盖强制限制人群并剔除出摄入建议;三级依据摄入建议做量效控制;四级对正向标签排序推荐。所有标注结果均经过互斥、空值、数值合理性校验。低置信度结果自动推送人工复核,人工复核覆盖率≤10%。 三、数据内容描述 最终数据以 Excel 扁平化宽表存证,单条食材一行,字段按四级裁决顺序排列,包括基础标识、过敏原、适宜 / 限制 / 强制限制人群、摄入建议、营养标签、养生功效、节日、节气、餐别、口味、加工状态。多值字段以英文分号分隔,摄入建议内部用英文逗号分隔,建议内容不含英文逗号。本数据集收录标准食材 4474 条,覆盖 11 个维度约 5 万条标签,结构规范、可直接应用。




