遇见数据集

Diabetes Recipe Suitability Dataset

收藏
arXiv2026-09-03 更新2026-09-05 收录
官方服务:

资源简介:

该数据集名为Diabetes Recipe Suitability Dataset,由南卡罗来纳大学·人工智能研究所创建,旨在评估大型语言模型对食谱是否适合糖尿病患者的分析能力。数据集包含7607条食谱,其中3807条来自MayoClinic、Diabetes UK等权威医学来源的糖尿病适宜食谱,另外3800条基于Recipe1M数据集通过关键词筛选得到的不适宜食谱。数据集构建过程严谨,首先收集医学网站推荐的糖尿病食谱,然后依据糖尿病饮食指南中的禁忌关键词(如高糖、高饱和脂肪食物)从Recipe1M中检索并随机选取等量非适宜食谱。该数据集主要用于研究LLMs在医学知识检索、概念理解和演绎推理方面的能力,以支持糖尿病膳食管理的人工智能应用。

This dataset, named Diabetes Recipe Suitability Dataset, was developed by the Artificial Intelligence Institute of the University of South Carolina. Its core purpose is to evaluate the analytical capabilities of Large Language Models (LLMs) to assess whether recipes are suitable for diabetes patients. The dataset contains a total of 7,607 recipes: 3,807 are diabetes-appropriate recipes sourced from authoritative medical resources including Mayo Clinic and Diabetes UK, while the remaining 3,800 are inappropriate recipes randomly selected from the Recipe1M dataset via keyword filtering. The dataset was constructed through a rigorous workflow: first, recipes recommended for diabetes patients by medical websites were collected; then, an equal number of non-suitable recipes were retrieved and randomly selected from the Recipe1M dataset based on taboo keywords specified in diabetes dietary guidelines, such as terms associated with high-sugar or high-saturated-fat foods. This dataset is primarily utilized to study the capabilities of LLMs in medical knowledge retrieval, conceptual understanding and deductive reasoning, thereby supporting AI-powered applications for diabetes dietary management.

创建时间:
2026-09-03
原始信息汇总

数据集概述

基本信息

  • 数据集名称: LLMs-Diabetes-Recipes
  • 任务目标: 评估大型语言模型(LLMs)判断食谱是否适合糖尿病患者食用的能力
  • 数据规模: 共 7,607 条食谱(类别均衡)
  • 作者: Revathy Venkataramanan, Aditya Luthra, Venkatesan Nadimuthu, Amit Sheth
  • 机构: 美国南卡罗来纳大学 AI 研究所

数据构成

列名 描述
Title 食谱标题
Ingredients 食材列表(逗号分隔)
Instructions 制作步骤
Safe_for_Diabetes 真实标签 — YES(适合)或 NO(不适合)

类别分布:

  • 3,807 条适合糖尿病的食谱,来源为 MayoClinic、Diabetes UK、Diabetes Food Hub 等医学来源。
  • 3,800 条不适合的食谱,通过关键词检索 Recipe1M 数据集(如 ribs、bacon、sausage 等 MayoClinic 建议避免的词汇)并随机抽样,以实现类别平衡。

评估方法

每条食谱使用三种提示方式逐一评估,逐步增加膳食指南上下文:

  1. Direct Query Prompt (Prompt-1) — 单行问题,完全依赖模型内部知识。
  2. Context-Guided Prompt (Prompt-2) — 加入糖尿病膳食指南(推荐与避免食品),要求模型基于关键词推理。
  3. Exemplary Context Prompt (Prompt-3) — 在 Prompt-2 基础上,为每个膳食概念提供具体示例。

评估模型: Mistral (7B, 12B)、Gemma2 (2B, 9B, 27B)、Llama (3.1 8B, 3.1 70B, 3.2 2B)、ChatGPT-3.5

主要结果

  • 整体表现: 多数模型在判断食谱是否适合糖尿病时趋于保守,即倾向于将食谱标记为“不适合”,以避免将有害食谱误判为安全的风险。
  • 性能最优模型: Mistral-7B 和 Llama3.1-70B 在准确率、精确率和召回率综合表现最佳且最稳定。例如:
    • Mistral 7B 在 Prompt-1 下准确率达 0.84,召回率 0.84。
    • Llama3.1 70B 在 Prompt-2 下准确率 0.83,召回率 0.72;在 Prompt-3 下准确率 0.85,召回率 0.79。
  • 推理能力与表现正相关: 能在推理中应用更多膳食指南关键词的模型,其 F1 分数和稳定性更高。
  • 模型规模并非决定性因素: 较小模型(如 Mistral-7B)与较大模型(如 Llama3.1-70B)均表现突出,而 ChatGPT-3.5 在 Prompt-2 场景下因外部指南与内部知识冲突而出现不稳定。

附加信息

  • 文件结构: 数据文件为 recipe_dataset.csv;图表存放于 figures/ 目录。
  • Citation: Venkataramanan et al., 2025。
  • 许可证: 代码采用 MIT 许可证;数据集仅限非商业研究用途,底层医疗来源和 Recipe1M 数据集保留其原始使用条款。
  • 免责声明: 本工作为研究基准,非医学建议,不可用于实际饮食或临床决策。
搜集汇总
数据集介绍
Diabetes Recipe Suitability Dataset 数据集图片
构建方式
该数据集由两部分构成:一部分包含3,807条来自MayoClinic、Diabetes UK和Diabetes Hub等权威医疗网站专门为糖尿病患者设计的食谱,确保了数据的医学专业性和可靠性;另一部分则根据MayoClinic指南中列出的不推荐食物关键词(如'ribs'、'pork bacon'、'sausage'等),从Recipe1M数据集中检索并随机选取了3,800条食谱作为不适宜糖尿病的样本,实现了类别平衡。这一构建策略不仅涵盖了医学依据,也利用了大规模公开数据集,为研究提供了均衡的标注数据。
特点
该数据集包含7,607条食谱,其中适宜和不适宜糖尿病的食谱数量均衡,各约3,800条,利于模型训练的稳定性。独特的双重来源设计,结合医学专家建议与大规模通用食谱,保证了数据的真实性和多样性。此外,每条食谱均包含标题、成分列表和烹饪说明,为评估大型语言模型对食谱进行医学适宜性分析的能力提供了结构化输入,同时支持不同层次的提示策略,有助于探究模型在医学知识检索、概念理解和演绎推理方面的表现。
使用方法
该数据集适用于评估和提升大型语言模型在糖尿病食谱适宜性分析上的性能。研究人员可利用三种提示方式——直接询问、上下文引导和示例增强——对模型进行测试,以衡量其在无外部信息下的知识检索能力、依循指南的概念理解力及结合实例的演绎推理效果。通过模型输出的判断与解释,可分析模型决策的稳健性,并利用精确率、召回率及提出的稳定性指标进行量化评价。该数据集也可作为微调训练资源,增强模型在慢性病饮食管理中的安全性和可靠性。
背景与挑战
背景概述
该数据集由南卡罗来纳大学AI研究所的研究团队于2024年创建,旨在系统评估大型语言模型(LLMs)在糖尿病食谱适宜性分析中的能力。鉴于全球糖尿病患者逾8.3亿,科学饮食管理至关重要,但现有医学指南繁杂且难以日常应用,本研究创新性地构建了包含7607个食谱的基准数据集,其中3807个来自MayoClinic等权威医疗来源的糖尿病适宜食谱,3800个依据Recipe1M数据集筛选的非适宜食谱。该数据集的核心研究问题是探究LLMs能否从庞大参数空间中精准检索糖尿病膳食指南,解读健康碳水、脂肪等营养概念,并逻辑推理食谱成分与烹饪方法,从而准确判别食谱对糖尿病患者的适宜性。数据集结合多样化的提示工程策略,为评估LLMs在健康信息学领域的推理能力提供了关键基准,其发布对AI辅助慢性病膳食管理研究具有推动作用。
当前挑战
该数据集面临多重挑战。领域层面,首要挑战在于医学知识的准确检索:通用LLMs需从其海量嵌入空间中提取完整且针对性的糖尿病膳食指南,而知识不全或检索偏差将导致错误判别。其次,营养概念的深层理解要求模型区分健康与不健康成分,例如高糖水果需规避,烹饪方法亦影响适宜性,这超越了单纯食材识别,考验模型的综合认知。构建过程中,数据集需严格确保类别平衡与医学可信度,非适宜食谱需通过关键词筛选自Recipe1M百万级数据,筛选策略需涵盖MayoClinic指南中的禁忌类别,如饱和脂肪、高糖及精加工食品,并避免主观偏差。此外,标注须准确反映医学共识,确保数据集的科学严谨性,这对后续模型评估的可靠性至关重要。
常用场景
经典使用场景
该数据集聚焦于评估大型语言模型在糖尿病饮食管理中的适用性分析能力,其经典使用场景是作为基准测试集,用于检验LLM能否根据食谱标题、配料及烹饪步骤,准确判断该食谱是否适合糖尿病患者食用。该场景不仅考察模型的基础分类能力,更深入到医学知识检索、概念理解及演绎推理等多维度认知挑战,为自然语言处理与健康信息学的交叉研究提供了关键实验平台。
解决学术问题
该数据集有效解决了当前LLM在特定医疗场景应用中缺乏精准评估基准的学术难题。它首次将食谱分析与糖尿病膳食指南相结合,构建了包含7607条样本的平衡数据集,覆盖适宜与不适宜两类食谱,为系统探究模型在医学知识检索完整性、营养概念掌握深度及基于指南的推理能力提供了可靠支撑。这一创新推动了LLM在饮食健康领域评估方法论的完善,填补了该研究方向的数据空白。
衍生相关工作
该数据集的提出衍生了多项后续探索工作。一方面,研究者借鉴其构建方式,开发了面向特定疾病(如胃肠道疾病、非传染性疾病)的食谱适宜性数据集,推动LLM在疾病营养管理中的跨域评估。另一方面,基于其验证的Prompt工程策略,涌现出诸如知识增强检索、多模态食谱理解等衍生研究,强化了LLM在复杂医疗指南下的推理性能。这些工作共同促进了可解释、负责任AI在健康领域的落地实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务