遇见数据集

fitfuel-recipes

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

FitFuel Recipes 数据集是一个合成生成的食谱数据集,专为 FitFuel 项目(Reichman University 的 AI 应用课程)设计。该数据集包含 10,169 个经过清洗的食谱,通过 Groq API(llama-3.1-8b-instant)生成,并使用 Pydantic 模式进行验证,种子固定为 42。每个食谱包含以下字段:食谱名称(recipe_name)、配料列表(ingredients)、烹饪步骤(instructions)、AI 估算的营养值(calories, protein_g, carbs_g, fat_g)、目标标签(goal_tag:bulking/cutting/maintenance)、餐型(meal_type:breakfast/lunch/dinner/snack)、难度(difficulty:beginner/intermediate/advanced)、准备时间(prep_time_min)、菜系(cuisine)、原始过敏原标签(allergen_tags_model_raw,不可靠,仅用于审计)、最终确定性过敏原标签(allergen_tags_final,基于配料的正则表达式推导)、饮食分类(is_vegan, is_vegetarian, is_pescatarian, diet_tag,基于配料确定性推导)、以及营养一致性指标(calories_implied, calorie_diff, calorie_diff_pct)。数据集还包含生成模型来源(source_model)。已知限制包括:原始过敏原标签与确定性方法的一致性仅约 41%,卡路里与宏量营养素推算值差异超过 10 kcal 的样本约占 80%,存在网格覆盖缺口(216 种(目标×餐型×菜系×难度)组合中有 27 种无食谱),以及食谱名称不唯一(约 95% 唯一)。域逻辑检查显示目标标签与卡路里、难度与准备时间之间存在预期相关性。该数据集适用于非医疗、教育性的营养/健身应用,营养值为 AI 估计,不可作为医学依据。

The FitFuel Recipes dataset is a synthetically generated recipe dataset designed for the FitFuel project (AI Applications course at Reichman University). It contains 10,169 cleaned recipes generated via the Groq API (llama-3.1-8b-instant), validated using Pydantic schema with a fixed seed of 42. Each recipe includes the following fields: recipe name (recipe_name), ingredient list (ingredients), cooking instructions (instructions), AI-estimated nutritional values (calories, protein_g, carbs_g, fat_g), goal tag (goal_tag: bulking/cutting/maintenance), meal type (meal_type: breakfast/lunch/dinner/snack), difficulty (difficulty: beginner/intermediate/advanced), preparation time (prep_time_min), cuisine (cuisine), raw allergen tags (allergen_tags_model_raw, unreliable, for audit only), final deterministic allergen tags (allergen_tags_final, derived via regex from ingredients), dietary classifications (is_vegan, is_vegetarian, is_pescatarian, diet_tag, deterministically derived from ingredients), and nutritional consistency metrics (calories_implied, calorie_diff, calorie_diff_pct). The dataset also includes the source model (source_model). Known limitations include: only about 41% agreement between raw allergen tags and deterministic methods, about 80% of samples with calorie vs. macronutrient discrepancy exceeding 10 kcal, coverage gaps (27 out of 216 combinations of goal×meal_type×cuisine×difficulty have no recipes), and non-unique recipe names (about 95% unique). Domain logic checks show expected correlations between goal tags and calories, and between difficulty and prep time. The dataset is intended for non-medical, educational nutrition/fitness applications; nutritional values are AI estimates and should not be used as medical evidence.

创建时间:
2026-08-02
原始信息汇总

FitFuel Recipes 数据集概述

基本信息

  • 数据集名称:FitFuel Recipes
  • 许可证:CC-BY-4.0
  • 语言:英语
  • 数据集规模:约 10,000-100,000 条(实际为 10,790 条食谱)
  • 数据类型:合成数据(由 AI 生成)
  • 标签:营养、食谱、合成数据、健身、嵌入向量、推荐系统、视觉语言模型、Gradio
  • 作者:Daniel Halali 与 Amit Ben-Avraham,赖希曼大学数据科学导论课程(2026)

数据集内容

数据集包含 10,790 条由 Groq API(llama-3.1-8b-instant)生成的合成食谱,覆盖目标、餐食类型、菜系和难度的各种组合。

主要字段

字段名 描述
recipe_name 食谱名称
ingredients 食材列表
instructions 烹饪说明
calories, protein_g, carbs_g, fat_g AI 估算的营养值
goal_tag 健身目标(增肌/减脂/维持)
meal_type 餐食类型(早/午/晚/零食)
difficulty 难度(入门/中级/高级)
prep_time_min 预计准备时间(分钟)
cuisine 菜系类别
allergen_tags_model_raw LLM 生成的过敏原标签(不可靠,仅审计用)
allergen_tags_final 确定性的、基于正则表达式的过敏原标签(推荐使用)
is_vegan, is_vegetarian, is_pescatarian, diet_tag 确定性的饮食分类
calories_implied, calorie_diff, calorie_diff_pct 宏量营养素推算热量与声明热量的差异
source_model 生成该行的 LLM

数据质量与验证

  • 领域逻辑检查通过goal_tag 与热量相关性符合预期(减脂 309 kcal < 维持 354 kcal < 增肌 518 kcal);难度与准备时间相关(入门 19.7 分钟 < 中级 22.0 分钟 < 高级 23.9 分钟)
  • 过敏原标签可靠性:LLM 自动生成的标签与确定性词表仅有约 41% 精确匹配,因此应用使用 allergen_tags_final
  • 热量一致性:约 80% 食谱的声明热量与宏量营养素推算热量偏差超过 10 kcal,属于 LLM 生成数据的预期噪声
  • 组合覆盖:216 种(目标 × 餐食 × 菜系 × 难度)组合中有 27 种无食谱,推荐系统采用放宽单一条件作为回退机制

嵌入向量与推荐系统

  • 嵌入模型:GTE-small(384 维),在三个模型基准测试中胜出(加载 9.6 秒、编码 3.6 秒、约 3,000 条/秒吞吐量、平均 top-3 相似度 0.86-0.92)
  • 推荐流程:确定性过滤(过敏原/饮食/目标/餐食/时间/难度)→ GTE-small 查询编码 → 余弦相似度排序 → 输出 top-k 结果,并带有自动放宽约束的回退机制(过敏原/饮食约束永不放宽)
  • 未使用 FAISS 的原因:10,790 条数据规模下,暴力余弦相似度(np.dot)毫秒级完成,FAISS 在此规模无显著收益

视觉与生成模型

  • 视觉模型HuggingFaceTB/SmolVLM-500M-Instruct,用于从冰箱/储藏室照片中自动识别食材
  • 生成模型Qwen/Qwen2.5-0.5B-Instruct,用于生成食谱适配性说明(最多 20 词,避免医疗声明)
  • 视觉流程:模糊检测(Laplacian 方差)→ 食材提取 → 输出清洗(去重、规范化)→ 空结果回退 → 食材作为查询文本进入推荐引擎

数据文件

  • fitfuel_recipes_clean.parquet — 清洗后的食谱数据集(10,790 行)
  • embeddings/fitfuel_embeddings_gte_small.npy — 预计算的 GTE-small 嵌入向量(384 维,已归一化)
  • embeddings/fitfuel_embeddings_index.csv — 嵌入向量与食谱的行索引对齐文件
  • images/ — 所有 EDA 和第三部分图表 PNG
  • FitFuel Final Project.ipynb — 完整项目笔记本(数据生成、EDA、嵌入)

已知局限

  • allergen_tags_model_raw 不可靠,应始终使用 allergen_tags_final
  • 热量/宏量营养素值存在噪声,应视为估算值
  • 嵌入向量无法强制硬性饮食规则,须结合确定性过滤
  • 食谱名称约 95% 唯一,重名可能对应不同食谱
  • 小型视觉模型可能漏检冰箱/储藏室照片中不明显或被遮挡的食材

预期用途

该数据集用于构建和测试推荐系统、评估嵌入模型,以及探索合成数据生成,作为经核实的营养数据库或专业饮食建议的替代品。

搜集汇总
数据集介绍
fitfuel-recipes 数据集图片
构建方式
FitFuel Recipes数据集是基于Groq API(llama-3.1-8b-instant)生成的全合成食谱数据,通过Pydantic模式验证确保结构完整,覆盖目标、餐型、菜系和难度等多维度组合,共生成10,790条食谱。数据生成过程采用SEED=42保证可复现性,并设置了检查点以应对API速率限制。后续进行了数据清洗和探索性数据分析(EDA),通过确定性词典方法生成可靠的食物过敏原标签(allergen_tags_final),以及基于成分的饮食分类标签(如素食、纯素等),并验证了卡路里与宏量营养素之间的一致性,确保数据的逻辑合理性。
特点
该数据集的核心特点在于其多维度的营养标签和丰富的元数据,每条食谱包含精确的宏量营养素(蛋白质、碳水、脂肪)、卡路里估算、目标标签(增肌/减脂/维持)、餐型、难度、准备时间及菜系类别。数据经过严格的质量控制,包括领域逻辑健全性检查,如目标与卡路里的关联性、难度与准备时间的相关性均符合预期。此外,数据集提供了预计算的GTE-small嵌入向量(384维,已归一化),便于直接用于语义检索和推荐系统开发,而嵌入模型的选择经过了三模型基准测试,GTE-small在速度和检索质量上均优于其他模型。
使用方法
该数据集适用于构建基于文本或图像的营养食谱推荐系统。文本查询需先通过确定性过滤(如过敏原、饮食限制、目标、餐型)缩小范围,再由GTE-small模型编码查询并计算余弦相似度排序,确保硬性约束不被违反。图像输入则通过SmolVLM视觉模型提取食材,再进入同一推荐流程。附带的全项目Notebook提供了从数据生成、EDA到嵌入计算及应用部署的完整代码示例。需注意,数据集仅供教育用途,卡路里和宏量营养素为AI估算值,不应作为专业营养建议的替代。
背景与挑战
背景概述
FitFuel Recipes 数据集由 Reichman 大学的 Daniel Halali 与 Amit Ben-Avraham 于 2026 年创建,源自一门数据科学导论课程项目,旨在探索生成式 AI 与推荐系统在营养与健身领域的融合。该数据集通过 Groq API 调用 LLaMA-3.1-8B 模型,结合 Pydantic 验证,生成了涵盖增肌、减脂、维持等健身目标,以及餐次、菜系、难度等多维组合的 10,790 条合成食谱。项目不仅提供了丰富的结构化营养数据(如热量、宏量营养素),还集成了嵌入模型、视觉识别与文本生成等多模态 AI 组件,构建了端到端的推荐流水线。该数据集在学术界和工业界具有示范意义,展示了如何利用合成数据驱动智能营养应用,并为推荐系统、嵌入模型评估及多模态融合研究提供了宝贵的基准资源。
当前挑战
数据集构建与使用面临多重挑战。在领域问题层面,食谱推荐需兼顾语义相似性与硬性规则约束,如过敏原、饮食偏好(素食、清真等)及健身目标,而嵌入模型仅捕捉语义却无法保证符合这些硬性条件,易导致无效推荐。在构建过程中,合成数据生成的挑战尤为突出:LLM 生成的热量与宏量营养素估算存在噪声,约 80% 的食谱其标注热量与宏量推算值偏差超过 10 千卡;模型生成的过敏原标签可靠性低,与确定性词典方法相比仅 41% 准确率;此外,216 个目标-餐次-菜系-难度组合中 27 个存在零样本覆盖,需设计降级回退策略。视觉模块还需应对图片模糊、食材遮挡等真实场景,保证系统鲁棒性。这些挑战驱动了项目采用确定性过滤与语义排序相结合的混合架构,为后续研究者提供了重要的经验与解决思路。
常用场景
经典使用场景
FitFuel Recipes数据集是一个专为营养与健身推荐系统设计的合成食谱数据集,包含10,790条食谱,覆盖增肌、减脂、维持等健身目标,以及早餐、午餐、晚餐、零食等餐食类型,并标注了热量、宏量营养素、过敏原、饮食标签等丰富属性。其经典使用场景在于构建基于文本查询或图像输入的智能食谱推荐系统,通过嵌入向量进行语义检索,同时结合确定性规则过滤满足严格的饮食约束,为个性化营养推荐提供了高质量的数据基础。
实际应用
实际应用中,FitFuel Recipes驱动了端到端的营养助手,用户既可通过自然语言描述(如“高蛋白晚餐”)获取推荐,也可拍摄冰箱或 pantry 照片,通过视觉模型自动识别食材并匹配食谱。该数据集还支持构建个性化宏量营养素计算器、饮食日志追踪等实用功能,在健身营养指导、饮食规划、过敏原规避等场景中展现出广阔的应用前景,尤其适用于移动健康应用与智能厨房设备。
衍生相关工作
围绕该数据集衍生了多项经典工作,包括基于GTE-small嵌入的语义检索管道,经基准测试验证其在速度与质量上的双重优势;集成SmolVLM视觉模型与Qwen2.5生成模型的融合流程,实现从图像到食谱解释的完整链路;以及聚焦合成数据生成与验证的方法论研究,为使用LLM构建垂直领域数据集提供了可复现的范例。这些工作共同推动了推荐系统、多模态学习与数据合成领域的交叉发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务