遇见数据集

OmniFood-Bench

收藏
arXiv2026-07-09 更新2026-07-11 收录
官方服务:

资源简介:

OmniFood-Bench是由多所高校研究团队基于MM-Food-100K数据集构建的综合性基准测试集,旨在评估视觉语言模型在营养推理和个性化健康建议方面的能力。该数据集包含1,208个高质量样本,涵盖自制食品、餐厅食品、包装食品和生鲜原料四大类别,并标注了食材、烹饪方法、分量重量及营养成分等关键信息。其构建过程通过精心筛选和人工核查,确保了数据的多样性与可靠性,并依据权威健康标准建立了针对特定临床状况的摄入建议标签。该数据集主要应用于食品计算和医疗保健领域,旨在解决现有模型在从视觉感知到物理属性量化、再到安全关键健康咨询的端到端推理链中存在的“语义-物理鸿沟”问题,推动构建可信赖的自主健康代理。

OmniFood-Bench is a comprehensive benchmark dataset constructed by research teams from multiple universities based on the MM-Food-100K dataset, aiming to evaluate the capabilities of vision-language models in nutritional reasoning and personalized health advice. This dataset includes 1,208 high-quality samples covering four major categories: homemade foods, restaurant dishes, packaged foods, and fresh raw ingredients, with key annotations such as ingredients, cooking methods, serving weights, and nutritional components. Its construction process adopts rigorous screening and manual verification to ensure the diversity and reliability of the data, and establishes intake recommendation labels for specific clinical conditions based on authoritative health standards. Mainly applied in the fields of food computing and healthcare, this dataset aims to solve the "semantic-physical gap" problem in the end-to-end reasoning chain of existing models, which spans from visual perception to physical property quantification and then to safety-critical health consultation, and promotes the construction of trustworthy autonomous health agents.

创建时间:
2026-07-09
原始信息汇总

数据集概述

该页面描述的是一个名为 OmniFood-Bench 的食物图像评估系统,专注于多模态大语言模型在食物图像分析任务上的评估。

数据集规模与内容

  • 样本数量:包含 1,200 个食物样本
  • 图像来源:原始图像数据来自 Hugging Face 上的 Codatta/MM-Food-100K 数据集。本仓库中图像文件夹 food_datasets_1200/images 因上传大小限制已被移除,可通过 utils/download_1200_samples.py 下载。

评估任务

系统支持对多模态模型进行以下四项任务的评估:

  • 成分识别:识别食物图像中的食材。
  • 营养分析:分析热量、蛋白质、脂肪、碳水化合物等营养成分。
  • 疾病风险评估:评估食物对特定疾病的影响。
  • 份量估计:估计食物的重量和份量大小。

支持的模型

  • 闭源 API 模型:GPT-5.1、Claude-3.5-Sonnet(实际使用 claude-sonnet-4-20250514)、Gemini-3-Pro(实际使用 gemini-3-flash 系列)、Qwen3-VL-8B-Instruct。
  • 开源本地模型:InternVL3.5-8B、Llama-3.2-11B-Vision-Instruct。

注意:部分文件命名中的模型编号可能不准确,实际模型信息请以对应研究论文为准。

输出与分析

评估结果包括:

  • JSON 格式详细结果:存放于 output/json/
  • 可视化图表:包括柱状图、折线图、雷达图等,存放于 output/figure/
  • 统计报告:包括 MAPE 误差分析、食物类型分布统计、疾病风险评估统计等,存放于 output/sum_up/

使用说明

  • 环境要求:Python 3.9+、CUDA 11.8+(本地 GPU 模型)、16GB+ 内存。
  • 安装:提供一键安装脚本 install_requirements.sh 或手动安装方式(pip install -r requirements.txt)。
  • 快速启动:可通过 bash/run_all.sh 运行全部模型评估,或单独运行特定模型的评估脚本。
  • 可视化:通过 utils/draw/run_all_plots.sh 生成统计图表。

项目结构

food/ ├── src/ # 评估脚本 ├── bash/ # 执行脚本 ├── utils/ # 工具函数(绘图、数据收集) ├── output/ # 输出结果(JSON、图表、统计报告) ├── dataset/ # 数据集文件 ├── food_datasets_1200/ # 1200样本数据集 └── logs/ # 运行日志

搜集汇总
数据集介绍
OmniFood-Bench 数据集图片
构建方式
OmniFood-Bench 基于 MM-Food-100K 数据集精心构建,从中筛选出 1,208 个高质量样本,涵盖家常食品、餐厅食品、包装食品和生鲜蔬果四大类别。为确保数据真实性与可靠性,所有样本均经过人工核验。依据权威健康卫生标准,针对不同临床病症(如糖尿病、慢性肾病)定义了蛋白质、脂肪和碳水化合物的精确数值范围,建立了“正常摄入”、“控制摄入”与“不推荐摄入”三级标签体系,从而将视觉信息与医学安全准则直接关联。
特点
该基准的显著特色在于其层级化评估架构,模拟人类营养师的认知链条,从基础感知、定量推理到安全关键建议逐层递进。它首次将视觉感知与医疗安全结果统一衡量,揭示了当前大视觉语言模型在“语义-物理鸿沟”上的致命弱点——模型虽能准确命名菜肴,却在质量估计上出现灾难性失败,并从营养成分估计错误进一步传导至高风险健康建议的幻觉生成。此外,OmniFood-Bench 覆盖多种真实餐饮场景,包括复杂摆盘与包装OCR挑战,提供了对模型鲁棒性与可信度的严格压力测试。
使用方法
使用时,研究者可基于零样本设置,向模型输入食物图像并依次提出基础感知(如烹饪方式与成分识别)、定量估计(如每份食材克数与营养素含量)以及个性化健康建议三类问题。评估指标涵盖分类准确率、成分匹配率、平均绝对百分比误差(MAPE)以及安全咨询准确率等。代码与数据集已在匿名仓库公开,支持复现与扩展。该基准适用于系统性评估大视觉语言模型在饮食管理场景中的感知、量化与医学逻辑推理能力,为构建可信的自主体健康助手提供测评标准。
背景与挑战
背景概述
在人机交互与智能健康管理深度融合的时代浪潮下,基于视觉语言模型的自主代理正逐步渗透至饮食监测与个性化营养推荐等关键领域。然而,现有基准如Food-101与Nutrition5k多聚焦于粗粒度的菜肴分类或实验室环境下的营养分析,难以应对真实世界中从视觉外观到内在营养成分的深度推理需求。为弥合这一鸿沟,由东北大学秦皇岛分校、香港科技大学(广州)、北京航空航天大学及穆罕默德·本·扎耶德人工智能大学的研究人员于2026年共同创建的OmniFood-Bench应运而生。该基准以MM-Food-100K数据集为基础,首次构建了涵盖基础感知、定量推理与安全关键建议的三级递进式评估体系,旨在系统性地检验当前最先进视觉语言模型在饮食管理场景中的可信度与鲁棒性,为公共健康领域的自主代理部署确立了严苛的信任标准。
当前挑战
OmniFood-Bench所应对的核心挑战源于饮食管理领域特有的“系统性信息不对称”——视觉外观与内在营养成分之间存在难以调和的偏差。具体而言,模型在菜肴命名上虽可逼近人类水平,但对食物质量进行克级估测时却表现灾难性,其平均绝对百分比误差普遍高于50%,尤其在包装食品与生鲜蔬果等类别中误差激增至185%,暴露了“语义-物理鸿沟”。此外,构建过程中需从海量非结构化数据中精准标注复杂混合菜肴的微观成分、烹饪方法及对应诊断疾病(如糖尿病、高血脂)的摄入分级,这对多目标解耦与医学知识对齐提出了严苛要求。更为严峻的是,模型在给出健康建议时频繁产生“安全性幻觉”,将高糖高脂食物推荐给慢性病患者,凸显了当前架构在临床逻辑推理与安全对齐层面的脆弱性。
常用场景
经典使用场景
在饮食计算与个性化健康管理的研究领域,OmniFood-Bench被广泛用于评估大型视觉语言模型在多层次推理链路中的表现。该数据集通过构建从基础感知(如食材与烹饪方法识别)、定量推理(如份量估算与营养成分剖析)到安全关键建议(如面向特定疾病患者的膳食推荐)的三级评估体系,成为检验模型能否弥合视觉外观与内在营养组成之间“系统性信息不对称”的核心平台。研究者通常利用该数据集考察模型从像素到处方的端到端推理能力,尤其是在真实场景中面对复杂菜肴、包装食品及原生食材时的鲁棒性与可靠性。
实际应用
在实际应用中,OmniFood-Bench刻画的能力直接服务于智能膳食监控与慢病管理场景。例如,糖尿病患者可通过拍照获取菜肴的隐式糖含量分析与个性化摄入建议;高血脂患者可基于视觉感知的油脂含量得到“正常摄入、控制摄入或避免摄入”的临床分级指导。此外,该数据集验证了模型在识别包装食品标签、估算家庭自制餐食份量等方面的潜力,为嵌入移动设备或云端服务的“AI营养师”系统提供了从视觉到物理量的关键转换基准,尤其适用于需要实时、低成本营养评估的公共卫生干预工具开发。
衍生相关工作
该数据集衍生了一系列关注视觉与物理量解耦及医学知识增强的经典工作。后续研究围绕神经符号系统设计,将结构化营养知识库(如食物成分表)与视觉语言模型结合,利用检索增强生成来修正定量估计偏差。同时,基于OmniFood-Bench中发现的“稠密定量失效”现象,研究者提出了多目标解耦注意力机制与尺度感知模块,以提升复杂场景下的份量估计精度。此外,针对“医学逻辑不一致”问题,涌现出面向临床指南对齐的提示策略与安全对齐微调方法,推动模型在生成建议时兼顾礼貌性与事实严格性,从而降低代谢风险患者的健康隐患。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务