FoodSense
收藏资源简介:
FoodSense是由中佛罗里达大学团队构建的多感官食品数据集,包含2,987张食物图像及其对应的66,842条人类标注。该数据集通过Yelp开放数据集筛选获得,每张图像由约21名参与者从味觉、嗅觉、质地和声音四个维度进行1-5级评分,并辅以文字描述。研究团队采用配额抽样方法,通过在线调查平台收集了8,382名参与者的感官预期数据,并设计了两阶段标注扩展流程将简短评分转化为基于图像的推理轨迹。该数据集主要应用于跨模态感官预测研究,旨在解决数字食品交互场景中通过视觉线索预测多感官体验的挑战,可支持食品推荐系统和特殊饮食需求等应用场景。
FoodSense is a multi-sensory food dataset developed by a research team at the University of Central Florida. It comprises 2,987 food images and their corresponding 66,842 human annotations. This dataset was curated from the Yelp Open Dataset. For each image, roughly 21 participants provided ratings on a 1-5 scale across four dimensions: taste, olfaction, texture, and auditory sensation, alongside accompanying textual descriptions. The research team utilized quota sampling to collect sensory expectation data from 8,382 participants via online survey platforms, and designed a two-stage annotation expansion workflow to transform concise ratings into image-based reasoning trajectories. This dataset is primarily used for cross-modal sensory prediction research, with the goal of addressing the challenge of forecasting multi-sensory experiences using visual cues in digital food interaction scenarios, and can support applications such as food recommendation systems and special dietary requirement scenarios.
FoodSense 数据集概述
数据集基本信息
- 数据集名称: FoodSense
- 数据规模: 544,312 张食物图像
- 图像来源: Yelp 评论
- 标注规模: 包含 438 张经过人工标注的测试图像
- 标注维度: 4 个感官维度(味觉、嗅觉、质地、声音)
- 评分尺度: 每个维度使用 1-5 分制
- 标注者数量: 每张图像由 3 名以上标注者进行标注
数据集构成
- 总图像数量: 544,312 张
- 训练图像数量: 3,590 张(附带评论文本)
- 人工标注测试集数量: 438 张
- 感官维度: 4 个(味觉、嗅觉、质地、声音)
数据标注与质量
- 标注一致性: 标注者间成对平均绝对误差为 1.039;留一法对比平均值的平均绝对误差为 0.793。
- 标注说明: 感官感知具有主观性,人类标注者之间在 5 分量表上存在近 1 分的差异。
数据集特点与用途
- 核心任务: 从单张食物图像预测四种感官维度(味觉、嗅觉、质地、声音),并生成 1-5 分的校准评分及自然语言理由。
- 问题定义: 将人类从视觉外观推断食物非视觉感官属性的能力形式化为“基于视觉线索的跨感官推理”。
- 数据集目的: 为多感官食物理解提供大规模资源。
相关模型与基准
- 配套模型: FoodSense-VL,一个基于 Gemma 3 27B 的两阶段 QLoRA 微调视觉语言模型。
- 基准测试: 在 438 张人工标注的测试图像上,对 9 个模型在 4 个感官维度上进行了评估,使用了 7 项指标。
已知局限性
- 领域偏差: 所有图像均来自 Yelp,严重偏向北美餐厅食物。未测试其在非西方菜系、家常菜或原材料上的性能。
- 标注者人口统计学偏差: 感官感知受文化影响。标注者群体可能无法代表全球食物感知规范的多样性。
- 测试集规模: 438 张人工标注的测试图像提供了中等的统计效力。某些单感官指标的置信区间可能较宽。
- 评分分布: 感官评分集中在 1-5 量表的中间区域,这种分布使得基于均值的预测策略在平均绝对误差指标上具有欺骗性的竞争力。
可用资源
- 代码: 完整的训练、推理和评估流程。包含适用于 SLURM 高性能计算集群的 SBATCH 脚本。
- 模型权重: Stage-1 和 Stage-2 检查点的 QLoRA 适配器。基础模型为 Gemma 3 27B-IT。
- 基准数据: 9 个模型在 5 种感官上的所有预测和评估指标。

- 1FoodSense: A Multisensory Food Dataset and Benchmark for Predicting Taste, Smell, Texture, and Sound from Images中佛罗里达大学·工程与计算机科学学院; 中佛罗里达大学·商业管理学院; 中佛罗里达大学·人工智能研究所 · 2026年



