遇见数据集

balua-food-es

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

Balùa Food (español) 是一个专为视觉语言模型微调设计的西班牙语食物识别数据集,源自Balùa应用(一款通过照片估算热量的设备端应用)。它包含俯拍视角的餐盘照片,标注了可见的主要食物及其估计分量(小/中/大)。数据集基于Nutrition5k(Thames等人,CVPR 2021,CC BY 4.0)的俯拍图像构建,但标签通过视觉蒸馏过程独立生成:使用Qwen2.5-VL-7B模型(Q4_K_M量化,温度0)处理每张照片,以西班牙语通用名称列出最多4种可见食物及其分量,输出为可解析的JSON。标签旨在描述“照片中实际可见的内容”,而非原始元数据中的克重信息。数据集包含3078个训练样本和326个验证样本,每个样本包括两个字段:`image`(餐盘的RGB俯拍照片)和`alimentos`(JSON格式字符串,结构为`{"alimentos":[{"nombre":"食物名称","racion":"分量"}]}`)。适用于图像到文本任务,特别是食物、营养、视觉语言和多模态模型的微调与研究。采用CC BY 4.0许可证,使用图像需注明Nutrition5k出处,标签归属Balùa项目,仅用于研究和教育目的,非临床营养建议。

Balùa Food (español) is a Spanish food recognition dataset designed for fine-tuning vision-language models, originating from the Balùa app (an on-device application that estimates calories from photos). It contains overhead-view plate photos annotated with visible main foods and their estimated portions (small/medium/large). The dataset is built on overhead images from Nutrition5k (Thames et al., CVPR 2021, CC BY 4.0), but the labels are independently generated through a visual distillation process: each photo is processed by the Qwen2.5-VL-7B model (Q4_K_M quantization, temperature 0), which is prompted to list up to four visible foods in Spanish common names and their apparent portions, with outputs validated as parsable JSON. The labels aim to describe what is actually visible in the photo, rather than the gram weight information in the original metadata. The dataset includes 3078 training samples and 326 validation samples, each with two fields: `image` (RGB overhead photo of the plate) and `alimentos` (a JSON-formatted string with the structure `{"alimentos":[{"nombre":"food name","racion":"portion"}]}`). It is suitable for image-to-text tasks, particularly for fine-tuning and research in food, nutrition, vision-language, and multimodal models. It uses the CC BY 4.0 license; use of the images requires attribution to Nutrition5k, while the labels belong to the Balùa project, and it is intended for research and educational purposes only, not as clinical nutrition advice.

创建时间:
2026-07-03
原始信息汇总

数据集概述:Balùa Food (español)

该数据集来自 Balùa 应用,专为微调视觉-语言模型(VLM)设计,用于从食物照片中估计卡路里。数据集包含西班牙语标注的食物图像。

  • 许可证:CC BY 4.0
  • 语言:西班牙语(es)
  • 任务:图像到文本(image-to-text)
  • 标签:食物、营养、视觉-语言、西班牙语、balua
  • 数据规模:1,000 < 样本数 < 10,000

数据特征

  • image:RGB 俯拍食物照片(图像类型)
  • alimentos:JSON 格式字符串,包含食物名称和份量({"alimentos":[{"nombre","racion"}]}),份量分为 pequeña(小)、media(中)、grande(大)

数据集划分

  • 训练集:3,078 个样本,约 1.39 GB
  • 验证集:326 个样本,约 136 MB
  • 总下载大小:约 1.51 GB
  • 总数据集大小:约 1.52 GB

数据构建方法

  • 标签为 100% 自有,通过视觉蒸馏生成:每张照片由 Qwen2.5-VL-7B(Q4_K_M,温度 0)处理,最多识别 4 种可见食物(西班牙语通用名称)及其 apparent 份量,输出验证为可解析的 JSON。
  • 图像来源于 Nutrition5k(Thames et al., CVPR 2021, CC BY 4.0),仅选取俯拍图像(realsense_overhead)。

使用示例: python from datasets import load_dataset ds = load_dataset("natzx94/balua-food-es") print(ds["train"][0]["alimentos"])

许可证与归属

  • CC BY 4.0 许可。
  • 图像需标注 Attribution 至 Nutrition5k(Thames et al., CVPR 2021);标签为 Balùa 项目所有。
  • 仅供研究或教育用途。份量与食物识别为参考性质,不构成临床营养评估。
搜集汇总
数据集介绍
balua-food-es 数据集图片
构建方式
在食物视觉理解与营养估算的交叉领域中,高质量标注数据是推动模型从简单分类走向细粒度感知的关键。Balùa Food (español) 数据集正是为此而生,其构建根植于蒸馏学习范式:所有图像源自Nutrition5k数据集中的俯拍视角(realsense_overhead)菜肴照片,标签则经由Qwen2.5-VL-7B大模型(采用Q4_K_M量化、温度参数设为0)对每张图像进行视觉蒸馏生成,模型被要求输出最多四种可见食物的西班牙语通用名称及其视觉份量(小/中/大)。最终输出经JSON可解析性验证后确认为标签。这一过程舍弃了原始元数据中的克级营养数值,转而聚焦于图像中实际可见的内容,使得标签更贴合视觉模型真实学习所需。数据集共包含3,078个训练样本与326个验证样本,均以图像-结构化JSON对的形式存储。
特点
该数据集的核心特点在于其面向视觉语言模型的精细语义对齐与西班牙语语言覆盖。每个样本由一张RGB俯拍菜肴图像与一个描述性JSON构成,JSON内结构化地列出了食物名称及其视觉份量等级,这种表示方式为多模态模型提供了从像素到结构化知识的直接映射路径。标签通过大模型蒸馏获得,具备规模一致性与语义泛化能力,避免了人工标注的主观偏差和成本瓶颈。此外,数据集采用完全自有的标签体系,与原始Nutrition5k的元数据剥离,从而在保持图像来源合规(CC BY 4.0)的同时,形成了一组专门针对西班牙语环境、面向视觉食物理解下游微调任务的独立资源。其规模虽在千级,但标签设计紧密服务于实际应用场景——如移动端卡路里估算,兼顾了实用性与领域专注度。
使用方法
数据集的使用极为简洁高效,完全兼容HuggingFace Datasets库的加载流程。用户仅需通过一行代码`from datasets import load_dataset; ds = load_dataset("natzx94/balua-food-es")`即可将训练与验证分片自动载入内存。每个样本以字典形式呈现,包含键`image`(PIL图像对象)与`alimentos`(JSON字符串),后者可通过Python内置的`json.loads()`解析为食物列表与对应份量。该数据格式专为视觉语言模型的微调或零样本评估设计——研究者可直接将图像-文本对输入如Qwen-VL、LLaVA等架构,以训练模型从图像中推理出结构化食物清单及其视觉量级。数据集默认启用`default`配置,无需额外参数选择,适合快速实验迭代与基准测试。
背景与挑战
背景概述
近年来,食品图像理解与营养估算成为计算机视觉与多模态学习交叉领域的重要研究方向,其应用场景涵盖健康监测、饮食记录与智能餐饮管理等多个方面。balua-food-es数据集由Balùa应用团队于2023年创建,其核心研究问题聚焦于如何从单一俯拍图像中提取可食用的食物种类及其视觉分量信息,以支持西班牙语环境下的视觉语言模型微调。该数据集基于Nutrition5k(Thames等,CVPR 2021,CC BY 4.0)中的俯拍图像,并通过Qwen2.5-VL-7B模型蒸馏生成高质量西班牙语标签,共含3078张训练图像与326张验证图像。其独特之处在于标签仅描述图像中可见的主要食物及其分量(小/中/大),而非原始元数据中的精确克数,从而更贴合模型从视觉信号进行学习的真实需求。balua-food-es填补了西班牙语食品图像理解领域标注数据集的空白,为多模态模型在非英语食品场景下的泛化能力研究提供了重要基准。
当前挑战
balua-food-es数据集面临的核心挑战包括领域问题与构建过程双重层面。在领域问题层面,食品图像理解需克服视觉粒度差异(如相似食物间的细微外观区分)、光照与拍摄角度变化导致的识别偏差,以及分量估算的主观性——同一食物在不同文化背景或个体眼中的“小/中/大”判断可能存在显著差异,这限制了模型在真实用户场景中的鲁棒性。在构建过程层面,标签完全依赖Qwen2.5-VL-7B模型蒸馏生成,缺乏人工校验机制,可能导致模型偏见(如对高频食物类别的过度拟合)及误标风险,尤其是当图像中食物边界模糊或堆叠时,模型可能遗漏或错误识别关键成分。此外,数据集规模较小(约3千余样本),且仅包含俯拍视角,难以覆盖实际饮食场景中常见的多角度拍摄、复杂摆盘或混合食物结构,这些局限性共同对模型泛化能力构成严峻挑战。
常用场景
经典使用场景
在计算机视觉与自然语言处理交叉领域,balua-food-es数据集被广泛用于多模态食品识别与描述生成任务。其核心价值在于提供从俯拍餐盘图像到西班牙语食品清单的结构化映射,支持视觉语言模型(VLM)进行细粒度的食品成分检测与分量估计。研究人员常利用该数据集微调预训练模型,使其能够从图像中自动提取可见食品名称及对应分量等级,进而实现从像素到语义的端到端转换,尤其适用于多语言、少样本的食品理解场景。
解决学术问题
该数据集有效解决了传统营养评估研究中标注粒度粗、语言覆盖窄的难题。通过提供西班牙语标注的可见食品成分与分量信息,balua-food-es填补了非英语食品图像理解数据资源的空白。它推动了视觉语义对齐、跨模态蒸馏等学术问题的探索,使模型能够学习从视觉特征到结构化营养信息的映射关系。其意义在于为多语言环境下的自动化饮食记录、营养摄入估算提供了可靠基准,促进了计算机视觉在公共健康领域的算法公平性与地域适应性研究。
衍生相关工作
基于balua-food-es数据集,研究者衍生了多项经典工作。一方面,它被用于评估和对比不同视觉语言模型在西班牙语食品理解任务上的表现,推动了Qwen2.5-VL等模型的本地化适配研究。另一方面,该数据集的构建方法——即通过大语言模型对现有营养图像进行知识蒸馏标注——启发了弱监督数据生成范式,催生了多语言、跨领域食品数据集的自动标注管线,促进了低资源语言场景下视觉语言模型的快速部署与迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务