遇见数据集

SmellNet-V

收藏
arXiv2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

SmellNet-V是一个大规模视觉-嗅觉多模态数据集,由韩国科学技术院等机构构建,旨在解决视觉与嗅觉联合表征学习的数据稀缺问题。该数据集基于SmellNet嗅觉数据集,通过语义配对策略将约18万条嗅觉时间序列样本与开放世界的网络图像进行合成配对,数据来源于50种食物和天然成分的便携式气体传感器采集。其创建过程利用了气味在语义类别内的不变性原理,无需昂贵的实地联合采集。该数据集主要应用于多模态感知研究,支持嗅觉分类、跨模态检索及气味源定位等下游任务,以推动人工智能在视觉-嗅觉整合领域的发展。

SmellNet-V is a large-scale visual-olfactory multimodal dataset constructed by institutions including the Korea Advanced Institute of Science and Technology (KAIST), aiming to tackle the data scarcity issue in joint visual and olfactory representation learning. Built upon the original SmellNet olfactory dataset, this dataset adopts a semantic pairing strategy to synthesize paired samples of approximately 180,000 olfactory time-series instances and open-domain web images. The olfactory data was collected via portable gas sensors from 50 categories of foods and natural ingredients. Its development leverages the invariance principle of odors within the same semantic category, eliminating the need for costly on-site joint data collection. This dataset is primarily applied in multimodal perception research, supporting downstream tasks such as olfactory classification, cross-modal retrieval, and odor source localization, so as to advance the progress of artificial intelligence in the field of visual-olfactory integration.

创建时间:
2026-06-26
搜集汇总
数据集介绍
构建方式
SmellNet-V的构建基于一个核心洞察:同一语义类别内,气味的身份对视觉变换(如光照、尺度或颜色变化)具有高度不变性。研究团队首先从现有的纯嗅觉数据集SmellNet中获取50种食材的化学传感器时序信号,并将其分割为固定时长的“嗅探单元”。随后,通过大语言模型为每种食材生成描述多样化真实场景的检索查询,从互联网采集海量图片,并经过CLIP验证、水印检测及人工筛选的三阶段精炼流程,确保图像与食材在语义上高度对齐且质量可靠。最终,将每个嗅探单元与同类别食材的图片随机配对,构建出大规模视觉-嗅觉配对数据集。
特点
SmellNet-V的核心特点在于其创新性地实现了纯嗅觉数据向跨模态基准的可扩展转化,无需昂贵的真实配对采集流程。该数据集涵盖水果、香草、坚果、香料和蔬菜五大类共50种食材,通过合成配对策略有效模拟了自然的视觉-嗅觉对应关系。尤为重要的是,数据集通过将长时间嗅觉记录切分为短时嗅探单元,不仅增加了数据粒度,还更贴合生物嗅觉的感知模式。此外,每个训练周期内图像-嗅探对的循环重采样策略,进一步增强了跨模态配对的多样性,避免了模型对固定合成对的过拟合,从而强化了类别层面的语义对齐。
使用方法
SmellNet-V为视觉-嗅觉联合表征学习提供了基础训练框架,适用于自监督的跨模态对比学习。研究者可利用该数据集训练双流编码器架构,通过密集局部对齐损失函数,将视觉特征图与嗅觉时序特征映射至共享嵌入空间,从而实现气味分类、跨模态检索和气味源定位等下游任务。具体而言,模型可基于气味输入检索视觉场景中对应的食材图像,或根据嗅觉信号在图像中精确定位气味源区域。该数据集还支持交互式定位评估,通过在同一图像中切换不同气味输入,检验模型对气味语义的细粒度空间理解能力。
背景与挑战
背景概述
在当代多模态人工智能系统中,视觉与语言、音频乃至触觉的融合已取得显著进展,然而嗅觉这一在生物感知中扮演核心角色的模态却长期被忽视,这主要源于便携式嗅觉传感器的稀缺和大规模标注数据的匮乏。为填补这一空白,韩国科学技术院、韩国外国语大学与蔚山科学技术院的研究团队于2026年提出了SmellNet-V数据集,旨在构建首个规模化的视觉-嗅觉配对基准。该数据集巧妙地利用了气味标识在同类视觉变换中保持不变的特性,通过将现有纯嗅觉数据集SmellNet中的样本与野外网络图像进行语义级别的合成配对,将单模态数据转化为跨模态学习资源。这一创新性工作开创了视觉-嗅觉联合学习的新方向,为理解多样感知系统中视觉与嗅觉的内在关联提供了关键数据支撑。
当前挑战
SmellNet-V所应对的核心挑战在于跨模态数据的天然匮乏——在真实世界中同步采集视觉与嗅觉信号成本高昂且操作困难,传统方法因此局限于单模态分析。为解决此困境,该数据集基于气味在同类视觉变换下的不变性假设,通过合成配对策略将纯嗅觉数据与语义对齐的网络图像结合,从而突破数据瓶颈。然而,这一方法面临双重挑战:其一,合成配对可能引入语义噪声与视觉歧义,例如不同类别但外形相似的食材(如香菜与韭菜)易导致错误关联,需依赖严格的CLIP验证与人工筛选以确保配对质量;其二,在构建过程中,如何从海量网络图像中自动筛选出高保真、无退化且语义一致的视觉样本,涉及多阶段过滤流水线的设计,包括对抗水印干扰与物种状态异常,这对流程的鲁棒性与效率提出了严苛要求。
常用场景
经典使用场景
SmellNet-V数据集最经典的使用场景在于为多模态感知研究提供视觉与嗅觉的联合表征学习基准。通过将现有的纯嗅觉数据集与语义对齐的野外网络图像进行合成配对,该数据集突破了传统多模态学习中嗅觉模态因缺乏配对数据而长期被忽视的困境。研究者可借助该数据集训练自监督模型,学习气味与视觉场景之间的密集局部对齐,从而实现对气味源的空间定位、跨模态检索以及气味分类等基础任务,为探索视觉与嗅觉两大感官系统的内在耦合关系开创了新的实验范式。
实际应用
SmellNet-V数据集的应用潜力广泛渗透于智能感知与生活服务领域。在实际场景中,该数据集可赋能于智能厨房系统,通过嗅觉信号自动识别并定位食材位置,辅助烹饪流程管理或食品库存监控。同时,其在虚拟现实与增强现实领域具备重要价值,通过气味驱动视觉内容的检索与呈现,可为用户构建更加沉浸式的多感官交互体验。此外,基于该数据集训练的模型还可应用于食品品质检测,通过判别食材新鲜程度及气味变化,为食品安全与质量管控提供智能化的技术支撑。
衍生相关工作
基于SmellNet-V数据集,研究者衍生出多项具有开创性的经典工作,其中最具代表性的是See & Sniff框架,该框架通过密集局部对齐的自监督学习范式,首次实现了视觉与嗅觉的联合表征建模,并创新性地提出了像素级气味定位任务及其对应的评估基准。相关后续工作进一步探索了跨模态气味检索、交互式气味源定位以及零样本气味分类等前沿课题,逐步构建起一个以气味为核心的多模态感知研究体系。这些衍生的研究工作不仅验证了SmellNet-V数据集在推动机器嗅觉发展中的基础性作用,也为未来整合气味与其他感官模态的通用多模态智能系统奠定了坚实的技术基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务