遇见数据集

SmellBench

收藏
github2026-05-25 更新2026-05-26 收录
数据链接:
官方服务:

资源简介:

SmellBench是第一个公开可用的数据集,用于评估人工电子鼻的嗅觉识别能力,并与生物系统进行基准比较。该数据集基于Anemo Labs的SmellDB构建,包含3,000个标记样本,每个样本持续115秒,具有32个传感器通道,总记录时间为96小时,涵盖12个语义气味标签。

SmellBench is the first publicly available dataset for evaluating the olfactory recognition capabilities of artificial electronic noses and performing benchmark comparisons against biological olfactory systems. Built upon Anemo Labs’ SmellDB, this dataset contains 3,000 labeled samples, each lasting 115 seconds with 32 sensor channels. The total recording time amounts to 96 hours, and the dataset covers 12 semantic odor labels.

创建时间:
2026-05-25
原始信息汇总

数据集概述

SmellBench 是首个公开的、用于机器嗅觉基准测试的数据集,旨在通过标准化的气味识别任务,评估人工智能电子鼻与人类生物系统的嗅觉识别能力。该数据集由 Anemo Labs 基于 SmellDB 构建,并附带在线竞赛平台。

核心特性

属性 详情
样本数量 3,000 个已标注样本
采样时长 每个样本持续 115 秒
传感器通道 32 个传感器通道
总记录时长 96 小时
类别数量 12 种语义气味标签

任务定义

给定来自 32 通道电子鼻的多通道时间序列传感器数据,任务是预测每个样本对应的 1-of-12 气味类别。

气味类别列表

编号 标签
1 🍊 甜橙 (Sweet Orange)
2 🪵 皮革与烟草 (Leather & Tobacco)
3 🍂 肉桂叶 (Cinnamon Leaf)
4 🍌 香蕉 (Banana)
5 ☕ 拿铁咖啡 (Cafe Latte)
6 🌹 玫瑰 (Rose)
7 💜 薰衣草油 (Lavender Oil)
8 🥥 椰子 (Coconut)
9 🥭 芒果 (Mango)
10 🌸 英国兰花 (English Orchid)
11 🧴 猴子屁 (Monkey Farts)
12 💧 水 (Water)

数据获取与使用流程

  1. 获取 API 密钥:需通过向 https://api.anemolabs.com 发送 API 调用进行注册和激活,密钥将通过邮件发送。
  2. 下载数据集:通过 Git 克隆仓库 https://github.com/anemo-labs/smellbench.git。仓库结构包含:
    • data/X_train.csv:传感器读数(N 个样本 × 32 通道)
    • data/y_train.csv:对应的标签
  3. 构建模型:使用提供的 CSV 文件进行模型训练。
  4. 提交预测:通过 REST API 将预测结果(预测的标签字符串列表)提交至 https://api.anemolabs.com/v1/evals
  5. 查看结果:可实时获取评分,并可选地发布在公共排行榜上。排行榜地址为 https://smelldb.anemolabs.com/leaderboard

许可信息

数据集的具体许可信息未在页面中详细说明。

搜集汇总
数据集介绍
SmellBench 数据集图片
构建方式
SmellBench是基于Anemo Labs的SmellDB数据集构建的首个机器嗅觉基准数据集。该数据集通过32通道电子鼻设备,在115秒的采样时长内,对12种不同的气味类别进行持续记录,总计收集了3000个标注样本,累积录制时长达到96小时。数据以多通道时间序列格式呈现,每个样本对应一组32维的传感器响应数据,并配有相应的语义气味标签。研究者可以通过GitHub仓库直接获取训练数据,包括传感器读数矩阵X_train.csv和对应的标签文件y_train.csv。
特点
SmellBench的核心特色在于其开创性地建立了人工电子鼻与人类嗅觉系统在标准化气味识别任务中的对比基准。数据集涵盖12种精心挑选的语义气味类别,包括甜橙、皮革与烟草、香蕉、玫瑰、椰子、芒果等常见气味,以及独具特色的Monkey Farts和空白对照的水样。每个样本均包含115秒内32通道传感器的连续响应,提供了丰富的时间动态信息。此外,该数据集还配套了实时API评估系统和公开排行榜,允许研究者即时获得模型性能反馈。
使用方法
使用SmellBench首先需要注册并获取API密钥,通过两次API调用完成注册和激活流程。研究者可通过git clone命令下载数据集,利用pandas库读取X_train.csv和y_train.csv文件进行模型训练。训练完成后,通过REST API提交预测结果,API会即时返回评分。提交过程需要将预测标签列表以JSON格式POST至指定端点,并携带API密钥进行身份验证。研究者还可以通过GET请求查询历史提交记录,评估进展。整个过程完全自动化,支持快速迭代实验。
背景与挑战
背景概述
嗅觉作为人类感知系统中最为复杂且理解尚浅的感官通道,其机制长期以来困扰着神经科学与人工智能领域的研究者。SmellBench由Anemo Labs于近期推出,作为首个针对机器嗅觉能力的标准化基准数据集,旨在评估人工电子鼻在气味识别任务上能否媲美乃至超越生物嗅觉系统。该数据集包含3000个标注样本,覆盖12类语义气味标签,数据来自32通道电子鼻传感器,总记录时长达到96小时。其研究核心在于构建一个可复现、可比较的竞争性评估框架,通过API提交预测结果并实时反馈评分,推动机器嗅觉从实验原型迈向标准化研究,对传感信号处理与嗅觉计算交叉领域具有里程碑式的影响力。
当前挑战
机器嗅觉长期面临两大核心挑战。在领域问题层面,气味识别本质上是一个非平稳、高维的多通道时间序列分类任务,电子鼻传感器的响应易受环境温湿度、气流扰动和传感器漂移等因素干扰,导致动态信号在类间区分度低下,加之气味分子间存在复杂的交叉响应与掩蔽效应,使得稳定地建立传感器信号与语义标签的映射关系极为困难。在构建过程中,SmellBench的创建需要确保数据采集的严格标准化,包括环境控制、样本呈现方式与同步标注的精确性;同时,要设计一个可靠、易用的API提交系统以支持即时评测与结果透明化,并保障用户在不同硬件条件下预测结果的可复现性,这些都对数据质量管控与平台工程提出了严苛的要求。
常用场景
经典使用场景
在机器嗅觉这一前沿交叉学科中,SmellBench作为首个公开的标准化嗅觉识别基准数据集,被广泛用于电子鼻系统对多类气味进行端到端分类的研究。该数据集包含3000个样本,每个样本涵盖32个传感器通道的时域响应信号,标记了12种语义化的气味类别,如甜橙、玫瑰、咖啡拿铁等。研究者利用这一多通道时间序列数据,训练深度学习模型以识别复杂气味模式,并通过与人类嗅觉表现的对比,评估模型的感知能力。经典的用法包括将传感器原始信号作为输入,使用卷积神经网络或循环神经网络等架构提取时序特征,最终输出气味类别概率分布。
实际应用
在实际应用中,SmellBench所支持的气味分类模型具有广泛而深远的价值。首先,在食品安全与质量控制领域,搭载该模型的人工嗅觉系统能够实时检测食品中的腐败气味或掺假成分,例如区分天然橙味与合成香精,提升质检效率。其次,在公共安全场景中,电子鼻可部署于机场、地铁等场所,快速识别恶臭化学品或危险物质释放的气味,为预警系统提供决策依据。此外,该技术有望进入家居健康管理领域,通过监测室内环境的异味变化提示甲醛超标或细菌滋生风险。最后,在医疗辅助诊断方向,基于SmellBench训练的模型未来可被用于患者呼气气味筛查,辅助识别代谢性疾病。
衍生相关工作
SmellBench的发布催生了一系列具有启发意义的后续研究工作。在模型架构方面,研究者基于其多通道时间序列特性,提出了融合注意力机制的时序卷积网络,用以捕捉不同传感器信号间的动态交互模式。在对抗性训练领域,有工作引入传感器噪声模拟策略,提升了模型在真实环境中的鲁棒性。另一重要方向是将人类主观气味描述与传感器特征进行跨模态对齐,构建面向感官的语义映射模型,从而让机器的嗅觉表达更贴近人的感知逻辑。此外,迁移学习方法的探索也随数据集扩展而兴起,研究者探索将在SmellBench上预训练的模型迁移至其他小型定制气味数据集,以缓解数据稀疏问题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务