Gas Sensor Array Drift Dataset for Gas Classification
收藏资源简介:
该数据集由UC San Diego的ChemoSignals实验室收集,包含13,910个实例,每个实例包含16个化学传感器对特定气体的响应。数据集涵盖了六种目标气体:乙醇、乙烯、氨、乙醛、丙酮和甲苯,收集时间跨度为36个月。数据集的目的是解决传感器漂移问题,并创建鲁棒的气体鉴别模型。
This dataset was collected by the ChemoSignals Lab at the University of California, San Diego, and comprises 13,910 instances. Each instance contains the response profiles of 16 chemical sensors to specific gases. The dataset covers six target gases: ethanol, ethylene, ammonia, acetaldehyde, acetone, and toluene, with a data collection period spanning 36 months. The primary objective of this dataset is to address the sensor drift issue and build robust gas discrimination models.
气体传感器阵列漂移数据集
项目概述
该项目专注于气体传感器阵列的漂移补偿。传感器漂移是由于传感器响应随时间逐渐变化而影响数据质量的挑战。数据集包含六种目标气体的数千次测量,浓度水平各异:
- 乙醇
- 乙烯
- 氨
- 乙醛
- 丙酮
- 甲苯
模型的目标是学习这些漂移模式,并在传感器响应随时间变化时进行准确分类。
数据集信息
数据集包含13,910个实例,由加州大学圣地亚哥分校的ChemoSignals实验室收集。每个样本包含对特定气体的传感器响应。每个传感器读数由一个128维的特征向量表示,包含两种主要特征类型:
- 稳态特征(ΔR): 捕捉暴露时的电阻变化。
- 动态特征(EMA): 使用指数移动平均(EMA)值表示瞬态行为。
数据结构
数据分为10个批次,代表不同的时间段和气体类型,用于漂移分析:
| 批次ID | 月份ID |
|---|---|
| 1 | 1和2 |
| 2 | 3, 4, 8, 9, 10 |
| ... | ... |
| 10 | 36 |
关键统计
- 实例数: 13,910
- 特征数: 128
- 传感器类型: 16
- 持续时间: 36个月
目标和应用
目标是提高气体分类任务的性能和时间上的鲁棒性,实现以下功能:
- 传感器漂移缓解: 检测和补偿传感器漂移。
- 气体分类: 在不同浓度下分类六种气体。
- 特征工程: 利用稳态和动态特征进行分类。
数据预处理
每个测量结果生成一个128维的特征向量,包含以下内容:
- 稳态值(ΔR): 最大电阻与基线之间的变化。
- 归一化ΔR: 以比率表示。
- EMA特征(上升和衰减): 三种不同的α值(0.001, 0.01, 0.1)捕捉传感器响应的上升和下降阶段的瞬态部分。
分类模型
为了复现引用论文的结果,以下是关键参数:
- 交叉验证折数: 10
- 对数缩放的C值: 范围从-5到10,步长为1
- 对数缩放的Gamma(γ)值: 范围从-10到5,步长为1
- 特征缩放: 标准化特征值在-1到+1之间
训练超参数
| 批次 | C | Gamma | 准确率(%) |
|---|---|---|---|
| 1 | 256.0 | 0.03125 | 98.88 |
| 2 | 64.0 | 0.00390625 | 99.76 |
| ... | ... | ... | ... |
| 10 | 1024.0 | 0.0078125 | 99.66 |
项目结构
项目目录和文件结构如下:
plaintext . ├── data # 原始数据和处理后的文件 ├── src # 数据摄取、预处理和模型训练的源代码 ├── artifacts # 训练好的模型和流水线输出 ├── app.py # Flask应用程序用于预测 └── README.md # 项目文档
结果和评估
模型在所有批次中表现出强大的分类性能,大多数情况下准确率超过99%。评估采用10折交叉验证设置,分类器经过微调以适应不同的传感器条件和气体浓度。




