ConfV2A Dataset
收藏资源简介:
该数据集包含从瓶子回收压缩机中收集的同步麦克风音频和振动记录,用于瓶子/罐子分类任务。数据包括5个类别(1升瓶子、500毫升瓶子、330毫升罐子、500毫升罐子、错误),共120个检测事件/1206个保留窗口,窗口长度为0.8秒的同步音频-振动数据。数据集采用时间分块划分(70%/15%/15%),原始和预处理数据均提供。
This dataset contains synchronized microphone audio and vibration recordings collected from a bottle recycling compressor, tailored for bottle and can classification tasks. It includes five categories: 1-liter bottle, 500-milliliter bottle, 330-milliliter can, 500-milliliter can, and error cases. The dataset comprises 120 detection events and 1206 retained windows, all consisting of synchronized audio-vibration data with each window lasting 0.8 seconds. The dataset is split using temporal chunking with a partition ratio of 70%/15%/15%, and both raw and preprocessed versions of the data are provided.
数据集概述:ConfV2A
这是一个用于回收压实机中瓶/罐分类的同步振动-音频数据集,支持置信度引导的振动到音频蒸馏方法(ConfV2A)。
核心任务
- 任务:回收压实机中的瓶/罐分类。
- 目标:训练一个仅使用麦克风音频的分类器,在训练阶段利用同步振动信号作为辅助模态,推理时无需振动传感器。
数据集详情
- 数据模态:麦克风音频 + 振动传感器信号。
- 类别数:5类,包括 1升瓶、500毫升瓶、330毫升罐、500毫升罐 以及异常插入或机器行为(如卡顿、异响)构成的
error类。 - 数据规模:
- 检测事件:120个。
- 保留的时间对齐窗口:1206个。
- 窗口长度:0.8秒(音频-振动对齐窗口)。
- 数据划分:按时间顺序的分块划分,比例为 70% 训练 / 15% 验证 / 15% 测试。
- 原始数据位置:
data/raw/sensor_plot_project/。 - 处理后的振动数据:
data/processed/。
主要类别文件示例
| 类别 | 音频文件 | 原始振动 CSV 文件 |
|---|---|---|
bottle_1000 |
data/raw/sensor_plot_project/bottle_1/1.wav |
data/raw/sensor_plot_project/bottle_1/1.csv |
bottle_500 |
data/raw/sensor_plot_project/bottle_500/500ml.wav |
data/raw/sensor_plot_project/bottle_500/500ml.csv |
bottle_can_330 |
data/raw/sensor_plot_project/bottle_yi_330/yi_330.wav |
data/raw/sensor_plot_project/bottle_yi_330/yi_330.csv |
bottle_can_500 |
data/raw/sensor_plot_project/bottle_yi_500/yi_500.wav |
data/raw/sensor_plot_project/bottle_yi_500/yi_500.csv |
error |
data/raw/sensor_plot_project/error/error.wav |
data/raw/sensor_plot_project/error/error.csv |
方法(ConfV2A)
- 训练一个仅基于音频频谱图的 CNN 基线模型。
- 在对齐的振动窗口上训练一个仅基于振动信号的 TCN 教师模型。
- 使用真实标签和教师软标签,通过蒸馏将振动教师的知识传递给音频学生模型。
- 根据教师置信度对 KL 散度项进行加权,使不可靠的教师预测影响力降低。
- 推理时仅部署训练好的音频学生模型。
主损失函数: text L = (1 - alpha) * CE + alpha * c_i * KL
其中 CE 为真实标签交叉熵损失,KL 为教师软标签信息传递,c_i 为教师置信度,temperature=3.0,主要实验中 alpha=0.4。
关键结果
- 音频基线:测试准确率 79.01%,Macro-F1 78.19%。
- 振动教师:测试准确率 91.14%,Macro-F1 91.80%。
- 标准知识蒸馏(KD)音频学生:测试准确率 86.99%,Macro-F1 86.62%。
- ConfV2A 音频学生:测试准确率 90.24%,Macro-F1 89.83%(仅使用音频推理)。
鲁棒性评估(波形级高斯噪声)
ConfV2A 在所有信噪比(0 dB 至 30 dB)下均优于标准 KD:
| 模型 | 干净 | 30 dB | 20 dB | 10 dB | 5 dB | 0 dB |
|---|---|---|---|---|---|---|
| 标准 KD | 86.99% | 87.80% | 88.62% | 83.74% | 74.80% | 55.28% |
| ConfV2A | 90.24% | 91.87% | 90.24% | 86.18% | 78.86% | 56.10% |
实验说明
主要报告使用的模型存储于 results/main/original_time_aligned_audio_spectrogram_outputs/ 和 results/main/original_time_aligned_tcn_teacher_outputs/。结果文件夹中名称包含 _old 的为论文对齐的原始模型输出。





