遇见数据集

ConfV2A Dataset

收藏
github2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

该数据集包含从瓶子回收压缩机中收集的同步麦克风音频和振动记录,用于瓶子/罐子分类任务。数据包括5个类别(1升瓶子、500毫升瓶子、330毫升罐子、500毫升罐子、错误),共120个检测事件/1206个保留窗口,窗口长度为0.8秒的同步音频-振动数据。数据集采用时间分块划分(70%/15%/15%),原始和预处理数据均提供。

This dataset contains synchronized microphone audio and vibration recordings collected from a bottle recycling compressor, tailored for bottle and can classification tasks. It includes five categories: 1-liter bottle, 500-milliliter bottle, 330-milliliter can, 500-milliliter can, and error cases. The dataset comprises 120 detection events and 1206 retained windows, all consisting of synchronized audio-vibration data with each window lasting 0.8 seconds. The dataset is split using temporal chunking with a partition ratio of 70%/15%/15%, and both raw and preprocessed versions of the data are provided.

创建时间:
2026-06-13
原始信息汇总

数据集概述:ConfV2A

这是一个用于回收压实机中瓶/罐分类的同步振动-音频数据集,支持置信度引导的振动到音频蒸馏方法(ConfV2A)。

核心任务

  • 任务:回收压实机中的瓶/罐分类。
  • 目标:训练一个仅使用麦克风音频的分类器,在训练阶段利用同步振动信号作为辅助模态,推理时无需振动传感器。

数据集详情

  • 数据模态:麦克风音频 + 振动传感器信号。
  • 类别数:5类,包括 1升瓶、500毫升瓶、330毫升罐、500毫升罐 以及异常插入或机器行为(如卡顿、异响)构成的 error 类。
  • 数据规模
    • 检测事件:120个。
    • 保留的时间对齐窗口:1206个。
  • 窗口长度:0.8秒(音频-振动对齐窗口)。
  • 数据划分:按时间顺序的分块划分,比例为 70% 训练 / 15% 验证 / 15% 测试。
  • 原始数据位置data/raw/sensor_plot_project/
  • 处理后的振动数据data/processed/

主要类别文件示例

类别 音频文件 原始振动 CSV 文件
bottle_1000 data/raw/sensor_plot_project/bottle_1/1.wav data/raw/sensor_plot_project/bottle_1/1.csv
bottle_500 data/raw/sensor_plot_project/bottle_500/500ml.wav data/raw/sensor_plot_project/bottle_500/500ml.csv
bottle_can_330 data/raw/sensor_plot_project/bottle_yi_330/yi_330.wav data/raw/sensor_plot_project/bottle_yi_330/yi_330.csv
bottle_can_500 data/raw/sensor_plot_project/bottle_yi_500/yi_500.wav data/raw/sensor_plot_project/bottle_yi_500/yi_500.csv
error data/raw/sensor_plot_project/error/error.wav data/raw/sensor_plot_project/error/error.csv

方法(ConfV2A)

  1. 训练一个仅基于音频频谱图的 CNN 基线模型。
  2. 在对齐的振动窗口上训练一个仅基于振动信号的 TCN 教师模型。
  3. 使用真实标签和教师软标签,通过蒸馏将振动教师的知识传递给音频学生模型。
  4. 根据教师置信度对 KL 散度项进行加权,使不可靠的教师预测影响力降低。
  5. 推理时仅部署训练好的音频学生模型。

主损失函数: text L = (1 - alpha) * CE + alpha * c_i * KL

其中 CE 为真实标签交叉熵损失,KL 为教师软标签信息传递,c_i 为教师置信度,temperature=3.0,主要实验中 alpha=0.4

关键结果

  • 音频基线:测试准确率 79.01%,Macro-F1 78.19%。
  • 振动教师:测试准确率 91.14%,Macro-F1 91.80%。
  • 标准知识蒸馏(KD)音频学生:测试准确率 86.99%,Macro-F1 86.62%。
  • ConfV2A 音频学生:测试准确率 90.24%,Macro-F1 89.83%(仅使用音频推理)。

鲁棒性评估(波形级高斯噪声)

ConfV2A 在所有信噪比(0 dB 至 30 dB)下均优于标准 KD:

模型 干净 30 dB 20 dB 10 dB 5 dB 0 dB
标准 KD 86.99% 87.80% 88.62% 83.74% 74.80% 55.28%
ConfV2A 90.24% 91.87% 90.24% 86.18% 78.86% 56.10%

实验说明

主要报告使用的模型存储于 results/main/original_time_aligned_audio_spectrogram_outputs/results/main/original_time_aligned_tcn_teacher_outputs/。结果文件夹中名称包含 _old 的为论文对齐的原始模型输出。

搜集汇总
数据集介绍
ConfV2A Dataset 数据集图片
构建方式
ConfV2A数据集源自真实回收压实机中瓶罐压缩事件的多模态同步采集。数据采集系统同时记录麦克风音频与振动传感器信号,经时间对齐后切割为0.8秒的音频-振动配对窗口。原始数据包含五类对象:1升瓶、500毫升瓶、330毫升罐、500毫升罐及异常状态,总计120个检测事件生成1206个保留窗口。数据集按时间顺序以70%、15%、15%的比例划分为训练、验证与测试集,确保时间连续性不被破坏。
特点
该数据集最显著的特征在于其构建了时间严格对齐的音频-振动双模态数据,为知识蒸馏提供了天然的监督信号。数据集中专门设计了异常类别,涵盖卡顿、犹豫等非典型机械行为,增强了模型对真实场景的鲁棒性。基于该数据训练的ConfV2A方法,通过自信度感知的蒸馏策略,使仅依赖音频的推理模型准确率达到90.24%,较基线提升逾11个百分点,同时在噪声环境下表现优于传统知识蒸馏方法。
使用方法
数据集使用时需遵循特定流程。首先通过预处理脚本将原始传感器日志转换为处理后的振动CSV文件。随后依次训练音频基线和振动教师模型,其中振动教师采用时序卷积网络架构。最终通过自信度加权的KL散度与交叉熵联合损失函数,将教师知识蒸馏至卷积神经网络学生模型。部署时仅需麦克风音频输入,振动传感器不再参与。项目提供完整代码复现框架,包含噪声鲁棒性评估与超参数扫掠实验脚本。
背景与挑战
背景概述
ConfV2A数据集由研究团队针对回收压实机中瓶罐分类任务创建,旨在利用振动信号辅助训练语音分类模型。该数据集包含同步采集的麦克风音频与振动传感器信号,涵盖1L瓶、500mL瓶、330mL罐、500mL罐及异常事件五类,共120个检测事件与1206个时间对齐窗口。研究核心在于提出基于置信度引导的振动至音频知识蒸馏方法,训练期间利用振动教师模型监督CNN音频学生模型,推理时仅需麦克风输入。实验表明,该方法在自采数据集上将音频基线准确率从79.01%提升至90.24%,显著优于标准知识蒸馏,为资源受限的工业声学监测提供了高效解决方案。
当前挑战
该领域面临的核心挑战在于回收压实机中瓶罐分类的模态依赖问题:振动传感器虽能提供高判别性信号,但部署成本与维护复杂性制约其实用性。构建过程中需克服多模态时间对齐难题,确保0.8秒窗口内的音频与振动数据精确同步。此外,异常事件(如卡料、机械异响)的识别要求模型具备噪声鲁棒性,而传统知识蒸馏中教师模型的不可靠预测易误导学生学习。ConfV2A通过置信度加权KL散度项,动态抑制低置信度教师样本的蒸馏贡献,在波形噪声干扰下仍保持优于90%的准确率,验证了所述方法的有效性。
常用场景
经典使用场景
ConfV2A数据集专为回收压实机中瓶罐分类任务而设计,其核心应用场景在于利用同步采集的麦克风音频与振动传感器数据,对1升瓶、500毫升瓶、330毫升罐、500毫升罐以及异常插入或机械故障五种类别进行精准识别。数据采集于真实的回收压实机压缩事件,共包含120个检测事件和1206个时间对齐的0.8秒窗口,并采用时间顺序分块方式进行训练/验证/测试集划分。该数据集的独特之处在于提供了一种模态互补的视角,使研究者能够探索从振动模态向音频模态的知识迁移路径。
解决学术问题
该数据集解决了知识蒸馏领域一个关键学术难题:如何在推理阶段仅依赖低成本传感器(麦克风),却能在训练时借助高信息量的多模态信号(振动)提升模型性能。ConfV2A通过提出置信度引导的振动到音频蒸馏框架,有效应对教师模型在不确定预测时产生误导性软标签的问题,将音频学生模型的测试准确率从79.01%提升至90.24%,甚至接近振动教师模型的91.14%水平。这一成果验证了异构模态间知识迁移的可行性,并为资源受限场景下的声学分类研究提供了方法论支撑。
衍生相关工作
该数据集催生了多项具有启发性的后续研究工作。其一,置信度加权KL散度损失函数被证明能有效抑制教师模型低置信度预测带来的噪声影响,为设计更细腻的知识迁移策略提供了范本。其二,通过对比实验揭示了标准知识蒸馏与置信度引导蒸馏在不同信噪比下的性能差异,推动了鲁棒蒸馏方法的系统化评估。其三,该工作验证了时序卷积网络作为振动模态教师模型的优势,为采用不同时间序列模型作为教师架构的研究开辟了道路。此外,该数据集的结构化处理流程(含日志预处理、事件窗口对齐与模型评估管线)为后续多模态压缩感知研究提供了可复现的基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务