遇见数据集

Doppio

收藏
arXiv2026-09-02 更新2026-09-04 收录
数据链接:
官方服务:

资源简介:

Doppio是一个专为接触式重量估计设计的视频数据集,由达姆施塔特工业大学创建,首次实现了对下落咖啡颗粒的视觉重量预测。该数据集包含219个视频序列,覆盖3种咖啡豆和25种研磨粒度,每个序列以60fps的4K分辨率记录,并配有精确的逐帧累积重量标注,数据量约32克/序列。数据集通过集成秤的OCR读取、时间滞后补偿与平滑滤波生成,确保标注准确性。其应用旨在为工业场景提供低成本、非接触式的粉末质量测量方案,解决传统机械秤在振动环境下的局限性,推动计算机视觉在动态重量估计中的研究。

Doppio is a video dataset designed for contact-based weight estimation, developed by Technische Universität Darmstadt, which enables the first visual weight prediction of falling coffee particles. This dataset contains 219 video sequences covering 3 types of coffee beans and 25 grind levels. Each sequence is recorded at 4K resolution with 60 frames per second (fps), and is accompanied by accurate per-frame cumulative weight annotations, with an approximate data size of 32 grams per sequence. The dataset is generated via integrated scale OCR reading, temporal lag compensation and smoothing filtering to ensure annotation accuracy. Its applications aim to provide low-cost, non-contact powder quality measurement solutions for industrial scenarios, address the limitations of traditional mechanical scales in vibrating environments, and advance research on dynamic weight estimation using computer vision.

创建时间:
2026-09-02
原始信息汇总

数据集概述

Doppio 是一个用于非接触式下落颗粒重量估计的视频数据集,由德国达姆施塔特工业大学(TU Darmstadt)等机构的研究者提出,并发表于 GCPR 2026。

核心目标

数据集聚焦于工业中常见的粉末(如下落颗粒)质量测量问题。传统秤适用于静态测量,而许多应用场景需要非接触式传感,但现有方案成本高、针对性强且技术复杂。该数据集旨在探索计算机视觉作为非接触式质量估计的可行替代方案,以咖啡研磨为实际案例,记录下落咖啡粉的视频,并为每一帧提供精确的地面真实重量测量值。

数据内容与特点

  • 数据构成:包含下落研磨咖啡粉的视频,以及与视频帧时间对齐的、经过平滑和时间延迟补偿的高精度逐帧重量标注。
  • 处理流程:从显示屏提取 OCR 读数,进行平滑和时间滞后补偿,并与裁剪的视频帧配对,为每帧数据生成重量标注。
  • 示例:提供单个序列的重量变化示例,并标注了序列的开始、中间和结束部分。

基准模型与评估

数据集评估了多种基于深度学习的方法,涵盖从纯粹的空间前馈网络(FFNs)循环时空模型(GRUs、TCNs)。模型性能基于两个指标评估:

  • MAE(平均绝对误差):针对整个序列的特定段落(开始、中间、结束)和完整序列进行计算。
  • MAE(最终误差):在序列结束时测量预测与真实重量之间的最终差异,并以“每杯(doppio)重量(即 16 克)”进行归一化。

结果表格中分别标注了各类模型(FFNs、GRUs、TCNs)的最佳结果以及所有模型中的总体最佳结果。

主要发现

研究表明,基于深度学习的计算机视觉模型能够准确估计下落颗粒的累计重量,为未来基于视觉的非接触式测量解决方案奠定了坚实基础。

引用信息

如需引用该数据集,可通过页面提供的 BibTeX 条目,其引用格式为 @inproceedings{Kiefhaber2026Doppio

补充信息

该数据集的发布得到了德国研究联合会(DFG)、欧洲研究委员会(ERC)、黑森州(LOEWE emergenCITY)、慕尼黑机器学习中心(MCML)等多个机构的资助。网页页面基于学术项目页面模板构建。

搜集汇总
数据集介绍
Doppio 数据集图片
构建方式
在工业与日常场景中,粉体质量的非接触式测量一直是极具挑战的课题。为填补该领域数据集空白,研究者构建了Doppio数据集,以咖啡研磨为可及的案例,捕捉下落咖啡颗粒的视频序列。数据采集采用Fiorenzato AllGround Sense研磨机,涵盖25种研磨粒径与3种咖啡豆类型,每段视频记录约32克咖啡的连续研磨过程。为保证空间一致性,场景中关键组件均贴附ArUco标记;主相机为Canon EOS R5,以60fps、4K分辨率及1/2000秒快门捕获高速运动颗粒,避免运动模糊。后处理中,从每帧提取512×512像素的咖啡下落区域,并通过OCR读取研磨机显示屏上的累积重量,经误检滤除、线性插值及时间滞后补偿,最终获得逐帧的精确重量标注,共计219段序列。
特点
Doppio数据集的核心特点在于其精细的时间对齐与丰富的标注信息。每个视频序列不仅包含高速相机拍摄的高分辨率RGB帧,还关联着经平滑处理且补偿时间延迟的逐帧累积重量真值,误差控制在亚克级别。数据集覆盖多种研磨设置与原料类型,使得颗粒下落模式——包括团聚体大小、遮挡关系及速度差异——呈现出高度多样性,为评估模型的鲁棒性提供了坚实基础。此外,数据被划分为训练、验证与测试集(131/13/75段),并进一步细分为序列起始、中段、结尾及全片段,以适配研磨过程不同阶段的动态特性。这种多尺度的时空结构,使得Doppio既能用于端到端的权重回归,也支持对模型时序建模能力的细粒度剖析。
使用方法
Doppio数据集为计算机视觉驱动的非接触式称重研究提供了标准化评测平台。使用时,研究者可加载预处理后的图像序列与对应的逐帧重量标注,通过累积逐帧预测的权重增量来估计总重量。数据集鼓励评估不同架构——如前馈网络、门控循环单元和时序卷积网络,并搭配ResNet或轻量级MobileNet等骨干特征提取器。输入形式可灵活选择单一RGB帧或叠加帧间差分信息,以考察空间与时间线索的作用。配套的评估协议定义了两种度量:最终累积误差(归一化至每16克约一单位)及逐帧预测与真值间的面积差异,二者结合能够全面衡量估计精度与动态一致性。该数据集亦可作为基准,用于验证新模型在未知咖啡类型上的泛化能力,从而推动低成本的工业非接触式质量流量监测方案的发展。
背景与挑战
背景概述
Doppio数据集由德国达姆施塔特工业大学等机构的研究人员于2026年创建,旨在解决工业应用中粉末质量非接触式测量的难题。该数据集以咖啡研磨为案例,记录了不同研磨度和咖啡豆类型下咖啡粉下落过程的视频,并配以逐帧精确的重量标注。研究团队利用计算机视觉技术,通过深度学习模型实现了对下落颗粒质量的连续估算,为工业场景中的非接触式质量测量提供了新思路。Doppio数据集的发布填补了该领域缺少公开基准的空白,推动了视觉质量估计研究的发展,并为食品加工、制药等行业的实时监测应用奠定了基础。
当前挑战
该领域面临的核心挑战在于如何利用视觉信息准确估计动态下落颗粒的质量。由于颗粒在摩擦电效应及液桥作用下易发生团聚,不同大小的团块具有不同的下落速度和遮挡特性,使得从视频中提取质量信息变得复杂。此外,精确的逐帧地面真值获取艰难,需集成高精度称重系统与高速摄影,并处理OCR误读、时间延迟及平滑噪声等问题。构建过程中还需保证数据多样性,涵盖多种研磨度与豆种,并确保模型在计算资源受限环境下保持高精度,实现实时非接触式测量。
常用场景
经典使用场景
Doppio数据集的核心使用场景在于对下落颗粒物进行非接触式重量估计的视频理解研究。该数据集以研磨咖啡为实例,记录了不同研磨度和咖啡豆类型下的咖啡粉下落过程,每帧配有精确的累积重量标注,为评估从视频序列中推断动态颗粒质量提供了标准基准。研究者利用该数据集开发并验证从简单回归到深度时空网络等多种模型,探索视觉信息转化为重量估计的可行路径,为工业粉体计量等应用提供了高效、低成本的计算机视觉方案。
实际应用
在实际应用中,Doppio数据集所推动的视觉称重技术可直接服务于多种工业过程。例如,在制药固体制剂和食品加工中,连续粉末给料的质量监控尤为重要,而传统称重方式易受机械振动干扰且仅支持批次处理。基于该数据集训练的模型能够实时、非接触地追踪下落颗粒的累积重量,有助于生产线实现动态计量和质量控制。此外,咖啡研磨场景中的颗粒流特征与诸多精细化工和添加剂制造流程相似,因此该技术可迁移至激光金属沉积等增材制造中的粉末供给监控,提升工程效率与系统耐久性。
衍生相关工作
Doppio数据集的发布催生了多项衍生工作。一方面,研究者基于该数据集探索了多种高效架构的性能边界,如轻量级MobileNet与深层ResNet在时序模型中的权衡,并揭示了压缩特征对递归状态构建的局限性,为设计低延迟、高精度的边缘部署模型提供了参考。另一方面,模型的可解释性分析(如Grad-CAM可视化)被用于验证网络关注的区域是否聚焦于下落颗粒,促进了视频理解中可解释性的讨论。该数据集还鼓励了针对颗粒聚团与遮挡的域适应研究,并启发了跨咖啡豆类型推广的泛化研究,其采用的时序增强和噪声抑制策略也为其他动态质量估计数据集提供了范本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务