遇见数据集

RGBD-VideoCount

收藏
arXiv2026-08-07 更新2026-08-08 收录
官方服务:

资源简介:

RGBD-VideoCount数据集由哈尔滨工业大学(威海)等机构构建,是首个面向拥挤遮挡场景的RGB-D视频目标计数数据集。该数据集提供195个同步RGB-D视频片段,覆盖6个目标类别,并包含深度信息与多类别共存场景,数据规模达195个序列。数据集通过真实仓库货架等密集场景采集,并标注了目标边界框和深度信息。该数据集旨在推动基于深度信息的视频目标计数研究,解决RGB信息在严重遮挡和外观相似条件下的局限性,为自动化库存管理、货架巡检等实际应用提供标准化评估基准。

RGBD-VideoCount Dataset is constructed by Harbin Institute of Technology (Weihai) and other relevant institutions. It is the first RGB-D video object counting dataset targeting crowded and occluded scenes. The dataset provides 195 synchronized RGB-D video clips covering 6 object categories, includes depth information and multi-class co-occurrence scenarios, and has a total of 195 sequences. Collected from dense real-world scenarios such as warehouse shelves, the dataset is annotated with target bounding boxes and depth information. This dataset aims to advance research on depth-based video object counting, address the limitations of RGB information under severe occlusion and visually similar conditions, and provide a standardized evaluation benchmark for practical applications including automated inventory management and shelf inspection.

创建时间:
2026-08-07
原始信息汇总

RGBD-VideoCount 数据集概述

基本信息

  • 许可证: CC-BY-4.0(知识共享署名4.0国际许可协议)
  • 任务类型: 目标检测(object detection)
  • 标签: RGB-D、视频目标计数、拥挤场景、遮挡

数据集简介

RGBD-VideoCount 是一个用于拥挤和遮挡场景下视频目标计数的 RGB-D 视频数据集。该数据集提供同步的 RGB 帧和深度图,以及用于评估检测、跨帧关联和视频级去重的实例级标注。

数据集规模

  • 视频片段数量: 195 个 RGB-D 视频片段
  • 目标类别: 6 个类别
  • 精细标注帧数: 2,032 帧
  • 实例边界框数量: 77,638 个
  • 场景特点: 多类别货架和拥挤目标场景

数据内容

数据集包含以下组成部分:

  • RGB 视频帧
  • 与 RGB 帧对齐的深度图
  • 实例级边界框标注
  • 视频级计数标注
  • 数据划分(训练/验证/测试)
  • 可视化示例(exemplars)

目录结构

RGBD-VideoCount/ |- images/ # RGB视频帧 |- Depth_Data/ # 深度图(与RGB帧对齐) |- object_annotations/ # 实例级边界框标注 |- count_annotations/ # 视频级计数标注 |- dataset_split.json # 训练、验证、测试划分 |- video_class.txt # 类别元数据 |- exemplars_train.json # 训练集可视化示例 |- exemplars_val.json # 验证集可视化示例 `- exemplars_test.json # 测试集可视化示例

引用信息

该数据集对应的论文为:

  • 论文标题: Depth-Guided Video Object Counting in Crowded Scenes
  • 发表于: Proceedings of the 34th ACM International Conference on Multimedia(2026年)
  • DOI: 10.1145/3767308.3835482

局限性说明

  • 数据集主要聚焦于拥挤目标场景,可能无法代表所有真实世界环境
  • 性能可能受到深度质量、严重外观模糊、相机运动以及未见目标类别的影响
  • 用户在实际部署前需自行评估适用性

相关资源

  • 模型权重: https://huggingface.co/aerospace123/DG-Net
  • 数据集页面: https://huggingface.co/datasets/aerospace123/RGBD-VideoCount
  • 代码仓库: https://github.com/streamer-AP/DG-Net
搜集汇总
数据集介绍
RGBD-VideoCount 数据集图片
构建方式
RGBD-VideoCount数据集的构建旨在弥补现有视频计数数据集仅依赖RGB信息的局限,通过引入深度模态以应对拥挤场景中的遮挡和外观相似性问题。该数据集利用Intel RealSense D455相机采集,并通过SDK级对齐确保RGB与深度流严格同步。数据集包含195个视频片段,覆盖饮料、箱包、书籍、植物、箱子和橱柜六类日常物品,其中多个类别可在同一视频中共存,模拟真实货架和库存管理场景。每帧均提供实例级边界框、示例框和视频级兴趣区域(ROI)标注,共计2032个精细标注帧和77638个实例框,为深度辅助的视频检测、跨帧关联及去重研究提供了全面基准。
使用方法
使用RGBD-VideoCount数据集时,研究者可基于文本或视觉提示(如示例框)执行视频对象计数任务。数据集的典型使用流程包括:利用深度引导的检测器(如DG-Det)逐帧生成候选检测结果,结合遮挡感知的预测头获取每个目标的遮挡概率;随后通过深度引导的跟踪与去重模块(如DG-Track)执行跨帧关联,融入深度约束的匹配代价和自适应时间投票机制,最终输出视频级标准计数。该数据集支持输入RGB-D视频序列和区域兴趣(ROI),并提供了预划分的训练/验证/测试集,便于公平比较不同计数方法的性能。
背景与挑战
背景概述
RGBD-VideoCount数据集由哈尔滨工业大学(威海)与香港城市大学的研究团队于2026年发布,旨在推动拥挤场景下的视频目标计数研究。针对现有方法过度依赖RGB信息而难以应对遮挡与外观相似的问题,该数据集创新性地引入深度模态,提供同步的RGB-D视频流,涵盖饮料、书籍、箱子等六个类别的195个视频片段,包含77,638个实例级边界框及视频级感兴趣区域标注。作为首个面向多类别共存场景的RGB-D视频计数基准,该数据集为深度引导的检测、跨帧关联及去重算法提供了标准化的评测平台,显著促进了多模态信息在视频计数任务中的融合与应用。
当前挑战
该数据集主要面临双重挑战:其一,在领域问题层面,拥挤场景中同类目标外观高度相似、排列密集且相互遮挡,仅凭RGB特征难以区分相邻个体,跨帧时视角变化与短期遮挡更导致外观表征不稳定,使得检测与关联策略易产生漏检与重复计数;其二,在数据集构建层面,需确保RGB与深度流的严格时空同步,并在多类别共存场景中完成精细的实例级标注,同时需应对深度传感器在玻璃、反光表面等场景下的噪声与缺失问题,这些因素对数据采集与标注质量提出了极高要求。
常用场景
经典使用场景
RGBD-VideoCount数据集为拥挤场景下的视频物体计数研究提供了全新的评测基准。该数据集包含同步的RGB-D视频流,覆盖饮料、书籍、箱子等六类日常物品,并提供了实例级边界框、示例框及视频级感兴趣区域等多层次标注。其独特之处在于引入了深度信息,使得模型能够利用空间层次关系有效区分紧密相邻或相互遮挡的目标,从而突破传统RGB方法的局限。该数据集适用于评估开放词汇下的视频计数、跨帧关联与去重、遮挡感知检测等核心任务,为深度引导的视频理解研究奠定了坚实基础。
解决学术问题
该数据集解决了现有视频计数研究长期面临的遮挡与外观相似问题。在拥挤场景中,同类物体往往呈现高度相似的包装与纹理,且存在频繁遮挡和视角变化,仅依靠RGB特征难以准确区分相邻目标,导致漏检和重复计数。RGBD-VideoCount通过提供精确的深度信息,使模型能够利用前后景关系和相对距离进行几何约束,有效缓解了遮挡造成的歧义性。这一设计推动了多模态融合、深度引导注意力机制及遮挡感知预测等方向的发展,为提升视频级计数精度提供了新的研究思路与实验平台。
实际应用
在实际应用层面,RGBD-VideoCount数据集紧密贴合零售与仓储场景的自动化管理需求。在货架库存盘点、仓库巡查等任务中,从动态视频流中准确统计目标物品数量是实现自动化补货和缺货预警的关键前提。该数据集模拟了真实货架的多类别密集排列场景,涵盖重遮挡饮料区、高密度书柜及包含开关门动作的柜体等复杂情况,为开发鲁棒的视觉计数系统提供了逼真的测试环境。其标注设计也便于直接迁移至工业部署,有力促进了智能零售与无人仓储技术的发展。
数据集最近研究
最新研究方向
RGBD-VideoCount数据集的发布标志着视频物体计数领域向多模态与深度感知方向的深刻转变。该数据集首次在拥挤场景中引入同步的RGB-D视频流,突破了传统RGB模态在严重遮挡与外观相似条件下的判别瓶颈。其前沿研究焦点集中于深度引导的跨模态特征融合、遮挡感知的检测器设计以及视频级轨迹去重框架的构建,旨在通过几何约束提升实例级定位与长时间计数的鲁棒性。此数据集不仅为开放词汇与提示驱动的计数任务提供了新的基准,还促进了深度传感器在智能零售、仓储盘点等实际场景中的应用探索。其意义在于推动视频计数从依赖外观线索转向结合空间几何推理,为复杂动态环境下的高精度个体计数奠定了数据与算法基础。
相关研究论文
  • 1
    Depth-Guided Video Object Counting in Crowded Scenes哈尔滨工业大学(威海); 香港城市大学; 中国科学技术大学; 哈尔滨工业大学青岛研究院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务