COESOT
收藏arXiv2025-09-30 收录
数据链接:
官方服务:
资源简介:
该数据集名为COESOT,提供了严格同步的原始事件流和RGB帧,包含了超过30个类别的对象,并标注了超过10个复杂属性。此外,该数据集利用变焦镜头技术提供多尺度图像捕捉,并附有完整的源文件。它涵盖了超过30个对象类别,任务专注于视觉目标跟踪。
The dataset named COESOT provides strictly synchronized raw event streams and RGB frames. It includes over 30 object categories, with more than 10 complex attributes annotated. Additionally, this dataset utilizes zoom lens technology to enable multi-scale image capture and is accompanied by complete source files. It covers more than 30 object categories, and the task focuses on visual object tracking.
搜集汇总
数据集介绍

构建方式
COESOT数据集由DVS346彩色与事件相机配合变焦镜头采集,覆盖室内外多样场景(如街道、动物园、家庭),共计1354段视频序列,包含478,721帧彩色图像及对应的事件流。数据集被划分为训练集(827段)与测试集(527段),目标对象涵盖90个类别,包括车辆、行人、动物等,显著超越现有数据集的类别规模。每帧均以逐帧方式密集标注边界框,并标记目标是否缺失,同时为测试集视频标注17种挑战属性(如全遮挡、快速运动、低光照等),以全面评估跟踪器在复杂环境下的表现。
特点
COESOT是当前规模最大、模态对齐最完善的彩色-事件跟踪数据集,拥有1354段视频和90类目标,远超同类数据集FE108与VisEvent。其独特之处在于使用变焦镜头采集,能够真实反映深度尺度变化,而此前数据集多固定焦距。数据集提供原始事件源文件(.aedat4)及多种事件表示格式(如事件计数帧、时间曲面、重建灰度图),便于研究者灵活探索。此外,引入全新评估指标BOC(BreakOut Capability),通过基线跟踪器的成功率衡量视频难度,更突出算法在挑战性场景下的突破能力。
使用方法
COESOT支持彩色-事件多模态与纯事件单模态两种跟踪任务。研究者可使用提供的训练子集(827段)训练模型,并在测试子集(527段)上评估性能。数据集配套完整的工具包,包含28种基线跟踪器的结果(如SiamR-CNN、TransT、OSTrack等),便于直接对比。官方提供事件体素化、时间曲面生成等转换脚本,降低使用门槛。评估时,除传统成功率(SR)、精确率(PR)外,建议采用BOC指标以突出算法在困难视频上的优势。所有资源(数据集、代码、工具包)均已开源,地址为https://github.com/Event-AHU/COESOT。
背景与挑战
背景概述
视觉目标跟踪是计算机视觉领域的核心任务之一,旨在于连续视频帧中精准定位初始化目标。然而,传统基于RGB相机的跟踪器在低光照、过曝光、快速运动及严重遮挡等复杂场景下性能显著退化。事件相机作为一种仿生传感器,凭借其高动态范围、低延迟及对运动模糊的天然鲁棒性,为克服上述困境提供了全新路径。在此背景下,COESOT数据集由中国科学院大学、安徽大学、北京理工大学及鹏城实验室等机构的研究人员于2023年联合创建。该数据集旨在解决颜色-事件多模态跟踪领域数据匮乏与框架碎片化的核心问题,收录了1354段由DVS346相机采集的对齐视频序列,涵盖90类目标对象,并标注了17种挑战属性,为评估跟踪算法在复杂环境下的鲁棒性提供了大规模、高泛化性的基准平台。
当前挑战
COESOT数据集所应对的挑战主要源于两个方面。其一,在领域问题层面,颜色-事件跟踪需融合异质模态信息以解决单一RGB相机在极端光照与高速运动下的失效难题,然而现有方法多采用分离式模块(如特征提取、融合、匹配与交互学习),导致计算冗余与效率低下(仅约20 FPS)。其二,在数据集构建过程中,挑战尤为突出:需确保颜色帧与事件流在时间维度上的精确对齐,并克服事件数据固有的稀疏性与噪声干扰;同时,为覆盖丰富场景,采集工作需在室内外多变环境下借助变焦镜头完成,这增加了尺度变化与目标形变的标注复杂度。此外,为全面评估跟踪器性能,还需设计兼顾视频难度的评价指标,如所提出的BOC分数,以区分算法在平凡与困难序列上的表现差异。
常用场景
经典使用场景
在视觉目标跟踪领域,单一模态传感器在复杂环境下的性能瓶颈催生了多模态融合的研究浪潮。COESOT数据集专为颜色-事件双模态单目标跟踪任务设计,其经典使用场景聚焦于利用事件相机的高动态范围、低延迟与运动敏感性,弥补传统RGB相机在低光照、过曝光、快速运动及严重遮挡等退化条件下的感知缺陷。研究者通过该数据集可系统评估跟踪算法在极端光照变化、高速运动模糊及目标形变等挑战性情境下的鲁棒性,从而推动多模态跟踪技术从实验室理想环境迈向真实复杂场景的实用化进程。
实际应用
在自动驾驶、无人机巡检及智能监控等对实时性与鲁棒性要求严苛的落地场景中,COESOT数据集的实践价值尤为凸显。事件相机极低的延迟与高动态范围特性,使其在车辆夜间行驶、隧道出入口光照剧变或高速运动目标捕捉等工况下,能够稳定输出运动边缘信息,与RGB相机的纹理细节形成互补。基于该数据集训练的跟踪模型,可有效应对真实环境中因光照突变、目标快速位移或局部遮挡导致的跟踪漂移问题,为自主导航系统的环境感知模块提供关键技术支持,同时为工业视觉检测中的高速运动目标定位提供可靠解决方案。
衍生相关工作
COESOT数据集的发布催生了一系列具有代表性的衍生研究工作。基于其提供的多模态对齐数据与标准化评估协议,研究者相继提出了CEUTrack这一单阶段统一跟踪框架,通过自适应视觉Transformer将颜色帧与事件体素融合为统一表征,实现了特征提取、交互学习与目标定位的一体化,在75 FPS的实时速度下刷新了多项基准性能。此外,该数据集还被用于扩展事件模态的跟踪基线,如SiamR-CNN、TransT等经典方法在COESOT上的重新训练与评测,为事件-颜色融合策略的消融分析提供了可靠对比,并启发了后续关于抗干扰机制、稀疏体素采样策略及自监督预训练等方向的研究探索。
以上内容由遇见数据集搜集并总结生成



