遇见数据集

面向体育场景的通用视频理解评测体系SportsVideo

收藏
官方服务:

资源简介:

通用视频理解大模型是实现动态感知与时序推理的关键技术,现有通用视频理解评测基准存在感知粗粒度、任务单一、标注稀疏等问题,难以支撑通用视频大模型的系统性评测与迭代优化。本文构建了面向体育场景的通用视频理解评测基准SportsVideo,包含SportsAction、SportsMOT、SportsHHI、SportsShot‑seg、SportsShot‑det、SportsGrounding 6 个任务子集,覆盖时空动作检测、多目标跟踪、人人交互检测、镜头分割、镜头边界检测、视频时空定位6类视频理解核心任务。数据集采用互联网合规采集、人工标注以及多层质量控制的标准化标注流程,具有标注精度高、任务覆盖全面、场景复杂度高等特点,可系统评测视频模型在动态多目标、复杂交互、长时序推理等关键维度的性能。为通用视频理解基础模型研发、算法验证与评测体系构建提供可靠、统一、高质量的数据支撑。

提供机构:
南京大学
二维码
社区交流群
二维码
科研交流群
商业服务