遇见数据集

BOVText

收藏
arXiv2021-12-09 更新2024-07-24 收录
数据链接:
官方服务:

资源简介:

BOVText是一个大规模的双语视频文本数据集,由浙江大学创建,包含2021个视频,覆盖30多个开放类别,如生活Vlog、驾驶、电影等。数据集提供了超过1,750,000帧的视频内容,支持丰富的文本类型标注,如标题、字幕或场景文本,并提供中英文双语文本标注,以促进多文化交流。BOVText旨在解决视频文本识别和跟踪的挑战,适用于视频理解、视频检索和视频文本翻译等领域。

BOVText is a large-scale bilingual video-text dataset created by Zhejiang University. It comprises 2021 videos covering more than 30 open categories such as lifestyle Vlogs, driving, movies and other types. The dataset provides over 1,750,000 video frames, supports rich annotations of diverse text types including titles, subtitles and scene text, and offers Chinese-English bilingual text annotations to facilitate cross-cultural communication. BOVText aims to address the challenges in video text recognition and tracking, and is applicable to fields such as video understanding, video retrieval and video-text translation.

提供机构:
浙江大学
创建时间:
2021-12-09
搜集汇总
数据集介绍
BOVText 数据集图片
构建方式
在当前视频文本检测与识别领域,现有基准数据集多局限于单一语言与有限场景,且数据规模较小。为突破这一瓶颈,BOVText数据集应运而生,其构建过程严谨而系统。首先,研究团队从快手与YouTube两大平台广泛采集视频素材,涵盖31个开放领域类别及一个未知类别,确保场景的多样性与开放性。随后,通过两轮人工筛选,剔除不含场景文本或字幕文本的普通视频,最终获得2021个视频、共计1,757,598帧的庞大数据集。在标注环节,专业团队对每个文本实例进行四维描述:旋转边界框定位、跟踪ID标识、文本内容识别以及文本类型分类(标题、字幕或场景文本)。为降低标注成本,采用均匀采样策略并以插值法补充未标注帧的文本信息,最后经由审核团队对约15万帧进行二次校验与修正,整个标注过程耗时30人三个月,共计21,600工时,确保了数据的高质量与一致性。
特点
BOVText数据集以其卓越的规模与丰富的多样性,在视频文本领域树立了新的标杆。相较于现有最大数据集,其视频帧数量扩大了25倍,覆盖了从生活Vlog、驾驶到体育赛事(如NBA、世界杯)、游戏及新闻播报等30余种开放场景,远超此前数据集局限于特定城市或语言的单一场景。尤为突出的是,该数据集首次引入丰富的文本类型标注,将字幕、标题与场景文本区分开来,为视频理解、检索与翻译等下游任务提供了细粒度的语义信息。此外,BOVText支持中英双语文本标注,促进了多元文化的交流与传播。其标注信息不仅包含旋转边界框与跟踪ID,还提供了文本内容的识别结果,使得数据集能够全面支持视频文本检测、识别、跟踪及端到端定位四项任务,为评估先进深度学习模型在开放世界中的表现提供了标准化平台。
使用方法
BOVText数据集为视频文本研究提供了标准化的评估框架,支持四项核心任务:视频文本检测、识别、跟踪及端到端定位。使用该数据集时,研究者可依据任务需求灵活选择评估指标。对于检测与识别任务,遵循ICDAR2015的评估协议;对于跟踪与定位任务,则采用多目标跟踪领域的MOTA、MOTP以及首次引入的IDF1指标,以全面衡量算法在身份保持与轨迹连续性上的表现。数据集已划分为训练集(1,541个视频,1,328,575帧)与测试集(480个视频,429,023帧),便于模型训练与公平比较。研究者可基于此数据集训练从传统图像级检测器(如EAST、PSENet、DB)到基于Transformer的端到端框架(如TransVTSpotter)等多种模型,并通过提供的开源代码与评估脚本进行性能验证。BOVText的开放场景与双语标注特性,使其特别适用于测试算法在复杂现实环境中的泛化能力,推动视频文本理解技术的实际应用。
背景与挑战
背景概述
视频文本定位(Video Text Spotting)是计算机视觉领域一项兼具检测、跟踪与识别文本实例的综合性任务,其在视频理解、视频检索及自动翻译等应用中扮演着关键角色。然而,长期以来,该领域的发展受限于缺乏大规模、多维度且贴近真实场景的基准数据集。为填补这一空白,浙江大学与快手科技的研究团队于2021年在NeurIPS会议上联合发布了BOVText(Bilingual, Open World Video Text)数据集。该数据集收录了超过2000个视频、逾175万帧图像,规模是此前最大数据集的25倍,覆盖了包括体育赛事、游戏实况、生活Vlog等在内的32个开放场景,并首次提供了中英双语文本标注以及标题、字幕、场景文本的细粒度分类。BOVText的推出极大地推动了视频文本定位研究从单一、受限场景向开放、多元世界的跨越,为评估先进深度学习模型在复杂环境下的泛化能力提供了标准化平台。
当前挑战
BOVText所面临的挑战主要体现在三个方面。首先,在领域问题层面,现有视频文本数据集多局限于单一语言和有限场景(如驾驶或街景),难以支撑模型在开放世界中的鲁棒性评估;BOVText通过引入双语文本、密集字幕与多方向长文本,显著提升了任务难度,例如中文识别因字符集庞大而准确率偏低,而长字幕文本对回归类检测器构成严峻考验。其次,在构建过程中,数据采集需从海量视频中筛选出包含文本的片段,并经过两轮人工筛查以剔除无效内容;标注环节则更为艰巨,需对每隔三帧采样的图像进行四边形框、跟踪ID、识别内容及文本类型的四维标注,再通过插值补全未标注帧,最终由审计团队对约15万帧进行二次校验,整个流程耗时30人三个月(约21600工时),体现了大规模精细化标注的极高成本与复杂性。
常用场景
经典使用场景
在视频文本检测与识别领域,BOVText数据集因其大规模、双语标注及开放世界场景的丰富性,被广泛用于训练和评估端到端视频文本定位模型。研究者常利用其包含的2000余段视频、超过175万帧图像,覆盖游戏、体育直播、生活记录等30余种开放类别,来测试算法在复杂背景、多语种文本(中文与英文)及多样文本类型(如标题、字幕、场景文字)下的鲁棒性。该数据集尤为适合评估基于Transformer的定位框架,如TransVTSpotter,其通过注意力机制实现多方向文本的跟踪与识别,成为该场景下的经典基准。
解决学术问题
BOVText解决了视频文本定位领域长期缺乏大规模、多维度标注数据集的学术困境。以往数据集如ICDAR2015或RoadText-1K,受限于单一场景(如驾驶)或少量帧数(不足30万帧),难以支撑深度学习模型在开放世界中的泛化能力评估。该数据集通过提供双语标注、文本类型分类(字幕、标题、场景文字)及30余种开放场景,首次使研究者能够系统探究视频文本的时空关联性、多语言识别挑战及长文本检测难题。其发布推动了视频理解、视频检索等下游任务的理论进展,填补了现有基准在多样性与规模上的空白。
衍生相关工作
BOVText衍生了一系列开创性研究工作。其中,TransVTSpotter作为首个基于Transformer的端到端视频文本定位框架,通过跟踪查询键机制和旋转角度预测,在ICDAR2015视频数据集上实现了44.1%的MOTA和9帧/秒的实时性能,成为后续方法的重要参照。此外,研究者基于该数据集提出了多任务学习范式,如联合文本检测与跟踪的AGD算法,以及针对长字幕文本的EAST改进版本。这些工作不仅提升了视频文本定位的精度,还推动了视频理解、视频描述生成等交叉领域的发展,形成了从数据到算法的完整研究链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务