遇见数据集

short_video_ocr_dataset

收藏
Hugging Face2026-07-15 更新2026-07-16 收录
官方服务:

资源简介:

Short Video OCR Dataset是一个正在开发中的数据集,旨在构建短社交视频帧OCR和文本标注流程。它主要包含乌克兰语、俄语和英语的短社交视频内容,集成了视频、文本和图像多模态数据。数据集存储源视频文件、轻量级元数据、提取的帧序列、手动漏斗分类标注以及基于Qwen2-VL-2B-Instruct模型的OCR预测结果。当前数据规模包括1000个源视频的元数据清单,其中300个视频已以约1.5 FPS的速率提取了帧序列,共生成10,353帧图像,并已上传7,096帧的OCR预测结果。数据集采用结构化文件组织,包括视频清单(manifest.jsonl)、提取的帧清单(frames_manifest.jsonl)、漏斗标注(annotations/)和OCR预测(ocr_predictions/)。它适用于多语言OCR模型训练与评估、视频字幕提取、社交视频内容分析等任务。需要注意的是,数据集仍在积极构建中,OCR预测为模型输出而非真实标注,部分源视频可能包含社交媒体元数据、水印和用户生成内容。

Short Video OCR Dataset is an in-development dataset for building OCR and text annotation pipelines for short social video frames. It primarily includes short social video content in Ukrainian, Russian, and English, integrating video, text, and image multimodal data. The dataset stores source video files, lightweight metadata, extracted frame sequences, manual funnel classification annotations, and OCR prediction results based on the Qwen2-VL-2B-Instruct model. The current scale includes metadata for 1000 source videos, with 300 videos having extracted frame sequences at approximately 1.5 FPS, generating a total of 10,353 frame images. OCR predictions for 7,096 frames have been uploaded. The dataset uses a structured file organization: video manifest (manifest.jsonl) contains information such as video ID, title, uploader, duration, URL path, etc.; extracted frame manifest (frames_manifest.jsonl) records video ID, frame ID, path, timestamp, etc.; funnel annotations (annotations/) provide video-level classifications including categories like matching subtitles, partial match, no match, ignore, and technical issues; OCR predictions (ocr_predictions/) include model inference text results and raw outputs. It is suitable for tasks such as multilingual OCR model training and evaluation, video subtitle extraction, and social video content analysis. Note that the dataset is still under active development, OCR predictions are model outputs rather than ground truth annotations, and some source videos may contain social media metadata, watermarks, and user-generated content.

创建时间:
2026-07-09
原始信息汇总

短视频OCR数据集(Short Video OCR Dataset)

数据集简介

该数据集是一个持续构建中的集合,旨在为短视频帧构建OCR(光学字符识别)和文本标注流水线。数据集包含源视频、元数据、提取的帧、手动漏斗标注以及OCR模型预测结果。

当前状态

  • 源视频清单:1000个短视频
  • 已提取帧的视频:300个视频,以约1.5 FPS(每秒帧数)提取
  • 帧清单:10,353条帧记录
  • Qwen2-VL帧OCR预测:已上传7,096条帧预测结果
  • 标注存储:手动点击先写入Firestore,随后同步为数据集工件
  • 快速媒体镜像:部分选定的视频/帧资源已镜像到Google Cloud Storage,供标注应用使用

语言与许可

  • 语言:乌克兰语、俄语、英语
  • 许可协议:其他(other)

主要文件结构

视频清单

  • 文件manifest.jsonl
  • 关键字段video_idtitleuploaderduration_secondswebpage_urlvideo_pathvideo_gcs_url

视频文件

  • 路径videos/{video_id}/{video_id}.mp4(源视频)、videos/{video_id}/{video_id}.info.json(下载器/源元数据)

漏斗标注

  • 文件annotations/funnel_state.jsonannotations/funnel_export.jsonl
  • 分类类别
    • matched:仅字幕与口语文本匹配
    • title_matched:静态文本加匹配的字幕
    • partially_matched:字幕/文本大部分匹配
    • unmatched:可见文本与口语文本不匹配
    • ignore:无有用字幕/文本
    • annotation_problem:技术或标注问题
  • 根级兼容导出funnel_state.jsonfunnel_export.jsonl

类别桶

  • 路径buckets/{category}/videos.jsonbuckets/{category}/videos.jsonl
  • 说明:按漏斗类别分组的便捷导出

提取的帧

  • 文件frames_manifest.jsonl
  • 帧文件路径frames/{video_id}/frame_000001.pngframes/{video_id}/frame_000002.png
  • 帧元数据frames/{video_id}/frames.json
  • 关键字段video_idframe_idframe_pathframe_gcs_urltimestamp_secondsfps

OCR预测

  • 模型来源Qwen/Qwen2-VL-2B-Instruct
  • 预测文件
    • ocr_predictions/qwen2_vl_2b_frame_ocr/qwen2_vl_2b_frame_ocr.jsonl
    • ocr_predictions/qwen2_vl_2b_frame_ocr/qwen2_vl_2b_frame_ocr_summary.json
  • 预测记录字段dataset_idmodelmodel_idvideo_idframe_idtimestamp_secondsframe_pathframe_gcs_urlprediction_textraw_textinference_seconds

GCS镜像

  • 镜像地址gs://short-video-dataset-ocr-videos
  • 已镜像的OCR输出
    • gs://short-video-dataset-ocr-videos/ocr_predictions/qwen2_vl_2b_frame_ocr/qwen2_vl_2b_frame_ocr.jsonl
    • gs://short-video-dataset-ocr-videos/ocr_predictions/qwen2_vl_2b_frame_ocr/qwen2_vl_2b_frame_ocr_summary.json

注意事项

  • 数据集正在积极构建中,文件数量和标注覆盖率会不断变化
  • OCR预测结果为模型输出,并非真实标注
  • 真实文本标注计划在漏斗分类、帧提取和OCR预填充之后的后期阶段进行
  • 部分源视频可能包含社交媒体元数据、水印、字幕或其他用户生成内容
搜集汇总
数据集介绍
short_video_ocr_dataset 数据集图片
构建方式
该数据集专为短社交视频帧的OCR与文本标注流水线而构建,目前仍在持续迭代中。数据来源涵盖1000条短视频的源清单,其中300条视频已完成约1.5帧每秒的帧提取,共计生成10353帧。每帧均通过Qwen2-VL-2B-Instruct模型进行OCR预测,已累计上传7096条帧级预测结果。手动标注采用分级漏斗式分类,将视频划分为匹配、标题匹配、部分匹配、不匹配、忽略及标注问题六大类别,并通过Firestore暂存后同步为数据集工件。此外,部分视频与帧资源镜像至Google Cloud Storage,以支撑标注应用的高速访问。
使用方法
使用该数据集时,用户可通过manifest.jsonl获取视频元数据,并依据video_id在videos/目录下定位对应MP4文件与下载信息。帧数据通过frames_manifest.jsonl索引,每条记录包含视频标识、帧路径、GCS链接及时间戳,便于直接加载图像进行视觉分析。OCR预测结果位于ocr_predictions/qwen2_vl_2b_frame_ocr/目录,每行记录包含模型信息与推理文本,可用于评估模型性能或作为预标注输入。漏斗分类结果存储于annotations/及buckets/目录,用户可按类别筛选视频子集,从而开展针对性实验或训练下游模型。
背景与挑战
背景概述
短视频平台的迅猛发展催生了海量多模态内容,其中字幕、贴纸、水印等视觉文本承载着关键语义信息,光学字符识别(OCR)技术成为解析这类非结构化数据的重要工具。Short Video OCR Dataset由研究团队于近期创建,旨在构建面向短视频帧的OCR与文本标注流水线。该数据集涵盖乌克兰语、俄语及英语的多语种短视频资源,初始版本包含1000条视频素材,并已完成约300条视频的帧提取,形成超过1万帧的影像库。利用Qwen2-VL-2B-Instruct模型对其中7096帧进行了预测输出,为后续研究提供了基准。数据集通过手动漏斗分类(如匹配、部分匹配等)对视频进行分层标注,并借助Firestore与Google Cloud Storage实现高效的存储与分发。该资源的提出,填补了短视频领域细粒度OCR数据集稀缺的空白,为多语种、非受控环境下的文本识别研究奠定了坚实基础。
当前挑战
短视频OCR面临的核心挑战在于场景的高度非受控性:帧内文本可能以多种字体、颜色、角度出现,并叠加于动态背景之上,同时受到水印、贴纸、特效等视觉元素的干扰,大幅提升了文本检测与识别的难度。此外,多语种混排(尤其乌克兰语与俄语)以及口语化、简化拼写带来的语言变异,对模型的语言建模能力提出了特殊要求。在构建过程中,团队需应对数据来源的异构性——短视频平台的内容格式、元数据字段及版权状态各异,增加了数据清洗与归一化的复杂性。人工标注采用Streamlit工具进行渐进式漏斗分类,但主观判断标准与噪声控制仍需持续优化。当前OCR预测仅作为初步结果,尚未形成精准的标注真相,如何高效融合人工标注与模型输出以构建高质量基准,仍是亟待突破的技术瓶颈。
常用场景
经典使用场景
在短视频内容分析与文本提取领域,Short Video OCR Dataset 为研究人员提供了弥合视觉文本与语音内容之间鸿沟的珍贵数据资源。该数据集囊括了千余条短视频素材,覆盖乌克兰语、俄语及英语等多语种字幕与文本内容,并通过精细的帧级抽取与多阶段标注策略,构建了从原始视频到结构化文本描述的完整数据链路。经典的用法是基于视频帧中的可见文本(如字幕、水印、贴纸等)进行光学字符识别(OCR)模型的训练、微调与评估,尤其适用于多语言、弱监督、非规范场景下的文字检测与识别挑战,为理解短视频生态中信息的多模态呈现形式提供了坚实的数据底座。
解决学术问题
学术界长期面临短视频场景下文本自动理解的多重困扰:字幕与口语不匹配时的语义歧义、非正式文本(如贴纸、水印)的识别困难,以及多模态内容对齐中的表征鸿沟。此数据集通过引入漏斗式手工标注(包括匹配、部分匹配、不匹配等细分类别),率先系统性地量化与标注了这些信息不一致性,从而为研究视觉文本与语音文本之间的语义对齐、信任度评估与内容审核提供了可复现的基准。它推动了自然语言处理与计算机视觉交叉地带中对多模态交互机理的深度探究,为提升跨模态理解模型的鲁棒性与解释性贡献了重要力量。
实际应用
在产业实践中,该数据集直接赋能短视频平台的智能审核与内容分发系统。借助其中标注的帧级文本及其与语音的匹配关系,企业能够训练出更为精准的敏感信息检测模型,自动识别字幕与画面文字间的矛盾或虚假诱导内容(如标题党、误导性字幕)。同时,它也可服务于视频摘要自动生成、多语言翻译辅助、以及视障人士的听觉化内容替代等无障碍应用场景,通过融合视觉与语音文本信息,提升短视频内容理解的全方位覆盖与用户体验的包容性。
数据集最近研究
最新研究方向
在短视频内容爆炸式增长的当下,该数据集聚焦于社交短视频帧中的光学字符识别与文本标注管线构建,顺应了多模态学习与细粒度视频理解的前沿浪潮。其特色在于融合了乌克兰语、俄语与英语的多语言场景,并引入Qwen2-VL大模型进行帧级OCR预测,结合人工漏斗分类(如字幕匹配度分级)与Firestore实时同步注释机制,为研究短视频中动态文本与口语交互提供了规模化、结构化的训练与评测基准。这一方向直接关联到跨语言视频内容审核、辅助无障碍字幕生成以及社交媒体语义分析等热点应用,其开放的数据管道设计也推动了社区协作与模型迭代,对提升短视频平台上的信息可及性与内容理解深度具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务