遇见数据集

geeklink-ocr-benchmark

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

GeekLink OCR Benchmark 是一个专为评估视频字幕 OCR 模型性能而设计的基准数据集,由 GeekLink 发布。该数据集包含 1140 张从真实电影片段中提取的字幕图像,覆盖英语、西班牙语、日语、韩语、中文和希腊语 6 种语言。每张图像均带有精确的 ground truth 文本,确保评估的准确性,且图像本身不涉及隐私或版权风险。数据集特别针对视频字幕 OCR 的典型挑战构建,如低对比度背景、胶片颗粒、小文本以及约 19% 的样本中存在的重叠水印干扰线,以测试模型能否正确隔离字幕区域而非输出所有检测到的文本区域。数据来源为三部公共领域或开放许可的电影(《将军号》、《诺斯费拉图》和旧金山旅行片),字幕文本改写自公共领域文学作品(如福尔摩斯、德古拉等),并翻译成其他语言。数据集包含 manifest.csv/manifest.jsonl 文件,每行包含 id、video_id、lang、image、ground_truth 和 has_watermark 字段,以及 images 文件夹中的渲染帧(全帧,未裁剪)。评估指标为字符错误率(CER)和词错误率(WER),并提供基线结果(包括 PaddleOCR、EasyOCR、Tesseract 和 GeekLink 引擎的原始输出)。该数据集适用于研究视频字幕 OCR 的检测与识别能力,特别是水印干扰下的鲁棒性评估。

GeekLink OCR Benchmark is a benchmark dataset designed for evaluating the performance of video subtitle OCR models, released by GeekLink. It contains 1,140 subtitle images extracted from real movie clips, covering six languages: English, Spanish, Japanese, Korean, Chinese, and Greek. Each image is annotated with precise ground truth text to ensure evaluation accuracy, and the images themselves pose no privacy or copyright risks. The dataset is specifically constructed to address typical challenges in video subtitle OCR, such as low-contrast backgrounds, film grain, small text, and overlapping watermark interference lines present in about 19% of the samples, to test whether the model can correctly isolate subtitle regions rather than outputting all detected text regions. The data sources are three public domain or openly licensed films (The General, Nosferatu, and a San Francisco travelogue), with subtitle texts rewritten from public domain literary works (e.g., Sherlock Holmes, Dracula) and translated into other languages. The dataset includes a manifest.csv/manifest.jsonl file, where each row contains fields such as id, video_id, lang, image, ground_truth, and has_watermark, along with an images folder containing rendered frames (full frames, uncropped). Evaluation metrics are Character Error Rate (CER) and Word Error Rate (WER), with baseline results provided (including raw outputs from PaddleOCR, EasyOCR, Tesseract, and GeekLink engines). This dataset is suitable for research on detection and recognition capabilities of video subtitle OCR, especially robustness evaluation under watermark interference.

创建时间:
2026-08-18
原始信息汇总

GeekLink OCR Benchmark 数据集概述

数据集简介

GeekLink OCR Benchmark 是一个用于**视频内嵌字幕 OCR(光学字符识别)**的公开基准测试数据集,由 GeekLink 团队发布。该数据集包含 1,140 张字幕图像,覆盖 6 种语言,图像基于真实电影画面渲染,具有精确的已知真实标注(ground truth)。

核心特点

  • 目标场景:专门针对视频字幕 OCR 的难点设计,包括低对比度背景、胶片颗粒、繁忙场景中的小文字,以及约 19% 样本中包含的第二条重叠字幕/水印线干扰。
  • 数据来源:图像取自三部公共领域或开放许可的电影(《The General》1926、《Nosferatu》1922、以及 1955 年旧金山 Cinemascope 旅行片),字幕文本改编自公共领域文学作品的短对话行,不涉及真实用户数据,无隐私和版权风险。
  • 数据修正:2026-08-21 曾修正过数据,修复了 437 个样本(38%)中文本超出视频帧导致的渲染截断问题,并将样本从 600 扩展至 1,140。

数据构成

语言 样本数
英语 (en) 191
西班牙语 (es) 191
日语 (ja) 191
韩语 (ko) 191
中文 (zh) 188
希腊语 (el) 188
总计 1140

约 19%(213/1140)的样本包含合成的动态水印/制作名单行,用于测试检测隔离能力。

文件结构与评估方法

  • data/manifest.csv / data/manifest.jsonl:样本清单(含 id、video_id、lang、image、ground_truth、has_watermark)
  • data/images/:渲染的完整帧图像
  • baselines/:GeekLink 自家 OCR 引擎原始输出(ONNX/CPU 和 CoreML 两个版本)
  • external_baselines/:PaddleOCR(3 种 PP-OCRv6 尺寸)、EasyOCR、Tesseract 的原始输出
  • 评估指标:CER(字符错误率)和 WER(词错误率),按语言和是否含水印分别统计
  • 评估脚本:python3 eval/eval.py --pred <prediction_file>

基线性能

  • 整体最佳:PP-OCRv6 medium 的 CER 为 0.5966,但与 small(0.5989)无显著差异,而 small 速度快 3.7 倍(381ms vs 1399ms)。
  • 最快速度:GeekLink 的 CoreML 路径在 Apple Silicon 上达 97.3ms/图,且 CER 为 0.6093。
  • 关键发现:所有引擎在水印样本上的准确率损失约 2.6-2.9 倍(CER 从约 0.45 增至 1.27-1.30),水印干扰是所有通用 OCR 引擎的共同盲点。
  • CJK 说明:日/韩/中文的 WER 可能超过 1.0,因无空格分词边界,CER 是跨语言更可靠的指标。

许可信息

  • 代码(eval/):MIT 许可证
  • 数据(data/):见 LICENSE-DATA 文件,字幕文本为原创,三部电影中两部为公共领域,一部为 CC BY-SA 3.0(需注明出处)
搜集汇总
数据集介绍
geeklink-ocr-benchmark 数据集图片
构建方式
GeekLink OCR Benchmark 数据集专为评估视频内嵌字幕的 OCR 性能而构建。其图像源自三部公有领域或开放许可影片的真实帧,利用与 GeekLink 应用硬字幕导出相同的 ffmpeg 与 libass 管线,将字幕文本烧录至画面中。字幕内容由公有领域文学作品的对话改写而成,并翻译为英、西、日、韩、中、希六种语言,确保自然口语化。构建过程规避了真实用户数据带来的隐私与版权风险,采用合成但现实的方案,并包含约19%带水印干扰的样本,以模拟实际视频中的复杂场景。
特点
该数据集包含1140张字幕图像,覆盖六种语言,所有图像均提供精确的标注文本,消除了标注歧义。其独特性在于针对视频字幕 OCR 的特定难点设计,如低对比度背景、胶片颗粒、微小文字及水印干扰。约19%的样本包含刻意放置的第二文本行,用以测试引擎在干扰下提取真实字幕的能力。此外,数据集提供了全面的基线结果,包括GeekLink自身引擎及PaddleOCR、EasyOCR、Tesseract等主流OCR工具的性能对比,并附有详细的评价脚本,便于复现与扩展。
使用方法
使用者可通过运行提供的eval.py脚本,输入预测结果文件(需包含id与prediction列)即可计算字符错误率(CER)与词错误率(WER),结果可按语言及是否含水印进行分层分析。预测文件格式支持CSV或JSONL,易于集成到现有评估流程。数据集同时提供各基线引擎的原始输出,供开发者直接对比或作为参考。对于中文与日文,建议以CER作为主要评估指标,因WER需分词预处理。所有数据与代码均遵循开放许可,支持学术与商业用途的二次开发。
背景与挑战
背景概述
GeekLink OCR基准数据集由GeekLink团队于2026年发布,旨在评估视频硬字幕OCR(光学字符识别)性能。该数据集包含1,140张来自六种语言(英语、西班牙语、日语、韩语、中文和希腊语)的字幕图像,真实电影画面叠加合成字幕,提供精确的标注。其核心研究问题聚焦于视频字幕特有的识别难题,如低对比度、胶片颗粒、复杂背景干扰及重叠水印。该基准填补了从文档OCR到视频OCR的空白,成为首个专门针对视频硬字幕的标准评测集,对多语言OCR引擎的跨平台性能评估具有重要参考价值,尤其为Apple Silicon上的模型优化提供了基准。
当前挑战
该数据集面临的挑战集中于两方面。其一,领域内通用OCR引擎在视频字幕识别上表现不佳,尤其是在重叠水印干扰下,所有引擎的CER均显著上升,揭示通用模型在此场景的盲点。其二,构建过程中,早期版本存在38%样本字幕被裁剪的缺陷,经重新渲染后修正。此外,使用真实用户数据引发隐私和版权风险,促使团队转向合成数据方案,确保可复现性。构建还需处理多语言字体、自动换行和均匀样本分布等问题,保证基准的公平性和广泛适用性。
常用场景
经典使用场景
作为视频内嵌字幕光学字符识别(OCR)领域的专项基准测试集,该数据集聚焦于评估OCR引擎在真实影视画面中提取烧录字幕的性能。其设计精巧,涵盖了英语、西班牙语、日语、韩语、中文及希腊语六种语言,共包含1,140张从公版影片中截取的动态帧,并精确标注了每帧的字幕文本真值。尤为匠心独运之处在于,约19%的样本中人为叠加了干扰性水印或署名行,以此严峻考验识别引擎在复杂背景、低对比度、胶片颗粒噪声以及字幕重叠等严苛条件下的鲁棒性。该基准为开发者提供了标准化的评估脚本(CER/WER指标),使其能够在统一框架下公平对比不同OCR模型的性能,从而精准定位现有技术瓶颈,推动视频字幕识别技术的精细化发展。
衍生相关工作
此基准问世后,已催生一系列具有开拓意义的衍生工作。首要的是,其提供了GeekLink、PaddleOCR、EasyOCR及Tesseract等多个主流引擎在同一严格规则下的原始性能基线,这些数据成为后续研究优化的对照基石。围绕其揭示的‘水印干扰导致所有引擎性能急剧下降’这一共性缺陷,激发了针对鲁棒检测网络与干扰隔离算法的专项研究,旨在设计能主动区分字幕文本与背景叠加信息的模型架构。此外,该数据集对CJK(中日韩)语言特有识别难点的分析,促使研究者探索融合字形特征或语言模型的端到端识别方案,以改善传统词错误率(WER)指标在这些无空格语言中的失准问题。更有后续工作尝试将人工手动画框的先验知识与自动检测结合,比较不同交互模式下字幕提取的性能差异,为实用系统的交互设计提供了宝贵的数据支撑与方向指引。
数据集最近研究
最新研究方向
针对视频硬字幕OCR这一特定场景,最新研究正聚焦于构建兼具真实性与可复现性的基准,以精准度量不同引擎在复杂背景、胶片颗粒及微小文字下的识别极限。该数据集的发布恰逢生成式AI与版权争议交织之际,其创新性地采用公有领域影片与自撰台词合成图像,彻底规避了隐私与版权风险,同时保留了实际视频渲染的严苛条件。基准揭示的突出挑战在于,水印或叠加字幕的存在使所有通用OCR引擎的字符错误率激增近三倍,暴露出当前模型在文本区域隔离上的普遍盲区,这已成为阻碍视频理解、实时翻译与智能字幕工具落地的关键瓶颈。此外,针对CJK语言字符分割与多语言模型在资源稀缺语种上性能衰退的探究,也随此基准的发布获得了新的评估标尺,推动领域向更鲁棒、更高效的专用解决方案演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务