遇见数据集

olmOCR-mix-1025-Photoreal

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

本数据集是allenai/olmOCR-mix-1025数据集的派生作品,专注于对文档页面进行真实感增强。通过Synthetic Engine,将干净的PDF渲染转换为具有自然光照、纸张纹理、阴影和拍摄伪影的真实扫描或照片图像,用于模拟现实世界中的文档捕获条件。图像文件采用JPEG格式,文件名与原始数据集一致,用户需自行从原始数据集下载对应的纯文本注释(无边界框或行级多边形)。当前仅包含100页咖啡渍效果的增强图像,未来将持续添加更多效果。数据集规模小于1000个样本,适用于图像到文本(OCR)和文本生成任务,旨在提升模型在真实场景下的鲁棒性。

This dataset is a derived work of the allenai/olmOCR-mix-1025 dataset, focusing on realistic enhancement of document pages. Through the Synthetic Engine, clean PDF renders are transformed into real scans or photo images with natural lighting, paper texture, shadows, and capture artifacts, simulating real-world document capture conditions. Images are in JPEG format with filenames consistent with the original dataset; users need to download the corresponding plain text annotations (without bounding boxes or line-level polygons) from the original dataset. Currently, it contains only 100 enhanced images with coffee stain effects, with more effects to be added in the future. The dataset size is under 1000 samples, suitable for image-to-text (OCR) and text generation tasks, aiming to improve model robustness in real-world scenarios.

创建时间:
2026-07-28
原始信息汇总

数据集概述:AlroWilde/olmOCR-mix-1025-Photoreal

基本信息

  • 许可证:ODC-BY(开放数据共享署名许可)
  • 任务类别:文本生成(text-generation)、图像到文本(image-to-text)
  • 数据规模:少于1K条样本(n<1K)

数据集简介

该数据集是 allenai/olmOCR-mix-1025 的衍生作品,对其文档页面进行了写实增强处理。原始干净的PDF渲染图被转换为具有自然光照、纸张纹理、阴影和拍摄伪影的真实感扫描/拍摄图像,该增强处理由 Synthetic Engine 工具完成。

文件与注释说明

  • 图像文件名与原始数据集完全一致,仅扩展名改为 .jpeg
  • 不提供额外的parquet注释文件。原始注释为纯文本格式(不含边界框或行级多边形),需从原始数据集中按文件名匹配下载。

当前增强效果

  • 咖啡渍效果(Coffee stains):100页(添加日期:2026-07-28)
  • 新效果将持续不断添加,后续会有更多增强类型上线。

设计目的

该数据集旨在为真实世界条件下训练更鲁棒的OCR(光学字符识别)和文档理解模型而设计。

使用与反馈

  • 数据集作者欢迎用户反馈该数据集对模型训练带来的正面或负面改进效果,可通过 hi@support.alrowilde.com 邮箱联系。
  • 如需新的增强效果或有反馈,可在数据集页面留言或发送邮件。

衍生声明

该数据集是 allenai/olmOCR-mix-1025(ODC-BY许可证)的衍生作品,使用时需按要求标注原始数据集。

搜集汇总
数据集介绍
olmOCR-mix-1025-Photoreal 数据集图片
构建方式
本数据集源自于对 allenai/olmOCR-mix-1025 数据集的二次加工,旨在模拟真实世界中文档图像的物理形态。其构建过程依托 Synthetic Engine 技术,将原始干净的 PDF 渲染图像转化为具有自然光照、纸张纹理、阴影及拍摄伪影的拟真扫描或拍摄效果。处理后的图像沿用原始文件名,仅扩展名变更为 .jpeg,未提供额外的 parquet 注释文件,原始标注信息(纯文本,无边界框或行级多边形)需从源数据集下载并按文件名匹配使用。
特点
该数据集以增强 OCR 与文档理解模型在真实环境下的鲁棒性为核心目标,其鲜明特征在于引入多样化的成像干扰因素。当前版本已包含咖啡渍效果(100 页),未来将持续扩充新的增强类型,以适应更广泛的应用场景。通过模拟拍摄角度、光照变化与纸张老化等物理条件,本数据集为评估模型在非理想成像条件下的性能提供了极具价值的基准,其衍生属性亦需遵守原始数据集的 ODC-BY 许可协议。
使用方法
使用本数据集时,建议与原始 allenai/olmOCR-mix-1025 数据集的标注文件协同工作。由于增强后的图像文件名与原图一一对应,用户可依据文件名匹配原始纯文本注释,从而在保持标注一致性的前提下完成模型训练或评估。该数据集设计初衷是服务于更加鲁棒的 OCR 及文档理解系统开发,适用于领域适应、数据增强或压力测试等研究场景。使用时请在相关成果中注明对原始数据集的贡献,以符合开放许可要求。
背景与挑战
背景概述
该数据集由Alro Wilde于2026年创建,基于Allen AI发布的olmOCR-mix-1025数据集进行派生增强。其核心研究问题在于提升OCR与文档理解模型在真实世界条件下的鲁棒性。通过Synthetic Engine将干净的PDF渲染转化为具有自然光照、纸张纹理、阴影和拍摄伪影的逼真扫描或拍摄图像,该数据集直面了文档图像在现实应用中的复杂视觉干扰。作为olmOCR-mix-1025的光照增强版本,它继承了原始数据集的丰富语料,同时注入了模拟真实环境的高保真度图像,为训练更健壮的文档智能模型提供了关键资源,对文档分析领域具有重要推动作用。
当前挑战
该数据集主要应对两大挑战:一是领域问题,即真实场景中文档图像常受光照不均、阴影遮挡、纸张老化及拍摄角度等因素影响,导致传统OCR误识率升高,此数据集通过合成逼真的照片级增强图像,填补了训练数据与实际应用之间的域差距;二是构建过程中的挑战,包括在保持原始注释匹配的前提下,对大量页面进行自动化高质量图像变换,确保增强效果的真实性与多样性,并持续扩展效果库(如咖啡渍)以覆盖更多现实噪声,同时需维护数据衍生的合规性与可追溯性,确保原始数据集的许可证要求得以满足。
常用场景
经典使用场景
该数据集作为olmOCR-mix-1025的摄影写实增强版本,其经典应用场景聚焦于文档智能处理领域,旨在模拟真实世界中文档被扫描或拍摄后的视觉形态。通过引入自然光照变化、纸张纹理、阴影及物理性污渍(如咖啡渍)等干扰因素,该数据集为训练鲁棒性OCR系统以及文档理解模型提供了高保真的训练样本,有效弥合了干净渲染图像与真实采集图像之间的领域鸿沟。
解决学术问题
在学术研究层面,该数据集精准回应了文档分析中一个长期存在的挑战——模型在实验室理想条件下的优异表现与真实场景中性能显著衰退之间的矛盾。通过系统性地为干净PDF渲染图注入现实采集伪影,它为解决OCR及文档理解中的域适应、数据增强策略和模型泛化能力等核心问题提供了实验基础,从而推动了该领域从受控测试向真实环境适配的研究范式转变。
衍生相关工作
基于该数据集,一系列衍生工作得以展开,尤其在数据增强策略和合成数据研究领域。它启发了研究者探索不同“污染”效应(如污渍、阴影)对模型性能的影响,进而发展出更具针对性的对抗训练方法和新的数据合成管线。此外,该数据集为社区提供了一个评估基准,鼓励开发更先进的图像增强与去噪算法,这些工作共同推动了文档智能处理技术的持续进阶。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务