StainDoc
收藏资源简介:
StainDoc是由惠州大学计算机科学与工程学院创建的首个大规模高分辨率文档污渍去除数据集,包含超过5000对污渍和清洁文档图像。该数据集涵盖多种污渍类型、严重程度和文档背景,旨在支持文档污渍去除算法的鲁棒训练和评估。数据集的创建过程包括模拟真实世界污渍、控制条件下拍摄和后期处理标准化。StainDoc主要应用于文档数字化和分析领域,旨在解决文档污渍对可读性和下游应用的影响问题。
StainDoc is the first large-scale high-resolution dataset for document stain removal created by the School of Computer Science and Engineering, Huizhou University. It contains over 5000 pairs of stained and cleaned document images, covering diverse stain types, severity levels and document backgrounds. The dataset aims to support robust training and evaluation of document stain removal algorithms. Its creation process includes simulating real-world stains, controlled-condition image capture and standardized post-processing. StainDoc is mainly applied in the fields of document digitization and analysis, targeting to resolve the adverse impacts of document stains on readability and downstream applications.
StainRestorer 数据集概述
数据集介绍
- 名称: StainDoc
- 描述: StainDoc 是首个大规模高分辨率数据集,专门用于文档污渍去除任务,包含真实世界的数据和对应的地面真值数据。
- 来源: 由 Kaggle 提供。
数据集类型
- 类型: 文档污渍去除
- 子集:
- StainDoc_mark
- StainDoc_seal
数据集生成
- 生成方法: 基于 DocDiff 的处理流程生成。
使用方法
训练
-
下载数据集。
-
在
config.yml文件的 TRAINING 部分指定 TRAIN_DIR、VAL_DIR 和 SAVE_DIR。 -
单 GPU 训练: bash python train.py
-
多 GPU 训练: bash accelerate config accelerate launch train.py
- 如遇
accelerate使用问题,请参考 Accelerate。
- 如遇
推理
- 在
config.yml文件的 TESTING 部分指定 TRAIN_DIR、VAL_DIR 和 SAVE_DIR。 - 运行推理脚本: bash python infer.py
引用
- 暂无引用信息。




