遇见数据集

cleaned_manga_dataset

收藏
Hugging Face2026-07-07 更新2026-07-08 收录
官方服务:

资源简介:

Cleaned Manga Dataset是一个专门用于训练文本去除/修复模型(例如ZITS++)以及气泡/文本检测模型的漫画页面数据集。它是Cleaned Webtoon Dataset的页面导向版本,以单页漫画图像为基本单元,而非拼接的长条网络漫画。数据集包含约43,217张漫画页面,源自约533部作品的2,335个章节,主要来源于GANMA!和Comic Walker两个公开漫画平台,其中Comic Walker的页面已对下载的XOR加扰WEBP图像进行解扰处理。每页漫画提供四个像素对齐的PNG文件:包含文本的原始页面图像、自动清理版本(背景均匀区域的文本被擦除,气泡内或复杂艺术背景上的文本保留)、指示被擦除像素位置的掩码图像,以及标识无趣区域(如空白边距、平坦装订线)的二进制掩码。此外,每个章节包含一个info.json文件,记录章节元数据、页面尺寸和详细检测框信息,包括约488,000个语音气泡框、约537,000个文本框以及自动清理阶段选择保留的文本框。页面分辨率通常宽度在1,000至2,100像素之间,高度最高可达约7,300像素(用于双页跨页)。该数据集适用于图像修复任务(提供退化输入、修复目标和修复掩码三元组)和目标检测与分割任务(使用边界框和掩码训练气泡和文本检测器),并遵循CC BY-NC 4.0许可证,旨在支持非商业性的学术研究。

The Cleaned Manga Dataset is a comic page dataset specifically developed for training text removal/repair models (e.g., ZITS++) and speech bubble/text detection models. It is a page-oriented variant of the Cleaned Webtoon Dataset, which takes individual comic page images as the basic unit rather than stitched long-form webtoons. The dataset contains approximately 43,217 comic pages sourced from 2,335 chapters across roughly 533 original works, primarily collected from two public manga platforms: GANMA! and Comic Walker. For pages obtained from Comic Walker, the downloaded XOR-scrambled WEBP images have been fully descrambled. Each comic page is paired with four pixel-aligned PNG files: the original page image with all text intact, the auto-cleaned version where text on uniform background regions is erased while text within speech bubbles or on complex artistic backgrounds is preserved, a mask image indicating the locations of erased pixels, and a binary mask identifying uninteresting regions such as blank margins and flat gutters. Additionally, each chapter includes an info.json file that records chapter metadata, page dimensions, and detailed bounding box annotations, including approximately 488,000 speech bubble boxes, 537,000 text boxes, and the text boxes selected for retention during the auto-cleaning process. The resolution of the pages typically ranges from 1,000 to 2,100 pixels in width, with a maximum height of approximately 7,300 pixels for double-page spreads. This dataset supports both image restoration tasks, which provide triplets of degraded input, restoration target, and restoration mask, as well as object detection and segmentation tasks for training speech bubble and text detectors using bounding boxes and masks. It is released under the CC BY-NC 4.0 license to facilitate non-commercial academic research.

创建时间:
2026-07-06
原始信息汇总

数据集概述

Cleaned Manga Dataset 是一个专为文本移除/修复(inpainting)和气泡/文本检测模型训练准备的漫画章节数据集。该数据集以页面为单位,每张漫画页面对应一组包括原始图像、自动清理后的图像、擦除掩码、无兴趣区域掩码以及文本和气泡边界框在内的标注文件。


基本信息

属性
许可证 CC BY-NC 4.0(仅适用于标注和元数据,原始作品版权归原作者所有)
任务类型 图像到图像、图像分割
标签 漫画、漫画、网漫、修复、文本移除、文本检测、气泡
数据规模 10K < 样本数 < 100K
名称 Cleaned Manga Dataset (text removal & inpainting)

数据来源

  • GANMA!ganma.jp):免费故事,标准页面图像。
  • Comic Walkercomic-walker.com / カドコミ):免费章节;页面为 XOR 加密的 WEBP 格式,下载时已解密。

数据集规模

指标 数值
章节数 ~2,335
源作品数 ~533
页面总数 ~43,217
文本边界框数 ~537,000
气泡边界框数 ~488,000
页面尺寸 全分辨率,通常宽约 1,000–2,100 像素,高可达约 7,300 像素(跨页)

数据集结构

dataset/ <key>/ # 每个章节一个子目录 info.json # 章节元数据 + 每页几何信息和所有边界框 page_0.png # 原始页面(含文字) page_0_cleaned.png # 自动清理后页面(文字在平坦背景上被擦除) page_0_clean_mask.png # 被擦除像素的掩码 page_0_uninteresting.png # 无兴趣区域的二值掩码 page_1.png page_1_cleaned.png ...

章节密钥 <key> 编码规则:

  • GANMA:<别名>_<故事ID>(例如 akagaminohanayome_2ca52150-68ee-11f0-8e03-96e8f2a966e0
  • Comic Walker:cw_<作品代码>_<章节ID>(例如 cw_KC_000040_S_018d6a9e-4072-73a5-812f-3244507f14dd

每个章节文件夹的文件

文件 颜色模式 描述
page_N.png RGB 原始页面,包含文字(白色背景上合成透明通道)。用于修复的源图像。
page_N_cleaned.png RGB 自动清理后的页面:仅擦除位于均匀背景上的文字,气泡内或复杂艺术上的文字保留。
page_N_clean_mask.png L(8-bit) 自动清理填充的每个像素的掩码(255 = 擦除,0 = 未触碰)。page_Npage_N_cleaned 仅在此掩码值为 255 处有差异
page_N_uninteresting.png L(8-bit) 二值(0/255) 无兴趣区域掩码(平坦边距、空白边缘、纯色空白区域,255 = 无兴趣)。用于训练裁剪时跳过空白区域。
info.json 章节元数据 + 每页几何信息和所有边界框(详见下方模式)。

info.json 模式(部分示例)

json { "source": "ganma", // "ganma" 或 "comicwalker" "magazine_id": "e9fa8129-…", "alias": "akagaminohanayome", "magazine_title": "赤髪の花嫁は…", "story_id": "2ca52150-…", "story_title": "第3話", "subtitle": "後編", "pages": [ { "index": 0, "page_number": 1, "width": 1975, "height": 2783, "bubble_boxes": [ { "model": "bubble_seg", "label": "speech_bubble", "score": 0.96, "piece_index": 0, "x1": 312, "y1": 1321, "x2": 718, "y2": 1751 } ], "text_boxes": [ { "model": "text_seg", "label": "text", "score": 0.97, "piece_index": 0, "x1": 361, "y1": 1342, "x2": 659, "y2": 1707 } ], "uncleaned_boxes": [ { "x1": 361, "y1": 1342, "x2": 659, "y2": 1707 } ] } ] }

  • 边界框使用页面绝对坐标 (x1,y1)–(x2,y2)model 标识检测器类型。
  • piece_index 始终为 0(漫画页面为单一片段)。
  • uncleaned_boxes 标记自动清理有意保留的文字(气泡内或复杂艺术上的文字),用于“可移除 vs. 保留”分类训练。

用途说明

  • 文本移除/修复(inpainting):使用 page_N.png(输入,含文字) + page_N_cleaned.png(目标,文字已移除) + page_N_clean_mask.png(掩码,指示需修复区域)构成训练三元组。
  • 检测/分割:使用 bubble_boxestext_boxes 作为边界框标注;uncleaned_boxes 用于训练“可移除 vs. 保留”分类器。
  • 训练裁剪优化:使用 page_N_uninteresting.png 掩码,在采样训练块时跳过无兴趣区域。

示例章节

数据集提供了 examples/ 目录,包含来自 10 部不同作品的 10 个章节(6 个来自 GANMA,4 个来自 Comic Walker),作为快速预览。


许可与使用限制

  • 原始作品版权归原作者所有。
  • 本数据集仅限非商业研究用途(文本移除、修复、检测模型训练)。
  • 数据集包含派生制品(掩码、边界框)和原始图像,不得将图像用于商业目的。如需删除内容,请提交 issue。
搜集汇总
数据集介绍
cleaned_manga_dataset 数据集图片
构建方式
该数据集源自GANMA!与Comic Walker两大开源漫画平台,经过系统性采集与精细加工而成。每一页漫画均被独立下载、分析与存储,Comic Walker的XOR加密页面在下载时即被还原。通过集成两个气泡检测模型与两个漫画文本检测模型构成的集成模型,对页面进行自动分割,生成精确的气泡与文本边界框。随后执行自动清除(autoclean)流程,仅在背景均匀的区域擦除文本,确保不引入任何猜测或伪造的修复像素。另设独立通道识别平坦空白区域并生成无趣区域掩码,所有处理步骤均保持像素对齐,最终产出涵盖原始页、清洁页、擦除掩码及无趣区域掩码的完整数据对。
特点
本数据集以漫画页为基本单位,涵盖约2,335章、533部作品、43,217页,包含约537,000个文本框与488,000个气泡框,规模宏大且标注精细。其独特之处在于提供四维对齐数据:带文本的原始页、自动清洁后的目标页、精确的擦除掩码,以及标记平坦空白区域的二值掩码。边界框数据不仅包含气泡与文本检测结果,还特别标注了自动清除流程中刻意保留的文本区域(如气泡内文本、复杂背景上的文字),为“可移除与应保留文本”的区分提供直接监督信号。每页保留原始分辨率,典型宽度1,000-2,100像素,高度可达7,300像素,充分适配漫画双页跨页格式。
使用方法
对于文本去除与图像修复任务,可直接采用(page_N.png, page_N_cleaned.png, page_N_clean_mask.png)作为输入-目标-掩码三元组,其中清洁掩码精确指示待修复区域。无趣区域掩码可辅助采样时跳过平坦空白区域,提升训练效率。检测与分割任务中,info.json中的bubble_boxes与text_boxes提供即用型边界框标注,uncleaned_boxes则可用于训练文本可移除性分类器。若有软目标需求,可通过builder的--debug标志重新生成各模型的置信度图。所有掩码与图像保持相同尺寸,确保像素级对齐,无需额外处理即可直接接入ZITS++等修复模型或YOLO等检测框架。
背景与挑战
背景概述
该数据集创建于近期,源自GANMA!与Comic Walker两大合法免费漫画平台,由研究者整合而成,核心服务于漫画领域的文本去除、图像修复及气泡/文本检测等视觉任务。数据集包含约43,000页漫画,覆盖533部作品,提供原始页面、自动清理后的图像、擦除掩码、无趣区域掩码及约53万个文本边界框与48万个气泡边界框,为模型训练提供了高质量、像素级对齐的标注信息。其影响力体现在为漫画图像处理研究提供了标准化的基准,尤其推动了文本移除与修复模型(如ZITS++)的评估与优化,弥补了该领域公开数据资源的不足。
当前挑战
领域层面的核心挑战在于漫画文本的复杂背景多样性:文本常嵌入非均匀背景(如气泡内或复杂画作之上),自动擦除易导致伪影或丢失细节,难以同时保证干净移除与艺术完整性。数据集构建中面临的关键困难包括:对Comic Walker页面需进行XOR解码以获取原始图像;多模型集成检测时需协调不同模型输出的置信度与重叠框;自动清理阶段需严格区分可擦除文本(均匀背景)与需保留文本(复杂背景),避免伪造内容;同时确保所有掩码与原始图像完全对齐,并处理不同页面分辨率差异(最高达7300像素)带来的计算与存储挑战。
常用场景
经典使用场景
Cleaned Manga Dataset专为漫画领域的文本移除与图像修复任务设计。该数据集以漫画页为基本单元,提供了原始带文本图像、自动清理后的无文本图像、精确的擦除掩码以及气泡与文本的边界框标注。其最经典的用法是作为图像修复模型(如ZITS++)的训练与评估数据,研究者可直接使用(page_N.png, page_N_cleaned.png, page_N_clean_mask.png)三元组,构建从退化图像到目标图像的端到端学习范式,同时利用未处理区域掩码优化采样策略,从而高效训练出能够精准去除漫画中各类文本的深度学习模型。
实际应用
在实际应用中,该数据集广泛服务于漫画本地化翻译与数字出版产业。基于此数据集训练的文本移除模型,能够自动擦除原始漫画中的源语言文本,保留气泡与艺术区域结构,为后续人工或机器翻译与嵌字工序提供干净的画布。此外,数据集中提供的文本与气泡检测框可直接用于训练高精度检测器,应用于漫画自动排版、内容审查以及无障碍阅读辅助工具的开发。出版社与翻译团队利用此类模型可大幅降低人工编辑成本,提升多语言版本的产出效率,使全球读者能够更快捷地享受跨文化漫画作品。
衍生相关工作
此数据集衍生了一系列经典的研究工作与工具。在图像修复领域,研究者基于其条纹对齐的掩码设计提出了改进的ZITS++模型,实现了漫画文本的上下文感知修复。在文本检测方向,数据集中标注的13万余个文本框与气泡框被用于训练轻量级漫画文本检测网络(如Manga Text Detector),推动了漫画特有的字体排列与艺术变形文本的鲁棒检测。此外,该数据集与清理网络数据集构成互补,催生了跨域迁移学习研究,探索页面与带状布局之间的知识共享,并诞生了多个开源漫画修复流水线,如MangaClean与ComicDeText,成为学术实验与工业应用的通用基线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务