遇见数据集

manga109-segmentation

收藏
Hugging Face2026-07-24 更新2026-07-27 收录
官方服务:

资源简介:

Manga109 Segmentation是一个专注于漫画布局分析和实例分割的纯标注数据集(版本v2.0.0)。该数据集不包含漫画图像,需用户另行获取Manga109图像集。它提供了漫画页面中四种关键元素(文本、拟声词、对话气泡、画格)的实例分割掩码(采用COCO RLE格式),以及这些元素之间的几何包含关系(如文本包含于气泡中)和可用的日文转录文本。标注基于109本漫画书,覆盖10,098个页面,包含454,606个标注实例,并按照书籍不相交原则划分为训练集(87本书,8,128页)、验证集(11本书,1,001页)和测试集(11本书,969页)。v2.0.0版本进行了重大更新:优先使用手动绘制的Zenodo文本掩码,并利用模型在人工标注框内精炼文本/拟声词像素;移除了标注不完整的页面以确保背景质量;所有标注标记为非拥挤状态(iscrowd: 0)。数据集以COCO格式发布,适用于漫画布局分析、实例分割、文本检测和阅读顺序推断等任务。但需注意,部分掩码(尤其是文本/拟声词)为模型辅助生成,气泡/画格掩码继承自上游数据集,且包含关系和阅读顺序字段为几何启发式结果,并非完全精确的人工标注。

Manga109 Segmentation is a purely annotated dataset (version v2.0.0) dedicated to manga layout analysis and instance segmentation. This dataset does not contain any manga images, and users must separately obtain the official Manga109 image collection. It provides instance segmentation masks in COCO RLE format for four key elements in manga pages: text, sound effects, speech bubbles, and panels, along with the geometric inclusion relationships between these elements (e.g., text contained within speech bubbles) and the accompanying Japanese transcriptions. The annotations are based on 109 comic books, covering a total of 10,098 pages and containing 454,606 annotated instances. The dataset is divided into training, validation, and test sets following the book-disjoint principle: the training set includes 87 books with 8,128 pages, the validation set includes 11 books with 1,001 pages, and the test set includes 11 books with 969 pages. Version v2.0.0 includes major updates: prioritizing manually drawn Zenodo text masks, refining text and sound effect pixels within manually annotated bounding boxes using models, removing pages with incomplete annotations to ensure high-quality background annotations, and marking all annotations as non-crowded (iscrowd: 0). The dataset is released in COCO format, and is applicable to tasks such as manga layout analysis, instance segmentation, text detection, and reading order inference. However, it should be noted that some masks (particularly those for text and sound effects) were generated with model assistance; speech bubble and panel masks are inherited from upstream datasets; and the inclusion relationship and reading order fields are geometric heuristic results rather than fully precise manual annotations.

创建时间:
2026-07-23
搜集汇总
数据集介绍
manga109-segmentation 数据集图片
构建方式
Manga109 Segmentation数据集作为一款纯标注数据资源,聚焦于漫画版面与实例分割任务,其核心构建基于对Manga109图像的精细化再处理。在本次v2.0.0版本中,项目团队采纳了多源标注融合策略:对于包含文本的449页漫画,优先采用Zenodo人工绘制的高精度文本掩膜作为像素级真值基石;其余页面则借助mayocream/koharu-text-sam-ts-l模型,在人工几何框约束下对文本与拟声词像素进行精炼优化。对于已有高质量文本掩膜的实例,采用与裁剪后的教师模型二值墨水区域取并集的方式予以保留;当教师模型支撑充分时,替换原有的填充框或多边形回退方案。值得一提的是,PP-DocLayoutV3模型在本版本中仅用于边界框提案,而非直接生成掩膜像素。对于通过该模型获得的3,372个仅用于训练的伪实例,其掩膜均源自TextSeg模型在提案框内的像素分割结果,并依据掩膜外形收紧边界框坐标。此外,为规避未标注文本成为COCO背景误报的风险,研究团队严格筛除了504个正面标签严重缺失的页面,包括102张封面页,从而确保训练数据的纯净性。
特点
本数据集展现了若干显著的技术特征。首先,所有454,606条标注实例均以COCO RLE压缩格式存储掩膜,并统一设置iscrowd: 0,规避了自定义密集头部或忽略区域编码的复杂需求,极大降低了模型训练时的预处理门槛。类别涵盖文本、拟声词、气泡与面板四大核心漫画元素,同时提供355,817条几何包含关系(如文本被气泡包含),为版面理解提供了结构化的上下文线索。数据集严格遵循按书籍划分而不跨卷混合的原则,训练、验证与测试集分别包含87、11、11本漫画,共计10,098页,避免了页面级别的数据泄露。每个实例皆配备quality_tier属性,忠实记录其来源质量等级,例如来自MangaSegmentation的金标掩膜、经过Zenodo人工像素精炼的金标实例,以及由TextSeg模型配合PP-DocLayoutV3提案生成的银标训练实例,透明化地呈现代理标注的可信度差异。
使用方法
使用Manga109 Segmentation数据集需首先获取Manga109原始图像文件,该资源不随本数据集一并分发。用户应依据数据集包内annotations目录下的train.coco.json、validation.coco.json与test.coco.json文件加载标准COCO格式的标注。通过读取images字段中的file_name,可将相对路径拼接至本地Manga109的images目录下,从而实现图像与标签的配对。由于标注文件中所有掩膜均已编码为压缩RLE格式,开发者可直接利用pycocotools库中的相关函数进行解码与评估。值得一提的是,数据集不包含负样本分割类别,所有未标注区域自然扮演COCO背景角色,训练时无需额外配置忽略区域。同时,review目录下的JSONL文件提供了每页的详细诊断信息,包括教师模型覆盖率、提案边界框与排除理由等,便于用户在离线分析或数据过滤时参考。用户在使用前务必遵守上游各数据源的许可协议,且不得随本仓库上传Manga109图像文件。
背景与挑战
背景概述
Manga109 Segmentation数据集由日本研究团队于2020年代初期创建,依托于Manga109项目,旨在推动漫画图像理解领域的发展。该数据集聚焦于漫画版面分析与实例分割,核心研究问题包括精确识别文本、拟声词、气泡和面板等元素,并解析其几何包含关系。Manga109作为漫画研究领域的标志性数据集,其版本v2.0.0通过引入COCO RLE掩码、多源标注优化及严格的分页过滤机制,显著提升了标注质量与训练效率,对漫画布局分析、文本检测及阅读顺序估计等下游任务具有重要影响力,推动了计算机视觉与数字人文交叉领域的进步。
当前挑战
所解决的领域问题方面,数据集面临漫画元素多样性与版面复杂性的挑战,如文本与拟声词在气泡或面板内的嵌套关系,以及不同漫画风格的布局差异,要求模型具备细粒度实例分割与几何推理能力。构建过程中,主要挑战包括:手工标注成本高昂,需融合来自Zenodo文本掩码、TextSeg模型及PP-DocLayoutV3等多种来源的标注,确保像素级一致性;处理含不完整标签的页面以避免假阴性背景干扰,导致504页数据被移除;气泡与面板掩码继承自原有数据集的模糊性和源错误,需通过严格的分页过滤与质量层级划分来缓解。此外,数据集的许可证限制要求用户自行获取原始图像,增加了复现与评估的复杂性。
常用场景
经典使用场景
在漫画内容分析与理解领域,Manga109-Segmentation数据集被广泛用于多类别实例分割与版面结构解析任务。它提供了文本、拟声词、气泡和面板四类元素的精确掩码注释,并包含了元素间的几何包含关系,使得研究者能够同时训练模型识别漫画中的不同语义组件及其空间层级。该数据集特别适合用于训练端到端的漫画版面分析模型,例如结合目标检测与分割的神经网络架构,以实现对复杂漫画页面的全自动结构化解析。
衍生相关工作
围绕Manga109-Segmentation,衍生出多项具有影响力的研究工作。其中最直接的是基于其注释格式与分割任务的改进型模型,如采用RF-DETR框架的实例分割方法,利用该数据集进行训练并评估性能。此外,该数据集的构建流程——特别是将MangaSegmentation、Zenodo文本掩码以及PP-DocLayoutV3提案融合的策略——启发了后续的多源标注融合研究,促进了漫画分析中教师-学生网络与半自动标注范式的普及。这些工作共同丰富了文档图像分析与场景文本理解领域的理论基础与实践工具。
数据集最近研究
最新研究方向
随着漫画数字化与多模态理解的深入发展,Manga109 Segmentation作为面向漫画版面解析与实例分割的高质量标注数据集,近期研究聚焦于弱监督与模型辅助标注的融合策略。其v2.0.0版本采用手工精绘的Zenodo文本遮罩作为最高优先级像素源,并引入TextSeg与PP-DocLayoutV3等预训练模型进行边界框提议与像素级优化,显著提升了文字、拟声词、气泡和分镜框等元素的掩码质量与标注一致性。该方向与当前热点事件如RF-DETR类实例分割训练范式紧密衔接,通过在449页上应用人工标注优先、其余页面以教师模型精炼的策略,有效缓解了伪标签引入的噪声问题,同时剔除了标签不完整的页面以避免假阴性背景干扰。这一工作不仅为漫画OCR与版面分析提供了更可靠的基准,也为面向复杂文档图像的多模态分割任务树立了数据质量管控与负监督机制的新范例,推动了漫画内容理解在数字人文与AI辅助创作领域的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务