遇见数据集

bl-crop-tighten-v1

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

bl-crop-tighten-v1数据集专注于书籍图像裁剪收紧任务,基于British Library Book Images集合构建。数据集包含7,565个ABBYY图片块裁剪样本,划分为训练集(6,050个)、验证集(757个)和测试集(758个),且分割保证书安全(每本书仅出现在一个分割中,共涉及4,484本书)。所有标签均为弱标签,由tiiuae/Falcon-Perception-0.6B模型对8,400个分层裁剪样本进行开放词汇分割后,经过滤筛选得到。每个实例提供边界框(bbox,格式为[x, y, w, h],像素单位)、COCO RLE格式的分割掩码以及几何诊断信息(rectangularity矩形度、n_components组件数、frac_largest最大组件比例)。数据集适用于图像分割任务,特别是实例分割与书籍图像裁剪收紧模型的训练与评估。

The bl-crop-tighten-v1 dataset focuses on the book image cropping and tightening task, built upon the British Library Book Images collection. It contains 7,565 ABBYY image block cropping samples, divided into training set (6,050), validation set (757), and test set (758), with split ensuring book safety (each book appears in only one split, involving 4,484 books in total). All labels are weak labels, obtained by filtering after open-vocabulary segmentation of 8,400 hierarchical cropping samples using the tiiuae/Falcon-Perception-0.6B model. Each instance provides a bounding box (bbox in [x, y, w, h] format, pixel units), a COCO RLE-format segmentation mask, and geometric diagnostic information (rectangularity, n_components, frac_largest). The dataset is suitable for image segmentation tasks, particularly for training and evaluating instance segmentation and book image cropping and tightening models.

创建时间:
2026-08-09
原始信息汇总

bl-crop-tighten-v1 数据集详情

基本信息

  • 数据集名称: bl-crop-tighten-v1
  • 许可证: CC0-1.0(公有领域)
  • 任务类型: 图像分割(image-segmentation)
  • 标签类型: 弱标签(weak-labels),非人工标注
  • 构建者: Daniel van Strien

数据来源

该数据集基于大英图书馆图书图像集构建,源图像由大英图书馆数字化(CC0协议)。数据集包含来自4,484本书籍的7,565个ABBYY图片块裁剪样本。

数据集结构

特征字段

字段 类型 说明
image image 图像数据
image_id string 图像标识符
split_src string 源划分信息
width / height int32 图像尺寸
objects struct 实例对象信息
masks_rle string RLE格式掩码
flags string 标志信息
n_instances int32 实例数量

objects字段详细结构

  • id: int64列表,实例ID
  • category: int64列表,类别
  • bbox: float32列表,边界框[x, y, w, h](像素)
  • area: float32列表,面积
  • segmentation: COCO RLE格式分割掩码(包含size和counts)
  • iscrowd: int64列表
  • rectangularity: float32列表,矩形度
  • n_components: int64列表,组件数
  • frac_largest: float32列表,最大组件占比

数据划分

划分 样本数 大小
train 6,050 499,709,244 字节
validation 757 86,384,241 字节
test 758 87,451,512 字节
总计 7,565 673,544,997 字节

数据划分具有书籍安全性,任何一本书不会同时出现在多个划分中。

数据生成方法

  1. 使用tiiuae/Falcon-Perception-0.6B模型对8,400个分层采样裁剪图像(包括装饰、图版、中等大小图像,普通封面作为负样本)进行开放词汇分割
  2. 经过过滤筛选后保留7,565个样本
  3. 每个实例包含边界框、COCO RLE分割掩码及几何诊断信息(矩形度、组件数、最大组件占比)

相关资源

使用示例

python from datasets import load_dataset ds = load_dataset("small-models-for-glam/bl-crop-tighten-v1", split="train")

注意事项

该数据集的标签为弱标签,并非人工标注,使用时需谨慎对待标签质量。

搜集汇总
数据集介绍
bl-crop-tighten-v1 数据集图片
构建方式
本数据集源自大英图书馆藏书影像(British Library Book Images)的数字化资源,旨在服务于图像分割任务中的裁剪收紧(crop tightening)场景。其构建过程采用了基于弱标签的技术路径,利用tiiuae/Falcon-Perception-0.6B模型对精选的8,400幅图像(涵盖装饰画、图版、中等复杂图像及空白封皮负样本)进行开放词汇分割,并通过几何诊断指标(如矩形度、连通分量数、最大分量比例)进行过滤,最终保留7,565个有效的图像块。数据划分遵循书籍隔离原则,确保同一本书的影像不会跨分割出现,共涉及4,484本书籍,形成训练集6,050例、验证集757例与测试集758例的均衡分布,并以COCO格式存储实例框与分割掩码。
特点
该数据集的核心特色在于其弱标签的性质,并非人工精细标注,而是由模型自动生成,因此在使用时需审慎对待标签的准确性。每个实例均附带丰富的几何属性,包括边界框坐标、面积、矩形度、连通分量数以及最大分量占比,这些诊断信息为后续的过滤与优化提供了量化依据。此外,数据集采用了COCO RLE格式的分割掩码,高效地存储了像素级掩膜,同时兼容广泛使用的图像分割工具链。其书籍安全的划分策略确保了模型评估的客观性,避免了数据泄露风险,使得训练结果更具泛化能力。
使用方法
使用该数据集时,用户可通过HuggingFace的datasets库便捷加载,例如执行`load_dataset("small-models-for-glam/bl-crop-tighten-v1", split="train")`即可获取训练子集。数据集中每一行包含图像、对象列表(含类别、边界框、分割掩码及几何特征)以及综合的RLE掩码与标志信息,适用于实例分割模型的训练与验证。该数据集已被用于训练名为bl-crop-tighten-rfdetrseg-clip10的学生模型,其预测结果已发布在源数据集的crop_masks配置中,可用于大规模图像语料库的快速裁剪处理。建议用户结合弱标签的特性,注意在特定任务中可能需要额外的后处理或人工校验。
背景与挑战
背景概述
在数字人文与文化遗产数字化领域,海量历史典籍的图像预处理是知识挖掘与视觉分析的基础环节。大英图书馆藏书影像(British Library Book Images)包含逾百万页扫描件,其版面元素如插图、边框与装饰纹样往往在OCR或展陈流程中因错切、倾斜而失真,亟需精准的裁剪校正。为此,英国图书馆与HuggingFace社区的GLAM小组于2023年构建了bl-crop-tighten-v1数据集,由Daniel van Strien主导,采用弱监督策略,利用Falcon-Perception-0.6B模型对8400幅分层采样图像进行开放词汇分割,经几何诊断过滤后保留7565幅有效样本,并按书籍安全划分训练、验证与测试集。该数据集核心服务于图像分割任务,为训练紧凑型裁剪校正模型提供了基准,其研究成果已应用于全语料库的裁剪掩膜生成,推动了大规模历史文献视觉结构理解的自动化进程。
当前挑战
该数据集所面临的挑战多维而深刻。在领域层面,历史书籍图像存在版面异构、装帧复杂、噪声干扰等特性,传统规则难以应对干扰性元素与装饰性图案的精确识别,分割模型需兼顾语义理解与几何约束,方能实现稳健的裁剪校正。在构建过程中,由于采用弱标签而非人工标注,模型输出不可避免存在类别混淆与边界误差,过滤环节必须权衡召回与精确率,依赖矩形度、连通域等几何特征进行质量筛选,工作量与算力消耗显著。此外,书脊弯曲、透视变形及扫描伪影进一步加剧标注难度,跨书籍泛化亦受限于训练样本的工艺风格差异,这些因素共同构成了数据集在质量保障与实用性能上的持续性挑战。
常用场景
经典使用场景
该数据集聚焦于图像分割领域的经典任务——实例分割与弱监督学习,专为优化大英图书馆藏书图像中的图片块裁剪过程而设计。其核心用法在于利用精心划分的训练、验证与测试集,训练模型精确识别并分割出图像中的插图、装饰等视觉元素,进而实现对这些区域的自动化裁剪与定位。数据集中每个实例均附带边界框、COCO格式的RLE分割掩码以及几何诊断信息,为算法提供了丰富的特征输入,使其成为评估和提升实例分割模型性能的理想基准。
实际应用
在实际应用中,该数据集训练的模型可直接部署于大规模图书馆数字化流水线,自动完成对百万级书页图像中插画、图表等内容的识别与裁剪,生成结构化的图片资源,便于后续的检索、存档与展示。此外,其衍生的预测掩码可被利用于古籍的版面分析、内容重组乃至光学字符识别前的预处理,极大提升了数字图书馆的服务效率与用户体验。模型输出的分割结果亦能辅助研究人员进行书页内容的统计分析,探索视觉元素在书册中的分布规律。
衍生相关工作
该数据集作为训练基础,催生了专门用于细化裁剪的轻量级学生模型,该模型在完整语料库上生成的预测掩码已作为公开资源发布,丰富了原数据集的可用性。相关研究可进一步包括:基于此弱标签数据集的领域自适应研究,探索将模型迁移至其他历史文献或不同扫描条件下的图像;以及结合几何诊断特征分析的裁剪策略优化,推动更精细的图像分割与后处理技术。这些衍生工作共同构建了一个从数据生成、模型训练到大规模应用的完整研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务