SmartDoc 2015 - Challenge 1 Dataset
收藏资源简介:
SmartDoc 2015 - Challenge 1数据集最初是为SmartDoc 2015竞赛创建的,专注于使用智能手机评估文档图像采集方法。挑战1特别包括在智能手机预览流中提取的视频帧中检测和分割文档区域。该数据集包含来自公共数据库的六种不同文档类型,每种类型选择五个文档图像,涵盖不同的文档布局方案和内容。数据集包括150个视频片段,约24,000帧,每帧都标注了文档位置的四边形坐标。
The SmartDoc 2015 - Challenge 1 dataset was originally created for the SmartDoc 2015 competition, focusing on evaluating document image acquisition methods using smartphones. Challenge 1 specifically involves detecting and segmenting document regions in video frames extracted from smartphone preview streams. The dataset comprises six different document types selected from public databases, with five document images chosen for each type, covering various document layout schemes and contents. It includes 150 video clips, approximately 24,000 frames, each annotated with quadrilateral coordinates indicating the document's location.
SmartDoc 2015 - Challenge 1 Dataset 概述
数据集描述
SmartDoc 2015 - Challenge 1 数据集是为 SmartDoc 2015 竞赛创建的,专注于使用智能手机评估文档图像采集方法。挑战1特别关注于从智能手机预览流中提取的视频帧中检测和分割文档区域。
数据集内容
- 文档模型:数据集包含来自公共数据库的六种不同文档类型,每种类型选择五张文档图像,涵盖不同的文档布局方案和内容(完全文本或高图形内容)。
- 视频录制:使用Google Nexus 7平板电脑手动捕捉,每个文档录制约10秒的视频,共5种不同的背景场景。视频以Full HD 1920x1080分辨率录制,帧率可变。
- 视频和模型图像:数据库包含150个视频片段,约24,000帧。同时提供模型图像以供研究人员使用。
数据集任务
- 分割:输入为视频帧,输出为文档图像在每帧中的四个角点坐标(左上,左下,右下,右上)。评估通过计算预期文档区域与找到区域之间的交并比(IoU)进行。
- 模型分类:输入为视频帧,输出为每帧中表示的文档模型标识符。共有30个模型。
- 模型类型分类:输入为视频帧,输出为每帧中表示的文档模型类型标识符。共有6种模型类型。
数据集下载
- 下载方式:
- 使用Python包装器:https://github.com/jchazalon/smartdoc15-ch1-pywrapper
- 直接下载
frames.tar.gz和models.tar.gz文件:https://github.com/jchazalon/smartdoc15-ch1-dataset/releases
数据集版本
- 版本号:数据集从版本2.0.0开始,与原始版本有显著差异。版本号遵循MAJOR.MINOR.PATCH格式,根据数据集内容的变更进行更新。
数据集结构
frames.tar.gz 档案
- 文件结构:包含视频帧及其元数据,每个背景场景下的每个模型文件夹中包含一系列JPEG图像。
- 元数据文件:
metadata.csv.gz,描述每个视频帧的详细信息,包括背景名称、模型名称、图像路径等。
models.tar.gz 档案
- 文件结构:包含模型图像及其元数据,分为五个不同的类别,每个类别下包含30个文档的PNG或JPG图像。
- 元数据文件:
metadata.csv.gz,描述每个模型图像的详细信息,包括模型类别、模型名称、图像路径等。
数据集使用建议
- Python包装器:推荐使用Python包装器以简化数据加载和处理。
- 模型图像使用:推荐使用
05-corrected-nexus-scaled33类别中的图像,如果需要使用局部描述符匹配文档模型与帧中的表示。
此数据集适用于文档图像处理和机器学习领域的研究和开发。




