Acutis Document Analysis Dataset
收藏资源简介:
这是一个使用Acutis文档分析系统创建的大型文档分析数据集。Acutis系统结合了Surya模型、boomb0om的CRAFT实现和dimdenGD的Google Lens OCR技术。数据集的内容来源于Archive.org的文本类型文档,通过高级搜索和筛选特定语言(如手写英语)的文档来获取数据。
This is a large-scale document analysis dataset created using the Acutis document analysis system. The Acutis system integrates the Surya model, boomb0om's CRAFT implementation, and dimdenGD's Google Lens OCR technology. The dataset content is sourced from text-type documents on Archive.org, with data collected through advanced search and filtering for documents in specific languages such as handwritten English.
数据集概述
数据集来源
- 数据集通过Acutis文档分析系统生成,该系统结合了Surya模型、boomb0om的CRAFT实现以及dimdenGD的Google Lens OCR技术。
- 文档来源于Archive.org的“texts”媒体类型,通过高级搜索功能筛选出特定语言(如手写英语)的文档。
数据集生成流程
- 文档筛选:通过Archive.org的高级搜索功能,筛选出符合条件的文档标识符,并保存为
identifiers.txt文件。 - 环境配置:需要Linux系统、conda环境和CUDA>=12.1支持。通过克隆仓库、安装Node包、创建conda环境并安装Python依赖项来配置环境。
- 数据集生成:运行
start.py脚本,指定输入目录和分块大小,生成数据集。脚本会处理每个文档标识符,生成对应的HTML和布局信息文件。
数据集结构
-
数据集目录结构如下:
INPUT_DIR/ └──dashboard.txt └── identifier_1/ └── document_name_1/ ├── 1.html ├── 1.boxes ├── 2.html ├── 2.boxes └── ... └── document_name_2/ ├── 1.html ├── 1.boxes ├── 2.html ├── 2.boxes └── ... ...
-
每个文档文件夹包含多个页面文件,每个页面文件包含
.html和.boxes文件,分别存储页面内容和布局信息。
布局信息
-
.boxes文件包含页面布局元素的描述,格式为:[x1, y1, x2, y2, label, box_id, position]
x1,y1,x2,y2:布局元素的归一化坐标。label:布局元素的标签,如Caption、Footnote等。box_id:布局元素的唯一标识符。position:布局元素在页面中的阅读顺序。
数据处理
- HTML转Markdown:通过运行
markdown.py脚本,将HTML文件转换为Markdown格式。 - 数据压缩:通过运行
compress_directory.sh脚本,压缩已完成处理的文件夹以节省磁盘空间。
进度跟踪
- 脚本运行时生成
dashboard.txt文件,记录处理进度,包括已处理的标识符数量、文档数量、页面数量等。
注意事项
- 数据集生成过程中,脚本会自动跳过无效的文档标识符,并记录已处理的标识符。
- 数据集生成过程中,可以根据VRAM资源调整
DETECTOR_BATCH_SIZE和ORDER_BATCH_SIZE参数。




