SpiS_GAN
收藏资源简介:
该数据集是SpiS-GAN手写合成框架的一部分,包含英文和越南语手写样本,用于生成逼真、清晰且书写者一致的手写体,以改进下游手写文本识别(HTR)系统。数据来源于两个公开数据集:IAM(英文手写数据集)和HANDS-VNOnDB(越南语手写数据集)。数据集以HDF5文件格式提供,包括训练/验证分割和测试分割文件,并配有相应的英文和越南语词典文件。数据支持两种分辨率版本:32像素和64像素。该数据集适用于手写合成、手写重建以及手写文本识别模型的训练与评估任务。
This dataset is part of the SpiS-GAN handwriting synthesis framework, containing English and Vietnamese handwriting samples for generating realistic, clear, and writer-consistent handwriting to improve downstream Handwritten Text Recognition (HTR) systems. The data is sourced from two public datasets: IAM (English handwriting dataset) and HANDS-VNOnDB (Vietnamese handwriting dataset). The dataset is provided in HDF5 file format, including train/validation splits and test split files, along with corresponding English and Vietnamese dictionary files. The data supports two resolution versions: 32 pixels and 64 pixels. This dataset is suitable for handwriting synthesis, handwriting reconstruction, and the training and evaluation of handwritten text recognition models.
数据集概述
数据集名称:SpiS-GAN 数据集(与 SpiS-GAN 手写合成框架配套)
数据集用途:用于训练和评估基于 GAN 的手写合成模型,生成逼真、可读且风格一致的手写文本,以提升下游手写文本识别(HTR)系统的性能。
数据集内容:
- IAM 英文手写数据集:包含训练/验证集和测试集,以 HDF5 格式存储(
train_32.hdf5、test_32.hdf5)。 - 越南语手写数据集(HANDS-VNOnDB):包含训练/验证集和测试集,以 HDF5 格式存储(
train_vn.h5、test_vn.h5)。 - 词表文件:
english_words.txt(英文词表)和vietnamese_words.txt(越南语词表)。
数据分辨率:
- 32px 版本:已公开发布数据与检查点(checkpoints)。
- 64px 版本:配置文件已提供,数据集与检查点待后续更新。
文件结构(期望存放路径 ./data/):
data/ |-- train_32.hdf5 # IAM 训练/验证集 |-- test_32.hdf5 # IAM 测试集 |-- train_vn.h5 # 越南语训练/验证集 |-- test_vn.h5 # 越南语测试集 |-- english_words.txt # 英文词表 `-- vietnamese_words.txt # 越南语词表
相关代码与模型:
- 代码仓库:https://github.com/DAIR-Group/SpiS-GAN
- 支持生成 32px 和 64px 分辨率的手写样本(64px 检查点待更新)。
- 提供预训练检查点(checkpoints)用于生成和推理。
许可协议:MIT




