MTHv2
收藏资源简介:
本项目共享的数据集包括韩文大藏经(TKH)数据集和多版本大藏经(MTH)数据集。为了促进中国历史文献的研究,我们通过添加布局、字符和文本行注释来扩展原始数据集的规模。更多来自互联网的挑战性文档图像被添加到MTH数据集中,其图像数量现在为2200,TKH和MTH的组合数据集被命名为MTHv2。
The dataset shared in this project includes the Tripitaka Koreana in Hanja (TKH) dataset and the Multi-version Tripitaka Hanja (MTH) dataset. To facilitate research on Chinese historical documents, we have expanded the original dataset by adding annotations for layout, characters, and text lines. More challenging document images from the internet have been added to the MTH dataset, which now contains 2200 images. The combined dataset of TKH and MTH is named MTHv2.
MTHv2 数据集概述
数据集内容
- 数据集名称:MTHv2,包括Tripitaka Koreana in Han (TKH) Dataset和Multiple Tripitaka in Han (MTH) Dataset的扩展版本。
- 数据集扩展:新增了来自互联网的更具挑战性的文档图像,总数达到2200张。
数据集特点
- 三类标注:
- 行级标注:包括文本行位置及其转录,按阅读顺序保存。
- 字符级标注:包括类别和边界框坐标。
- 边界线标注:由线段的起始和结束点表示。
数据集划分
- 训练集与测试集:随机按3:1的比例划分。
数据集下载
- 下载链接:
- Google Drive
- Baidu Drive 提取码: eweb
引用信息
@article{ title={Joint Layout Analysis, Character Detection and Recognition for Historical Document Digitization}, author={Weihong Ma, Hesuo Zhang, Lianwen Jin, Sihang Wu, Jiapeng Wang, Yongpan Wang}, journal={ICFHR 2020}, year={2020} }




