Digitization of Old Indonesian Documents using YOLO and OCR
收藏资源简介:
NOTE: The Dataset For TrOCR Is Available In HuggingFace NusaAksara https://huggingface.co/datasets/NusaAksara/NusaAksara/viewer/Image%20Transcription%20(OCR)/train?f%5Bscript%5D%5Bvalue%5D=%27jawa%27&views%5B%5D=image_transcription_ocr This data is a combination of data for TrOCR Text Transcription of Jawa Aksara from NusaAksara, and A collection data for YOLOv8 manually created and annotated from Robflow consisting of document images from NusaAksara Jawa Aksara Image Segmentation Dataset, and Single page images of historical documents from The British Public Library: Endangered Archives Program. Link To NusaAksara (OCR Transcription): https://huggingface.co/datasets/NusaAksara/NusaAksara/viewer/Image%20Transcription%20(OCR)/train?f%5Bscript%5D%5Bvalue%5D=%27jawa%27&row=4707&views%5B%5D=image_transcription_ocr Link To NusaAksara (OCR SEGMENTATION): https://huggingface.co/datasets/NusaAksara/NusaAksara/viewer/Image%20Segmentation/train?f%5Blanguage%5D%5Bvalue%5D=%27Jawa%27&views%5B%5D=image_segmentation Link EAP: https://eap.bl.uk/search




