遇见数据集

himalaya-ai/devanagari_ocr_dataset

收藏
Hugging Face2026-07-17 更新2026-07-22 收录
官方服务:

资源简介:

这是一个经过整理的编译数据集,包含7个公开的天城体OCR数据集,经过脚本纯度过滤,并重新打包为ShareGPT对话格式,用于微调视觉语言模型如GLM-OCR。数据集以42个压缩图像批次(便于管理下载)和单个合并的JSON注释文件(devanagari_ocr.json)分发。未提供固定的训练/验证/测试分割,允许用户根据下游任务创建分层分割。总大小:约58 GB(图像)+注释。

This is a curated compilation of 7 public Devanagari OCR datasets, filtered for script purity and repackaged into the ShareGPT conversation format for fine-tuning vision-language models like GLM-OCR. The dataset is distributed as 42 compressed image batches (to enable manageable downloads) alongside a single consolidated JSON annotation file — devanagari_ocr.json. No fixed train/validation/test splits are provided, allowing you to create your own stratified splits based on your specific downstream tasks. Total size: ~58 GB (images) + annotations.

提供机构:
himalaya-ai
搜集汇总
数据集介绍
himalaya-ai/devanagari_ocr_dataset 数据集图片
构建方式
该数据集汇聚了7个公开的天城文OCR数据集,经过精细的脚本纯净度筛选与清洗后,重构为ShareGPT对话格式。原始图像数据被压缩为42个批次(约58 GB),并配以统一的JSON标注文件。数据集的构建旨在服务于视觉语言模型的微调,采用无固定分割的设计,留予使用者根据下游任务自行构建分层样本划分。
特点
数据集涵盖尼泊尔语、印地语、马拉地语、梵语及巴利语,主要聚焦于印刷体页面文字识别,同时包含手写单词、数字识别及文档理解等多样化子任务。其以ShareGPT结构组织样本,每条记录包含图像路径和标准的人机对话,其中人类指令固定为图像标记附以文字识别提示,模型回答则为真实文本转录。
使用方法
推荐使用Python语言结合PIL与scikit-learn库完成数据加载与分割。首先解压所有图像批次至统一目录,随后利用兼容JSON数组与JSONL格式的加载函数读取标注文件。使用者可依据随机种子构建训练集、验证集与测试集以实现可复现的实验配置,亦可依据元数据中的语言标签过滤特定语言子集进行定向评估。
背景与挑战
背景概述
天城文作为印度-雅利安语支的核心书写系统,广泛应用于尼泊尔语、印地语、马拉地语、梵语及巴利语等多语言场景,承载着南亚次大陆深厚的文化遗产。然而,现有光学字符识别(OCR)研究多聚焦于拉丁语系,针对天城文的公开数据集往往分散、规模有限且格式不一,难以支撑现代视觉语言模型(VLM)的大规模微调需求。2026年,himalaya-ai机构精心整合了7个公开的天城文OCR数据集,剔除重复样本后,重新封装为统一的ShareGPT对话格式,发布了devanagari_ocr_dataset。该数据集包含约58GB的图像与注释文件,覆盖印刷体页面识别、手写词级识别、数字识别及文档布局理解等多样化任务,显著提升了天城文OCR资源的完整性与可用性,为多语言文档数字化、梵语巴利文古籍整理及区域语言AI应用提供了关键基础。
当前挑战
首先,天城文字符结构复杂,存在大量连字、变音符号及垂直粘合形态,传统OCR模型在无额外上下文支持时,字符分割与识别错误率居高不下,尤其是手写体与低质量移动端图像中的模糊字形构成严峻挑战。其次,该数据集构建过程面临多重困难:来自7个源头的数据具有迥异的标注粒度(词级、行级、页面级)、图像分辨率与扫描条件,需设计统一的预处理流水线以清洗脚本纯度并过滤非天城文字符。此外,混合数字子集中包含拉丁数字,而部分梵语/巴利语样本的词汇模式与现代语言差异显著,若直接用于语言语义任务可能导致偏差。最终,58GB的大体量与未预设固定分割要求用户自行构建分层采样策略,如何在保持领域平衡的同时避免数据泄露成为可重复性实验的关键技术障碍。
常用场景
经典使用场景
在天城文光学字符识别(OCR)研究领域,该数据集最为经典的使用场景是用于微调视觉语言模型(VLM),尤其是针对天城文书写的图像到文本生成任务。数据集采用ShareGPT对话格式组织,每个样本包含一张天城文图像和对应的文本转录对,天然适配于多模态大模型的指令微调范式。研究者可利用该数据集训练模型从端到端地完成天城文印刷体与手写体的识别,涵盖梵文、尼泊尔语、印地语、马拉地语等多种语言的文字变体。其大规模、高纯净度的天城文字符标注,为基于注意力机制的序列到序列模型、尤其是GLM-OCR类架构的性能提升提供了可靠训练基础。
实际应用
在实际应用层面,该数据集直接服务于尼泊尔语、印地语、马拉地语等天城文文档的自动化数字化流程。企业和政府机构可基于微调后的OCR模型,高效地将历史手稿、古籍佛经、现代印刷出版物等纸质内容转化为可搜索的电子文本,大幅减少人工誊录成本。在图书馆数字化、文化遗产保护、南亚地区政务服务等领域,该数据集驱动的OCR工具能准确识别梵文佛经与印度合同法典中的特殊字符,辅助构建多语种文档管理系统。此外,混合拉丁数字的去除与纯天城文字符过滤能力,使其在车牌识别、表单自动化填单等垂直场景中展现出实用价值。
衍生相关工作
围绕该数据集衍生出的经典工作主要集中在两大方向:一是基于多模态大模型的天城文OCR基准测试,研究者利用其丰富语种覆盖与统一标注格式,系统评估了GLM-4V、Qwen-VL等主流视觉语言模型在印度次大陆文字识别上的零样本与微调性能,揭示了当前模型在梵文连写字符识别上的能力短板。二是面向低资源语言的指令微调策略探索,相关工作对比了全参数微调与LoRA等参数高效微调方法在天城文OCR任务上的效果差异,并引入字符级对比学习损失以提升对形近字符的判别能力。此外,该数据集还被用作数据增强模板,启发研究者基于ShareGPT格式构建面向孟加拉文、泰卢固文等其他婆罗米系文字的OCR编译数据集,推动了南亚多语言文字识别生态的协同发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务