遇见数据集

chujian-ocr-shiwen-20260901

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

本数据集为 OCR 释文三步流水线的交付结果,包含从古籍或文档图像中提取的识别文本。数据经过三步处理:首先使用百度 PaddleOCR-VL-1.5 进行保守首识,然后由 Qwen3-VL-4B-Instruct 对照页图和百度结果进行复核,最后使用 GPT-5.6 仅处理分歧、低置信和版式异常页,不对已一致页做语言润色。字段包括:`paddle_raw`(百度首识结果)、`qwen_review`(Qwen 复核结果)、`gpt_review`(GPT 处理结果)、`accepted_text`(最终接受文本)、`review_status`(审核状态)和 `source_sha256`(源文件 SHA-256 哈希)。对于古字图版、无码字和无法解释的分歧,必须放入 `quarantine` 目录,不得静默修改。资产详情、页数、SHA-256 与模型 revision 信息见 `HF_ASSET_MANIFEST_20260901.json` 文件。

This dataset is the delivery result of a three-step OCR transcription pipeline, containing recognized text extracted from ancient books or document images. The data undergoes three steps: first, conservative initial recognition using Baidu PaddleOCR-VL-1.5; second, review by Qwen3-VL-4B-Instruct against page images and Baidu results; third, GPT-5.6 is used only to handle discrepancies, low-confidence, and layout anomalies, without language polishing for consistent pages. Fields include: `paddle_raw` (Baidu initial recognition result), `qwen_review` (Qwen review result), `gpt_review` (GPT processing result), `accepted_text` (final accepted text), `review_status` (review status), and `source_sha256` (SHA-256 hash of source file). For ancient character plates, uncoded characters, and inexplicable discrepancies, they must be placed in the `quarantine` directory without silent modification. Asset details, page count, SHA-256, and model revision information are in the `HF_ASSET_MANIFEST_20260901.json` file.

创建时间:
2026-09-01
原始信息汇总

数据集概述

该数据集为“chujian-ocr-shiwen-20260901”,是一个针对2026年9月1日正式释文OCR任务的本地交付根目录,围绕文档OCR识别与人工复核构建了一套三步流水线处理流程。

处理流水线

  • 第一步(百度 PaddleOCR-VL-1.5):进行保守的初步识别;
  • 第二步(Qwen3-VL-4B-Instruct):对照页面图像与百度识别结果进行复核;
  • 第三步(GPT-5.6):仅处理存在分歧、低置信度或版式异常的页面,不对已达成一致的页面进行语言润色。

字段结构

每条识别结果按字段分离保存,具体包括:

  • paddle_raw:百度初识原始结果;
  • qwen_review:Qwen复核结果;
  • gpt_review:GPT处理结果;
  • accepted_text:最终接受的文本;
  • review_status:复核状态;
  • source_sha256:源文件哈希值。

特殊处理规则

对于古字图版、无码字以及无法解释的分歧,必须归入 quarantine(隔离区),严禁静默修改为通顺文字。

附加文件说明

数据集中包含 HF_ASSET_MANIFEST_20260901.json 清单文件,其中记录了资产详情、页数、SHA-256哈希值以及所使用模型的修订版本号等信息。

搜集汇总
数据集介绍
chujian-ocr-shiwen-20260901 数据集图片
构建方式
在古籍数字化与OCR技术交汇的背景下,该数据集通过三级递进式流水线构建释文。先由百度PaddleOCR-VL-1.5对原始图版进行保守首识,产出基础文本;继而以Qwen3-VL-4B-Instruct对照页图与首识结果复核,标记差异;最终由GPT-5.6仅处理分歧、低置信及版式异常页,避免对已一致内容进行语言润色。全过程分离保存各阶段输出,并记录来源SHA-256,无法解释的分歧或古字图版则进入隔离区,确保数据可追溯且不篡改原貌。
特点
该数据集显著特征在于多模型协同与严格的质量控制。其字段分离存储机制保留了每一阶段的原始输出与复核状态,便于溯源与审计。数据集将古字图版、无码字及无法解释的分歧强制隔离,杜绝静默通顺化,维护了文献的真实性。同时,资产清单提供页数、SHA-256与模型版本信息,增强了数据的完整性与可复现性,为古籍OCR研究提供了高可信度的基准资源。
使用方法
使用该数据集时,研究者可依据review_status字段筛选不同置信级别的文本,或直接采用accepted_text作为最终释文。通过对比paddle_raw、qwen_review与gpt_review,可分析各模型在古籍识别中的表现差异。隔离区数据适用于错误分析与模型改进。使用前应核对HF_ASSET_MANIFEST_20260901.json中的校验信息,确保数据完整性。该数据集适用于古籍OCR评测、多模型融合策略研究及低资源文本识别等任务。
背景与挑战
背景概述
古籍数字化与释文整理长期依赖人工校勘,效率低下且易受主观影响。2026年9月,针对正式释文OCR场景,chujian-ocr-shiwen-20260901数据集应运而生。该数据集由未知研究团队构建,核心研究问题在于如何通过多模型级联流水线实现高保真古籍文字的自动化释读,同时严格区分原始识别、交叉复核与仲裁输出。其创新性的三阶段(PaddleOCR-VL-1.5、Qwen3-VL-4B-Instruct、GPT-5.6)与字段分离设计,为古籍OCR领域提供了可追溯、可审计的基准资源,有望推动释文工作的标准化与可信化进程。
当前挑战
该数据集所解决的领域问题为古籍OCR中的高精度释文与分歧仲裁,其核心挑战在于:一、古字图版、无码字及不可解释分歧必须进入隔离区,不得静默修正,这对模型的不确定性建模提出严苛要求;二、三阶段流水线需在保持保守首识、对照复核与有限仲裁之间取得平衡,避免过度润色或漏检异常;三、构建过程中需严格分离paddle_raw、qwen_review、gpt_review等字段并核验SHA-256与模型revision,确保流程可复现与数据完整性。
常用场景
经典使用场景
在古籍数字化与智能文字识别领域,该数据集构筑了一套经典的三级OCR释文流水线范式。其核心使用场景在于:首先以百度PaddleOCR-VL-1.5完成对古籍页面的保守首识,继之引入Qwen3-VL-4B-Instruct模型对照原页图版进行复核,最终由GPT-5.6仅针对分歧、低置信度与版式异常页面进行裁决。这一流水线借助字段分离存储策略,将paddle_raw、qwen_review、gpt_review、accepted_text、review_status与source_sha256等各阶段结果逐一留存,既保障了释文过程的可追溯性,也使得整体识别准确率与可信度远超单一模型方案。
实际应用
在实际应用层面,该数据集为图书馆、档案馆及古籍整理出版机构提供了一套可直接部署的释文解决方案。其三步流水线能够在保证效率的前提下,显著降低人工校对成本,适用于大规模古籍善本的数字化工程。对于需要高可靠性文字提取的珍贵文献,该数据集所倡导的保守首识、交叉复核与分歧隔离机制,确保了释文成果能够直接用于学术引用与出版。此外,其资产清单与模型版本记录为长期维护与版本迁移提供了工程便利。
衍生相关工作
围绕该数据集,已衍生出若干经典工作方向。基于其三模型协作框架,研究者开发了面向甲骨文、敦煌遗书等特定古籍类型的自适应OCR流水线;其字段分离与隔离机制被后续工作扩展为通用古籍数据治理规范;部分研究以此为基础,探索了低资源古文字场景下的模型微调与知识蒸馏方法。该数据集所建立的复核与仲裁范式,亦被借鉴至碑刻、简帛等其它载体文献的智能识别任务中,形成了广泛的方法论影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务