遇见数据集

rc-parsing-dataset

收藏
Hugging Face2026-07-13 更新2026-07-14 收录
官方服务:

资源简介:

该数据集旨在为微调OCR模型以解析运价确认书类文档提供训练数据,以解决现有解析方案的延迟高、依赖外部服务和成本高昂问题,目标是训练快速、可本地部署的替代模型。数据集由结构化JSON文件组成,每个JSON对应一个原始PDF文档,涵盖物流文档的关键字段,如起运地、目的地、提货日期、送达日期、文件日期、总费用、货物重量、货物类型、提货单号、特殊说明和包含多个停靠点信息的列表(每个停靠点细分为原始类型、类型、地址、日期和时间)。初始源PDF文档共46个,专门用于文档信息抽取或OCR后处理模型的微调任务,以自动化从非结构化文档图像或PDF中提取结构化业务数据。

This dataset is designed to provide training data for fine-tuning OCR models to parse rate confirmation documents, addressing issues with existing parsing solutions such as high latency (2-5 seconds per document), reliance on external services (with uncertainties), and high costs when processing large volumes of documents, with the goal of training a fast, locally deployable alternative model. The dataset consists of structured JSON files, each corresponding to an original PDF rate confirmation document, covering key fields of such logistics documents, including origin, destination, pickup date, delivery date, document date, total rate, weight, commodity, pickup number, instructions, and a list of stops (each stop further subdivided into original type, type such as PICKUP, address, date, and time). There are 46 initial source PDF documents. It is specifically used for document information extraction or fine-tuning OCR post-processing models to automatically extract structured business data from unstructured document images or PDFs.

创建时间:
2026-07-11
原始信息汇总

数据集概述

该数据集用于微调OCR模型,以解析货运费率确认文件(Rate Confirmation文档)。其目标是训练一个快速、本地的模型,替代当前使用的NVIDIA API(速度慢、依赖外部服务、成本高)。

数据集结构与格式

  • 目录结构:项目包含rate_confirmations/目录(存放待处理的PDF文件,共46份)和dataset/目录(保存处理后的JSON输出)。
  • 数据集格式:每个PDF文件对应一个JSON文件,JSON结构如下:
    • source_file: 源PDF文件名。
    • parsed: 解析后的结构化数据,包含以下字段:
      • origin: 出发地。
      • dest: 目的地。
      • pu_date: 提货日期。
      • del_date: 交货日期。
      • document_date: 文档日期。
      • total_rate: 总费率。
      • weight: 货物重量。
      • commodity: 货物类型。
      • pickup_num: 提货编号。
      • instructions: 特殊指令。
      • stops: 停靠点数组,每个元素包含raw_type(原始类型)、type(类型)、address(地址)、date(日期)、time(时间)。

数据处理与工具

  • 主要脚本gather_dataset.py,负责读取PDF文件,调用本地OCR模型进行解析,并将结果保存为JSON。
  • OCR引擎:主引擎为本地llama-server(Tailscale地址:100.75.222.32:8081 或本地localhost:8080),备用引擎为Tesseract(通过fairy_vision.py实现)。
  • 使用方式
    • 安装依赖:pip install -r requirements.txt
    • 列出可用模型:python gather_dataset.py --list-models
    • 处理所有新文件:python gather_dataset.py
    • 处理特定文件:python gather_dataset.py --file "RateConfirmation.pdf"
    • 重新处理所有文件:python gather_dataset.py --reprocess
    • 指定模型:python gather_dataset.py --model "qwen/qwen3.5-122b-a10b"
  • 运行环境要求:Python 3.11+,PyMuPDF、httpx、Pillow、pytesseract等依赖。

数据来源与用途

  • 数据来源:PDF文件从newbot/test_rcs目录复制而来,共46份,均为费率确认文档(Rate Confirmations)。
  • 用途:用于微调本地OCR模型,实现快速、离线、低成本的文档结构化解析,降低对NVIDIA API的依赖。
搜集汇总
数据集介绍
rc-parsing-dataset 数据集图片
构建方式
该数据集专为OCR模型的微调与解析任务而构建,聚焦于Rate Confirmation类型文档的结构化信息提取。构建流程首先通过本地llama-server或NVIDIA API对PDF文档进行解析,利用适应于本地服务器的解析器rc_parser.py提取关键字段,同时集成Tesseract作为OCR降级方案以处理解析失败的情形。主控脚本gather_dataset.py负责遍历存放于rate_confirmations目录下的PDF文件,将提取结果以JSON格式保存至dataset文件夹中,每个JSON文件包含源文件名及解析后的结构化数据,如起运地、目的地、日期、运费等字段。数据集支持增量处理与重新处理模式,并可指定不同的解析模型,从而灵活适应多样化的文档样本。
特点
该数据集具有明确的领域针对性,专门针对物流行业中常用的Rate Confirmation文档,涵盖了起源地、目的地、运输日期、总运费、货物重量、商品类型、指令信息及多站点明细等关键字段。其结构化JSON格式清晰而完备,能够直接用于训练OCR模型进行细粒度信息抽取。数据集的构建高度依赖本地化服务,通过llama-server实现低延迟解析,同时保留了Tesseract作为备份引擎,确保在复杂文档或服务不可用时仍能获得有效结果。此外,数据集支持选择性处理与模型切换,具备灵活扩展与持续集成的潜力。
使用方法
使用该数据集进行模型微调前,需确保本地环境满足Python 3.11+及PyMuPDF、httpx、Pillow、pytesseract等依赖库的安装,并运行llama-server(默认连接Tailscale地址100.75.222.32:8081或localhost:8080)。通过执行gather_dataset.py脚本,用户可选择列出可用模型、处理全部新增PDF文件、指定单个文件或强制重新处理所有文档。处理完成后,解析结果将自动存储为JSON文件,可直接作为标注数据用于后续OCR模型的监督学习或评估。推荐的微调策略为基于预训练OCR模型,以数据集中结构化字段为目标进行序列标注或键值对提取训练。
背景与挑战
背景概述
rc-parsing-dataset(即Rate Confirmation Parsing Dataset)由开发者于2025年创建,旨在解决物流领域中费率确认单(Rate Confirmation)的结构化信息提取问题。该数据集聚焦于OCR模型微调,核心研究问题是如何从PDF文档中高效、准确地解析关键字段,如起运地、目的地、提货与交付日期、总运费、重量、商品类别及运输指令等。该数据集提供了46份已标注的JSON格式样本,覆盖了真实场景中格式多样、元素复杂的票据,其构建背景源于生产环境中NVIDIA API解析方案的高延迟(每文档2-5秒)、成本高昂及潜在的服务不可靠性。通过将标注数据集用于微调本地部署的轻量级光学字符识别模型,该项目旨在实现更快速、经济且可控的文档解析能力,对物流自动化与中小规模企业的智能化票据处理具有重要的实践意义。
当前挑战
该数据集所解决的领域问题核心在于非结构化PDF文档向结构化数据的自动转换挑战,具体包括:物流票据中字段位置不固定、表格式与自由文本混排、日期与金额格式多变,以及因扫描质量差异导致的光学字符识别精度下降。构建过程中面临多重现实约束,如依赖本地llama-server的推理能力,需处理服务器超时与模型返回的不一致结果;源文档仅含46份样本,数据量有限且来源单一,可能无法覆盖所有票据样式;此外,需兼容Tesseract OCR作为回退方案,以应对主解析器因模型不可用或API失效时的处理中断问题。这些挑战共同构成了对数据增强、错误处理机制及跨模型泛化性能的严峻考验。
常用场景
经典使用场景
rc-parsing-dataset专为从费率确认文件(Rate Confirmation)中抽取关键结构化信息而设计,广泛应用于物流与运输领域的文档解析任务。该数据集聚焦于从PDF格式的费率确认单中提取装运地、目的地、提货日期、交付日期、货物重量、商品类型、总运费及备注说明等核心字段,并支持多站点停靠信息的细粒度结构化呈现。经典用法是将该数据集用于微调OCR模型,使其能够高效、准确地将非结构化的费率确认文档转化为机器可读的JSON格式数据。研究者通常使用该数据集训练轻量化的本地部署模型,以替代对云端API的依赖,从而在控制成本的同时提升数据提取的实时性与稳定性。
实际应用
在实际生产环境中,rc-parsing-dataset主要服务于物流与货运代理公司自动化处理费率确认单的业务流程。企业可基于该数据集微调本地OCR模型,将其嵌入内部业务系统(如自动结算、运单审核或合规检查环节),实现批量PDF文件的秒级结构化解析,从而替代人工录入或昂贵的高延迟云端API。此外,该数据集还可用于构建物流文档的智能归档系统,自动提取关键日期、运单号、费用明细和停靠点信息,与仓储管理系统(WMS)或运输管理系统(TMS)无缝对接。在分布式运输网络与多式联运场景中,该数据集支持的本地化部署方案保障了数据隐私与操作实时性,显著提升了上下游合作伙伴之间的信息流转效率。
衍生相关工作
rc-parsing-dataset的发布催生了一系列领域细粒度的文档解析工作。例如,研究者在其基础上扩展标注了费率确认单中的费率条款变更与附加服务费用字段,构建了金融级别合规检查的专用数据集;也有团队借鉴其标注结构与微调流程,针对提单(Bill of Lading)、装箱单(Packing List)和商业发票(Commercial Invoice)等物流关联文档开发了统一的多模态解析框架。此外,部分工作聚焦于将其作为评测基准,对比不同OCR模型(如Tesseract、EasyOCR与PaddleOCR)在物流文档上的微调效果,并探索基于指令微调(instruction-tuning)的文档问答范式。这些衍生工作不仅验证了该数据集在迁移学习与多任务联合训练中的基础性价值,也推动了物流领域文档智能管线的标准与演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务