遇见数据集

DocForge

收藏
RapidAPI2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

Extract structured data from any PDF, image, or Office file. Templates, custom schemas, confidence scores and more. 50 files free.

创建时间:
2026-08-19
原始信息汇总

DocForge 数据集详情总结

DocForge 是一个智能文档处理(IDP)API,能够将PDF、图片、Office文件或纯文本等各类文档转换为结构化数据,并为每个字段提供置信度评分和算术一致性校验。该API支持7种输出格式(JSON、CSV、XLSX、XML、YAML、Markdown、纯文本)。

API基本信息

  • 类别:文本分析(Text Analysis)
  • 服务级别:100%
  • 延迟:1077ms
  • 测试通过率:100%
  • 创建者:Matthew Hayes
  • 订阅者数:1

核心功能

五种提取模式

模式 参数 说明
模板 template 提供95个预构建模板(发票、收据、提单、税务表格等)
表格布局 schema_id 上传Excel/CSV定义列标题,按列名提取
JSON Schema schema 自定义字段定义,输出按Schema验证(ULTRA+计划)
指令 instructions 直接用自然语言描述提取需求
自动检测 无需参数 自动识别文档类型

三种结果获取方式

  1. 同步模式(推荐):添加 ?wait=1 参数,单次请求返回完整结果(最长40秒),每个文档消耗1次请求
  2. 异步模式:立即返回 task_id,通过轮询 GET /status/{task_id} 获取结果,每个文档消耗4-6次请求
  3. Webhook:传递 callback_url,结果完成后自动POST推送,使用HMAC-SHA256签名验证

主要特性

  • 95个预构建提取模板,所有计划均支持表格布局
  • 字段级置信度评分:分数0-100,等级分为高(80+)/中(50+)/低,可路由低置信度结果到人工审核
  • 算术一致性检查:验证小计+税=总计、行项目求和及财务文档余额对账
  • OCR预处理:支持暗色表头反转和伪影去噪,优化手机拍摄照片和旧扫描件
  • 多页和大文档原生支持:分块提取,无截断、无数据丢失
  • 零数据留存:文档仅在RAM中处理,不写入磁盘,不用于模型训练

支持的文件格式

PDF、JPG、PNG、TIFF、BMP、DOCX、PPTX、HTML、Markdown、TXT,最大25MB(免费计划为5MB)

API端点

端点 用途
POST /api/v1/extract?wait=1 同步提取(单次请求)
POST /api/v1/extract 异步提取(返回task_id)
GET /api/v1/status/{task_id} 轮询结果
GET /api/v1/templates?fields=true 查看95个模板及字段定义
POST /api/v1/schema/from-spreadsheet 从Excel/CSV表头创建布局
GET /api/v1/health 服务健康检查(无需认证)

定价计划

计划 月费
BASIC $0.00
PRO $39.00
ULTRA $115.00
MEGA $345.00

错误码说明

  • 400 输入错误
  • 401 密钥错误
  • 403 计划功能限制
  • 413 文件过大
  • 415 不支持的文件类型
  • 429 配额超限
  • 503 服务暂时不可用

额外说明

  • 配额按请求数计算,使用同步或Webhook模式时1个文档=1次请求
  • 同一文档同一模式产生相同结果(确定性,温度0)
  • 完整文档:https://docforge.biz/docs
  • 真实提取效果展示:https://docforge.biz/what-to-expect
  • 支持邮箱:hello@docforge.biz
二维码
社区交流群
二维码
科研交流群
商业服务