DocForge
收藏官方服务:
资源简介:
Extract structured data from any PDF, image, or Office file. Templates, custom schemas, confidence scores and more. 50 files free.
创建时间:
2026-08-19
原始信息汇总
DocForge 数据集详情总结
DocForge 是一个智能文档处理(IDP)API,能够将PDF、图片、Office文件或纯文本等各类文档转换为结构化数据,并为每个字段提供置信度评分和算术一致性校验。该API支持7种输出格式(JSON、CSV、XLSX、XML、YAML、Markdown、纯文本)。
API基本信息
- 类别:文本分析(Text Analysis)
- 服务级别:100%
- 延迟:1077ms
- 测试通过率:100%
- 创建者:Matthew Hayes
- 订阅者数:1
核心功能
五种提取模式
| 模式 | 参数 | 说明 |
|---|---|---|
| 模板 | template |
提供95个预构建模板(发票、收据、提单、税务表格等) |
| 表格布局 | schema_id |
上传Excel/CSV定义列标题,按列名提取 |
| JSON Schema | schema |
自定义字段定义,输出按Schema验证(ULTRA+计划) |
| 指令 | instructions |
直接用自然语言描述提取需求 |
| 自动检测 | 无需参数 | 自动识别文档类型 |
三种结果获取方式
- 同步模式(推荐):添加
?wait=1参数,单次请求返回完整结果(最长40秒),每个文档消耗1次请求 - 异步模式:立即返回
task_id,通过轮询GET /status/{task_id}获取结果,每个文档消耗4-6次请求 - Webhook:传递
callback_url,结果完成后自动POST推送,使用HMAC-SHA256签名验证
主要特性
- 95个预构建提取模板,所有计划均支持表格布局
- 字段级置信度评分:分数0-100,等级分为高(80+)/中(50+)/低,可路由低置信度结果到人工审核
- 算术一致性检查:验证小计+税=总计、行项目求和及财务文档余额对账
- OCR预处理:支持暗色表头反转和伪影去噪,优化手机拍摄照片和旧扫描件
- 多页和大文档原生支持:分块提取,无截断、无数据丢失
- 零数据留存:文档仅在RAM中处理,不写入磁盘,不用于模型训练
支持的文件格式
PDF、JPG、PNG、TIFF、BMP、DOCX、PPTX、HTML、Markdown、TXT,最大25MB(免费计划为5MB)
API端点
| 端点 | 用途 |
|---|---|
POST /api/v1/extract?wait=1 |
同步提取(单次请求) |
POST /api/v1/extract |
异步提取(返回task_id) |
GET /api/v1/status/{task_id} |
轮询结果 |
GET /api/v1/templates?fields=true |
查看95个模板及字段定义 |
POST /api/v1/schema/from-spreadsheet |
从Excel/CSV表头创建布局 |
GET /api/v1/health |
服务健康检查(无需认证) |
定价计划
| 计划 | 月费 |
|---|---|
| BASIC | $0.00 |
| PRO | $39.00 |
| ULTRA | $115.00 |
| MEGA | $345.00 |
错误码说明
400输入错误401密钥错误403计划功能限制413文件过大415不支持的文件类型429配额超限503服务暂时不可用
额外说明
- 配额按请求数计算,使用同步或Webhook模式时1个文档=1次请求
- 同一文档同一模式产生相同结果(确定性,温度0)
- 完整文档:https://docforge.biz/docs
- 真实提取效果展示:https://docforge.biz/what-to-expect
- 支持邮箱:hello@docforge.biz



