DocuCleanse
收藏官方服务:
资源简介:
Layout-aware PDF to Markdown parsing API for LLM and RAG pipelines. Fixes scrambled columns, broken tables, and lost equations.
创建时间:
2026-06-17
原始信息汇总
DocuCleanse 数据集概述
基本描述
DocuCleanse 是一个高性能、保留布局的PDF解析API,专为AI开发者、RAG流水线和LLM应用设计。它通过单次POST请求,解决标准PDF解析器常见的文档结构破坏问题,如多栏顺序错乱、表格关系丢失、数学公式和希腊符号无法识别等。
核心功能
- 布局感知解析:正确处理多栏布局(如学术论文、报告),保持自然阅读顺序。
- 表格重建:将打散的PDF表格数据恢复为干净的GitHub-Flavored Markdown表格。
- 公式处理:将数学公式和希腊符号包裹在LaTeX分隔符中,便于LLM读取。
- 扫描件支持:对于纯图像页面,通过Google Tesseract OCR处理,并给出置信度分数。
输出结果
每个响应包含:
- 清理后的结构化 Markdown,可直接用于LLM。
- JSON blocks数组,包含类型、页码和边界框信息,适用于RAG流水线。
- 每页的 置信度分数。
- 提取方法:原生 / OCR / 混合。
- 处理时长(毫秒)。
- SHA-256缓存:重复上传可在3毫秒内返回结果。
可用端点
POST /v1/parse-file— 上传并解析PDF文件POST /v1/parse-url— 从公共URL解析PDFGET /v1/metadata— 提取PDF元数据GET /v1/health— 健康检查
性能与价格对比
| 特性 | DocuCleanse | LlamaParse | Unstructured.io |
|---|---|---|---|
| 价格 | $19/月 | $50/月 | 企业级 |
| 框架锁定 | 无 | 需使用LlamaIndex | 无 |
| 确定性输出 | 是 | 否(基于LLM) | 部分 |
| 速度 | ~200毫秒/页 | 秒级 | 秒级 |
订阅方案
- BASIC:$0.00 /月
- PRO:$19.00 /月(推荐)
- ULTRA:$79.00 /月
提供商信息
- 创建者:Arjun Sharma
- 类别:文本分析
- 订阅数:1
- 资源:产品网站



