ParseRAG
收藏官方服务:
资源简介:
Turn any PDF into embedding-ready JSON chunks for your RAG pipeline: column-aware text, headers and footers stripped, tables as structured JSON, OCR fallback for scans, and a confidence score on every chunk.
创建时间:
2026-08-30
原始信息汇总
ParseRAG 数据集 API 详情
API 概述
ParseRAG 是一个将 PDF 文档转换为可直接用于嵌入(embedding)的干净、结构化 JSON 数据的 API。该服务提供一个端点(POST /api/v1/parse),用户只需上传 PDF 文件,即可获得分块(chunks)列表,每个分块都可用于向量存储。
- API 版本:1.0.0(当前)
- 类别:Text Analysis
- 提供商:ParseRAG
- 订阅者:2
- 人气指数:9.1
- 服务级别:100%
- 延迟:334ms
核心功能
- 阅读顺序保持:支持多栏布局,按页面实际列结构逐段组装文本。若检测到交错列的痕迹,会重新拆分页面。
- 去除重复页眉页脚:通过三种堆叠检测器(几何重复、样板模式、密度聚类)去除运行标题、DOI 行和页码。
- 表格结构化输出:将表格输出为结构化 JSON,包含
headers、rows以及发现时的标题(caption)。质量门控决定是否需要视觉模型重新读取断开的网格。 - 扫描页处理:纯图像页面由视觉模型处理,而非返回空结果。
- 置信度评分:每个分块带有置信度分数和
manual_review_needed标志,防止低质量页面被静默索引。
响应结构
响应包含以下顶层字段:
| 字段 | 类型 | 描述 |
|---|---|---|
document_id |
string | 本次解析生成的标识符 |
pages |
integer | 读取的页数 |
language |
string | ISO 639-1 语言代码(fr/en/de/es/unknown) |
processing_ms |
integer | 服务端处理时间(毫秒) |
chunks |
array | 分块数组,按页排序 |
status |
string | 成功时为 "ok" |
每个分块包含:
| 字段 | 类型 | 描述 |
|---|---|---|
id |
string | 文档内顺序编号 |
text |
string | 分块文本(TABLE 类型时为管道符分隔的行) |
type |
enum | PARAGRAPH、TABLE、FIGURE_CAPTION 或 HEADER_ARTIFACT |
page |
integer | 1-based 页码 |
confidence |
number | 0-1 之间的置信度 |
fallback_used |
boolean | 是否由视觉模型生成(扫描页或无法读取的表格) |
manual_review_needed |
boolean | 置信度低于阈值时标记为需人工审查 |
table_json |
object | 仅 TABLE 分块包含,见下 |
表格 JSON 结构(table_json)包括 caption(可选)、headers(字符串数组)和 rows(等长行数组)。
技术约束
| 约束 | 值 |
|---|---|
| 最大文件大小 | 50 MB(所有计划) |
| 最大页数 | 取决于计划 |
| 内容类型 | application/pdf 或 application/octet-stream(PDF 签名会被验证) |
| 解析方式 | 同步,需设置较长的客户端超时(建议 5 分钟) |
收费计划
| 计划 | 月请求数 | 每分钟请求数 | 每文档页数上限 |
|---|---|---|---|
| BASIC | 50 | 2 | 100 |
| PRO | 1,000 | 5 | 300 |
| ULTRA | 7,500 | 10 | 500 |
| MEGA | 50,000 | 20 | 1,000 |
错误处理
错误以统一格式返回(包含 error 代码、message 和 HTTP status)。支持重试的错误包括:
RATE_LIMIT_EXCEEDED(429)- 按Retry-After提示等待SERVICE_BUSY(503)DATABASE_UNAVAILABLE(503)INTERNAL_ERROR(500)
不可重试的错误包括:MISSING_FILE、INVALID_FILE_FORMAT、UNSUPPORTED_MEDIA_TYPE、FILE_TOO_LARGE、PDF_UNREADABLE、DOCUMENT_TOO_LONG(需拆分 PDF 或升级计划)、NOT_FOUND。
其他说明
- 文档隐私:文档不会被存储,仅在请求期间在内存中处理,不记录日志或用于训练。OCR 页面会发送至第三方视觉模型提供商进行转录,不保留。
- 分块大小:约为 2,000 字符的窗口(约 512 tokens),重叠 100 字符,确保分割的句子仍可检索。
- 语言支持:文本提取与语言无关,语言检测支持 fr、en、de、es。
- 使用建议:建议在索引前过滤掉
manual_review_needed的分块;保留page和document_id作为元数据;TABLE 分块的text可直接嵌入,table_json可用于渲染;HEADER_ARTIFACT分块通常可丢弃。



