遇见数据集

ParseRAG

收藏
RapidAPI2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

Turn any PDF into embedding-ready JSON chunks for your RAG pipeline: column-aware text, headers and footers stripped, tables as structured JSON, OCR fallback for scans, and a confidence score on every chunk.

创建时间:
2026-08-30
原始信息汇总

ParseRAG 数据集 API 详情

API 概述

ParseRAG 是一个将 PDF 文档转换为可直接用于嵌入(embedding)的干净、结构化 JSON 数据的 API。该服务提供一个端点(POST /api/v1/parse),用户只需上传 PDF 文件,即可获得分块(chunks)列表,每个分块都可用于向量存储。

  • API 版本:1.0.0(当前)
  • 类别:Text Analysis
  • 提供商:ParseRAG
  • 订阅者:2
  • 人气指数:9.1
  • 服务级别:100%
  • 延迟:334ms

核心功能

  1. 阅读顺序保持:支持多栏布局,按页面实际列结构逐段组装文本。若检测到交错列的痕迹,会重新拆分页面。
  2. 去除重复页眉页脚:通过三种堆叠检测器(几何重复、样板模式、密度聚类)去除运行标题、DOI 行和页码。
  3. 表格结构化输出:将表格输出为结构化 JSON,包含 headersrows 以及发现时的标题(caption)。质量门控决定是否需要视觉模型重新读取断开的网格。
  4. 扫描页处理:纯图像页面由视觉模型处理,而非返回空结果。
  5. 置信度评分:每个分块带有置信度分数和 manual_review_needed 标志,防止低质量页面被静默索引。

响应结构

响应包含以下顶层字段:

字段 类型 描述
document_id string 本次解析生成的标识符
pages integer 读取的页数
language string ISO 639-1 语言代码(fr/en/de/es/unknown)
processing_ms integer 服务端处理时间(毫秒)
chunks array 分块数组,按页排序
status string 成功时为 "ok"

每个分块包含:

字段 类型 描述
id string 文档内顺序编号
text string 分块文本(TABLE 类型时为管道符分隔的行)
type enum PARAGRAPHTABLEFIGURE_CAPTIONHEADER_ARTIFACT
page integer 1-based 页码
confidence number 0-1 之间的置信度
fallback_used boolean 是否由视觉模型生成(扫描页或无法读取的表格)
manual_review_needed boolean 置信度低于阈值时标记为需人工审查
table_json object 仅 TABLE 分块包含,见下

表格 JSON 结构(table_json)包括 caption(可选)、headers(字符串数组)和 rows(等长行数组)。

技术约束

约束
最大文件大小 50 MB(所有计划)
最大页数 取决于计划
内容类型 application/pdfapplication/octet-stream(PDF 签名会被验证)
解析方式 同步,需设置较长的客户端超时(建议 5 分钟)

收费计划

计划 月请求数 每分钟请求数 每文档页数上限
BASIC 50 2 100
PRO 1,000 5 300
ULTRA 7,500 10 500
MEGA 50,000 20 1,000

错误处理

错误以统一格式返回(包含 error 代码、message 和 HTTP status)。支持重试的错误包括:

  • RATE_LIMIT_EXCEEDED(429)- 按 Retry-After 提示等待
  • SERVICE_BUSY(503)
  • DATABASE_UNAVAILABLE(503)
  • INTERNAL_ERROR(500)

不可重试的错误包括:MISSING_FILEINVALID_FILE_FORMATUNSUPPORTED_MEDIA_TYPEFILE_TOO_LARGEPDF_UNREADABLEDOCUMENT_TOO_LONG(需拆分 PDF 或升级计划)、NOT_FOUND

其他说明

  • 文档隐私:文档不会被存储,仅在请求期间在内存中处理,不记录日志或用于训练。OCR 页面会发送至第三方视觉模型提供商进行转录,不保留。
  • 分块大小:约为 2,000 字符的窗口(约 512 tokens),重叠 100 字符,确保分割的句子仍可检索。
  • 语言支持:文本提取与语言无关,语言检测支持 fr、en、de、es。
  • 使用建议:建议在索引前过滤掉 manual_review_needed 的分块;保留 pagedocument_id 作为元数据;TABLE 分块的 text 可直接嵌入,table_json 可用于渲染;HEADER_ARTIFACT 分块通常可丢弃。
二维码
社区交流群
二维码
科研交流群
商业服务