OCR
收藏官方服务:
资源简介:
Extract texts from images
创建时间:
2026-08-16
原始信息汇总
数据集概述:OCR API
该数据集对应的API服务为 OCR API,由 Jim He 创建,归类于 Text Analysis 类别,目前拥有 1位订阅者。API旨在通过单次调用从图像和PDF文档中提取干净、结构化的文本,无需手动指定语言或选择模型。
核心功能与优势
- 零配置:单一端点,仅需一个
file字段,无需语言标记或模型选择。 - 多语言支持:内置 7种语言(英语、简体中文、繁体中文、日语、韩语、俄语、印地语、阿拉伯语),并能处理同一文档中的混合脚本。
- 逐行语言标注:每个文本行返回检测到的语言及置信度,便于路由、记录或QA。
- 图像与PDF统一处理:支持PNG、JPG/WebP/BMP图像及多页PDF,结果按页分组并可扁平化为单一文本。
- 保留阅读顺序:文本按上到下、左到右返回,附带每行四边形坐标,便于布局重建。
- RTL支持:阿拉伯语按真实阅读顺序返回,无需手动反转。
- 快速CPU推理:使用
ppocrv6_tiny模型,单张图像在单vCPU上平均处理时间约 0.4秒。 - 结构化输出:每行返回文本、置信度、四边形框坐标、语言和页码,以及文档级
detected_language。
适用场景
- 发票与收据:提取总额、税额、供应商、货币符号。
- 合同与文件:搜索、索引、字段提取。
- 多语言内容:如日文手册、韩文/繁体中文产品标签、俄/德文通信。
- PDF数字化:将扫描PDF转换为可搜索文本。
- 文档QA/脱敏管道:通过置信度+坐标筛选高质量行或遮盖敏感信息。
- UI自动化与本地化:利用OCR坐标输出进行点击/验证。
使用说明
- 获取API密钥:订阅任意计划(免费版可用),从代码片段选项卡复制
X-RapidAPI-Key。 - 调用端点:
POST /v1/ocr,请求参数为文件字段file,支持PNG、JPG/JPEG、WebP、BMP或PDF格式。 - 解析JSON响应:包含
detected_language、text、results[]、pages[]、duration_ms等字段。
限制
| 项目 | 限制值 |
|---|---|
| 最大文件大小 | 25 MB |
| 最大PDF页数 | 每PDF最多20页 |
| 最大图像边 | 宽/高超过1600 px时自动缩小 |
错误码
| 代码 | 含义 |
|---|---|
| 400 | 文件不可读或为空 |
| 413 | 文件超过25 MB |
| 422 | 无效的multipart表单数据 |
| 429 | 超出计划速率/配额 |
| 503 | 引擎预热中(从零扩容),请稍后重试 |
定价计划
| 计划 | 价格/月 | 请求数/月 | 速率 |
|---|---|---|---|
| FREE | $0 | 100 | 1 req/s |
| STARTER | $9 | 5,000 | 5 req/s |
| PRO | $49 | 50,000 | 10 req/s |
| SCALE | $149 | 200,000 | 25 req/s |
| ENTERPRISE | $499 | 1,250,000 | 50 req/s |
所有计划均包含完整多语言模型集和PDF支持。付费套餐超量按每1000次额外请求计费。



