SmartSchema Extract API
收藏官方服务:
资源简介:
Convert unstructured text to validated JSON using AI. Define any JSON Schema per request. Extract data from invoices, emails, HTML, PDFs.
创建时间:
2026-06-09
原始信息汇总
SmartSchema Extract API 数据集详情
核心功能:将非结构化文本(如网页HTML、原始PDF文本、邮件、转录日志)转换为严格验证的JSON对象。它利用Google Gemini的原生结构化输出,实现99.99%的Schema合规率,消除了对脆弱正则表达式或自定义解析器的依赖。
关键性能指标:
- 中位响应时间:使用优化的
gemini-2.5-flash-lite模型,低于400ms。 - 准确率:对提供的JSON Schema(Draft-07兼容)结构的遵循率为99.9%。
- 零幻觉保护:开启
strict_mode: true后,对缺失字段返回null而非推断值,确保数据事实完整性。 - 规模容量:在Business层级,单次请求支持高达100,000字符的输入。
核心应用场景:
- 电子商务与Web爬取:将非结构化的爬取HTML标准化为清晰、可比较的产品记录(含数组、对象、数字、布尔值)。
- 文档与发票处理:将发票、收据、合同中的原始OCR文本转换为结构化数据库,实现准确的税额和汇总金额提取。
- 邮件自动化与实体识别:直接从邮件正文提取会议日期、联系方式、采购订单号和行动项,以触发自动化CRM工作流。
工作原理:
- 发送请求:在请求体中提交原始非结构化文本和目标JSON Schema。
- AI提取:工作进程使用原生JSON输出配置,将请求转发至Google Gemini API。
- 结构化响应:收到严格验证的JSON负载,完全匹配所要求的Schema结构。
请求示例: json { "text": "Order #1042 placed on June 3rd 2025. Customer: Alice Johnson. Total: $149.99. Status: shipped.", "schema": { "type": "object", "properties": { "order_id": {"type": "string"}, "customer_name": {"type": "string"}, "total_amount": {"type": "number"}, "status": {"type": "string"} }, "required": ["order_id", "customer_name"] } }
价格方案:
- BASIC: $0.00/月
- PRO: $19.00/月
- ULTRA: $49.00/月
- MEGA: $149.00/月
API端点:
- 提取端点:
POST /extractData



