Clean Extract
收藏官方服务:
资源简介:
Turn any web page into clean, structured JSON — title, author, date, readable text with boilerplate stripped out
创建时间:
2026-08-05
原始信息汇总
数据集概述:Clean Extract
Clean Extract 是一个由开发者 muscaiu 提供的免费文本分析类API,当前版本为0.1.0。该API的核心功能是将任意网页转换为干净、结构化的JSON格式数据,便于开发者提取网页中的关键信息。
主要功能
- 网页内容提取:输入网页地址,API会自动去除页面的样板内容(如导航、广告、页脚等),保留核心可读文本。
- 结构化JSON输出:输出格式包含以下字段:
- 标题(title)
- 作者(author)
- 发布日期(date)
- 可读正文(readable text)
- 用途:适用于文本分析、内容抓取、数据挖掘等场景,帮助开发者快速获取网页的语义化内容。
技术信息
- API版本:0.1.0(当前版本)
- 端点:提供
extract端点(用于内容提取)以及meta端点的健康检查接口(health_health_get)。 - 所属分类:Text Analysis(文本分析)
使用与社区
- 定价:免费
- 订阅者数量:1位订阅者
- 试用方式:可通过“Playground”直接在线测试不同端点,体验API效果。
- 联系支持:注册后可联系API提供者获取更多支持。
注意事项
- API当前订阅者较少,可能处于早期发布阶段。
- 使用前建议先通过Playground充分测试,以确保输出符合您的数据解析需求。



