遇见数据集

Clean Extract

收藏
RapidAPI2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

Turn any web page into clean, structured JSON — title, author, date, readable text with boilerplate stripped out

创建时间:
2026-08-05
原始信息汇总

数据集概述:Clean Extract

Clean Extract 是一个由开发者 muscaiu 提供的免费文本分析类API,当前版本为0.1.0。该API的核心功能是将任意网页转换为干净、结构化的JSON格式数据,便于开发者提取网页中的关键信息。

主要功能

  • 网页内容提取:输入网页地址,API会自动去除页面的样板内容(如导航、广告、页脚等),保留核心可读文本。
  • 结构化JSON输出:输出格式包含以下字段:
    • 标题(title)
    • 作者(author)
    • 发布日期(date)
    • 可读正文(readable text)
  • 用途:适用于文本分析、内容抓取、数据挖掘等场景,帮助开发者快速获取网页的语义化内容。

技术信息

  • API版本:0.1.0(当前版本)
  • 端点:提供extract端点(用于内容提取)以及meta端点的健康检查接口(health_health_get)。
  • 所属分类:Text Analysis(文本分析)

使用与社区

  • 定价:免费
  • 订阅者数量:1位订阅者
  • 试用方式:可通过“Playground”直接在线测试不同端点,体验API效果。
  • 联系支持:注册后可联系API提供者获取更多支持。

注意事项

  • API当前订阅者较少,可能处于早期发布阶段。
  • 使用前建议先通过Playground充分测试,以确保输出符合您的数据解析需求。
二维码
社区交流群
二维码
科研交流群
商业服务