遇见数据集

Multimodal Transkrip

收藏
RapidAPI2026-07-16 更新2026-07-10 收录
官方服务:

资源简介:

Advanced multimodal transcription API that extracts text, emotions, and visual context from videos

创建时间:
2026-07-16
原始信息汇总

数据集概述:Multimodal Transkrip

这是一个高级多模态转录API,能够提取文本、情感和视觉上下文信息。

核心功能

  • 多模态分析:通过单一API处理图像、音频和视频,返回详细、可读的分析结果。
  • 端点
    • POST /v1/analyze/image:描述/检测图像中的物体、文本和上下文。
    • POST /v1/analyze/audio:转录音频内容、总结语气和显著声音。
    • POST /v1/analyze/video:逐场景描述视频内容。
    • POST /v1/analyze/multimodal:在单个请求中组合图像、音频和视频,进行统一分析。
    • GET /health:检查服务状态。
  • 可定制分析:所有分析端点支持可选的 prompt 字段,用于指定分析重点(例如“仅关注可见文本”或“总结情感基调”)。
  • 字幕格式输出:为 /v1/analyze/video/v1/analyze/multimodal 添加 format=srt 参数,可获得带时间戳的字幕格式分析,适用于场景索引、无障碍字幕或审核日志。

技术规格与限制

  • 文件大小:图像最大50MB,音频/视频最大2GB。
  • 时长限制:视频最长60分钟,音频最长150分钟(可根据需求配置更高限制)。
  • 错误处理:服务器端自动重试瞬态错误(如AI后端过载),减少客户端重试需求。
  • 计费方式:基于实际媒体大小/时长按使用量计费,响应中包含 X-RapidAPI-Billing 头部。

适用场景

内容审核流水线、无障碍工具、视频索引/搜索、用户生成内容的市场研究、自动化媒体编目。

提供者信息

  • 创作者:Umar Syafiq
  • 类别:视觉识别(Visual Recognition)
  • 订阅者数:1
二维码
社区交流群
二维码
科研交流群
商业服务