Multimodal Transkrip
收藏数据链接:
官方服务:
资源简介:
Advanced multimodal transcription API that extracts text, emotions, and visual context from videos
创建时间:
2026-07-16
原始信息汇总
数据集概述:Multimodal Transkrip
这是一个高级多模态转录API,能够提取文本、情感和视觉上下文信息。
核心功能
- 多模态分析:通过单一API处理图像、音频和视频,返回详细、可读的分析结果。
- 端点:
POST /v1/analyze/image:描述/检测图像中的物体、文本和上下文。POST /v1/analyze/audio:转录音频内容、总结语气和显著声音。POST /v1/analyze/video:逐场景描述视频内容。POST /v1/analyze/multimodal:在单个请求中组合图像、音频和视频,进行统一分析。GET /health:检查服务状态。
- 可定制分析:所有分析端点支持可选的
prompt字段,用于指定分析重点(例如“仅关注可见文本”或“总结情感基调”)。 - 字幕格式输出:为
/v1/analyze/video或/v1/analyze/multimodal添加format=srt参数,可获得带时间戳的字幕格式分析,适用于场景索引、无障碍字幕或审核日志。
技术规格与限制
- 文件大小:图像最大50MB,音频/视频最大2GB。
- 时长限制:视频最长60分钟,音频最长150分钟(可根据需求配置更高限制)。
- 错误处理:服务器端自动重试瞬态错误(如AI后端过载),减少客户端重试需求。
- 计费方式:基于实际媒体大小/时长按使用量计费,响应中包含
X-RapidAPI-Billing头部。
适用场景
内容审核流水线、无障碍工具、视频索引/搜索、用户生成内容的市场研究、自动化媒体编目。
提供者信息
- 创作者:Umar Syafiq
- 类别:视觉识别(Visual Recognition)
- 订阅者数:1



