遇见数据集

Live Voice Translator

收藏
RapidAPI2026-07-16 更新2026-07-14 收录
官方服务:

资源简介:

Real-time speech-to-speech translation across 70+ languages. Send audio (MP3, WAV, PCM16, M4A, OGG) and get back translated audio plus transcripts in seconds

创建时间:
2026-07-16
原始信息汇总

API 概述

Live Voice Translator 是一个实时语音到语音翻译 API,能够通过单次 API 调用实现音频翻译,无需单独串联语音识别、翻译和语音合成服务。

核心功能

  • 实时语音翻译:支持 70+ 种语言(使用标准 BCP-47 代码),输入一种语言的音频,直接输出目标语言的语音。
  • 多种音频格式支持:可发送 MP3、WAV、M4A、OGG、WebM 或原始 PCM16 格式的音频;输出支持 MP3 或 PCM16 格式。
  • 附带文本转录:每次响应均包含原始音频的识别文本和翻译后的文本,便于显示字幕或记录对话。
  • 快速响应:专为短语音片段设计(最长 20 秒),适合语音消息、应用内语音笔记和短语翻译。
  • 多模态分析能力:API 不仅能处理文本,还能分析音频语调等,提供深度多模态洞察。

主要端点

  • POST /v1/translate-file:主端点,发送完整音频片段,单次响应返回完整翻译结果。
  • 会话流端点(进阶):POST /v1/session/startPOST /v1/session/{id}/audioPOST /v1/session/{id}/end,适用于边录制边传输音频的场景。

请求与响应

  • 请求字段
    • audioBase64(必填):Base64 编码的音频数据。
    • audioFormat(可选):音频格式,默认 pcm16,支持 mp3wavm4aoggwebmauto(自动检测)。
    • targetLanguageCode(必填):目标语言 BCP-47 代码(如 idenesjakozh-Hans 等)。
    • echoTargetLanguage(可选):默认为 true,若输入音频已是目标语言则回传原音频。
    • outputFormat(可选):输出音频格式,默认 pcm16,推荐 mp3
  • 响应字段
    • translatedAudioBase64:Base64 编码的翻译后音频。
    • outputFormat:输出音频格式。
    • inputTranscript:原始音频的识别文本。
    • outputTranscript:翻译后的文本。

支持的语言

支持包括但不限于:印尼语、英语、西班牙语、葡萄牙语、法语、德语、意大利语、荷兰语、日语、韩语、普通话、粤语、阿拉伯语、印地语、孟加拉语、越南语、泰语、土耳其语、俄语、波兰语、乌克兰语、斯瓦希里语等 70+ 种语言。

使用限制

  • 音频时长:每请求最长 20 秒,超时返回 413 错误。
  • 请求大小:Base64 编码后最大 25MB。
  • 语音特征:翻译后的语音会适配目标语言的自然音调,非原说话人音色的精确克隆。
  • 免费用户:延迟约 50 秒或更长。

错误响应

状态码 含义
400 参数无效或音频解码失败
401 缺失或无效的 API 密钥
404 会话 ID 未知或已过期
413 音频超过 20 秒限制
502 上游翻译失败,响应包含 incidentId

订阅计划

提供 BASIC($0.00/月)、PRO($9.00/月)、ULTRA($25.00/月)、MEGA($85.00/月)四种套餐。

二维码
社区交流群
二维码
科研交流群
商业服务