Live Voice Translator
收藏数据链接:
官方服务:
资源简介:
Real-time speech-to-speech translation across 70+ languages. Send audio (MP3, WAV, PCM16, M4A, OGG) and get back translated audio plus transcripts in seconds
创建时间:
2026-07-16
原始信息汇总
API 概述
Live Voice Translator 是一个实时语音到语音翻译 API,能够通过单次 API 调用实现音频翻译,无需单独串联语音识别、翻译和语音合成服务。
核心功能
- 实时语音翻译:支持 70+ 种语言(使用标准 BCP-47 代码),输入一种语言的音频,直接输出目标语言的语音。
- 多种音频格式支持:可发送 MP3、WAV、M4A、OGG、WebM 或原始 PCM16 格式的音频;输出支持 MP3 或 PCM16 格式。
- 附带文本转录:每次响应均包含原始音频的识别文本和翻译后的文本,便于显示字幕或记录对话。
- 快速响应:专为短语音片段设计(最长 20 秒),适合语音消息、应用内语音笔记和短语翻译。
- 多模态分析能力:API 不仅能处理文本,还能分析音频语调等,提供深度多模态洞察。
主要端点
POST /v1/translate-file:主端点,发送完整音频片段,单次响应返回完整翻译结果。- 会话流端点(进阶):
POST /v1/session/start、POST /v1/session/{id}/audio、POST /v1/session/{id}/end,适用于边录制边传输音频的场景。
请求与响应
- 请求字段:
audioBase64(必填):Base64 编码的音频数据。audioFormat(可选):音频格式,默认pcm16,支持mp3、wav、m4a、ogg、webm或auto(自动检测)。targetLanguageCode(必填):目标语言 BCP-47 代码(如id、en、es、ja、ko、zh-Hans等)。echoTargetLanguage(可选):默认为true,若输入音频已是目标语言则回传原音频。outputFormat(可选):输出音频格式,默认pcm16,推荐mp3。
- 响应字段:
translatedAudioBase64:Base64 编码的翻译后音频。outputFormat:输出音频格式。inputTranscript:原始音频的识别文本。outputTranscript:翻译后的文本。
支持的语言
支持包括但不限于:印尼语、英语、西班牙语、葡萄牙语、法语、德语、意大利语、荷兰语、日语、韩语、普通话、粤语、阿拉伯语、印地语、孟加拉语、越南语、泰语、土耳其语、俄语、波兰语、乌克兰语、斯瓦希里语等 70+ 种语言。
使用限制
- 音频时长:每请求最长 20 秒,超时返回 413 错误。
- 请求大小:Base64 编码后最大 25MB。
- 语音特征:翻译后的语音会适配目标语言的自然音调,非原说话人音色的精确克隆。
- 免费用户:延迟约 50 秒或更长。
错误响应
| 状态码 | 含义 |
|---|---|
| 400 | 参数无效或音频解码失败 |
| 401 | 缺失或无效的 API 密钥 |
| 404 | 会话 ID 未知或已过期 |
| 413 | 音频超过 20 秒限制 |
| 502 | 上游翻译失败,响应包含 incidentId |
订阅计划
提供 BASIC($0.00/月)、PRO($9.00/月)、ULTRA($25.00/月)、MEGA($85.00/月)四种套餐。



