合成语音
POST /v1/voice/tts:为最多 4096 个字符的文本流式返回合成语音。
POST /v1/voice/tts
为最多 4096 个字符的文本流式返回合成语音。提供商响应体不会缓冲直接传输,因此合成结束前即可收到首批音频字节。format 可为 mp3(默认)、opus 或 wav;opus 会路由至 OpenAI 提供商,适合 Telegram 风格的语音留言。按句调用时,可传入 previous_text / next_text(各截断至 600 个字符),使 ElevenLabs 在请求间保持连贯韵律;回复首句传入 first_chunk: true,在启用更快启动设置时可让网关换用启动更快的模型。provider 可将预览固定到 openai 或 elevenlabs,避免某提供商原生 voice ID 被回退供应商复用。
| 方法 | POST |
| 路径 | /v1/voice/tts |
| 认证 | 设置 GATEWAY_AUTH_TOKEN 时需要 Authorization: Bearer <token> |
| 类别 | voice |
请求体
{ "text": "...", "voice": "optional", "provider": "openai", "format": "mp3", "first_chunk": false, "previous_text": "optional", "next_text": "optional" }响应体
audio bytes (audio/mpeg | audio/ogg | audio/wav)