合成語音
POST /v1/voice/tts:為最多 4096 個字符的文本流式返回合成語音。
POST /v1/voice/tts
為最多 4096 個字符的文本流式返回合成語音。提供商響應體不會緩衝直接傳輸,因此合成結束前即可收到首批音頻字節。format 可為 mp3(默認)、opus 或 wav;opus 會路由至 OpenAI 提供商,適合 Telegram 風格的語音留言。按句調用時,可傳入 previous_text / next_text(各截斷至 600 個字符),使 ElevenLabs 在請求間保持連貫韻律;回覆首句傳入 first_chunk: true,在啟用更快啟動設置時可讓網關換用啟動更快的模型。provider 可將預覽固定到 openai 或 elevenlabs,避免某提供商原生 voice ID 被回退供應商複用。
| 方法 | POST |
| 路徑 | /v1/voice/tts |
| 認證 | 設置 GATEWAY_AUTH_TOKEN 時需要 Authorization: Bearer <token> |
| 類別 | voice |
請求體
{ "text": "...", "voice": "optional", "provider": "openai", "format": "mp3", "first_chunk": false, "previous_text": "optional", "next_text": "optional" }響應體
audio bytes (audio/mpeg | audio/ogg | audio/wav)