MINARA

合成語音

POST /v1/voice/tts:為最多 4096 個字符的文本流式返回合成語音。

POST /v1/voice/tts

為最多 4096 個字符的文本流式返回合成語音。提供商響應體不會緩衝直接傳輸,因此合成結束前即可收到首批音頻字節。format 可為 mp3(默認)、opus 或 wav;opus 會路由至 OpenAI 提供商,適合 Telegram 風格的語音留言。按句調用時,可傳入 previous_text / next_text(各截斷至 600 個字符),使 ElevenLabs 在請求間保持連貫韻律;回覆首句傳入 first_chunk: true,在啟用更快啟動設置時可讓網關換用啟動更快的模型。provider 可將預覽固定到 openaielevenlabs,避免某提供商原生 voice ID 被回退供應商複用。

方法POST
路徑/v1/voice/tts
認證設置 GATEWAY_AUTH_TOKEN 時需要 Authorization: Bearer <token>
類別voice

請求體

{ "text": "...", "voice": "optional", "provider": "openai", "format": "mp3", "first_chunk": false, "previous_text": "optional", "next_text": "optional" }

響應體

audio bytes (audio/mpeg | audio/ogg | audio/wav)

本頁目錄