MINARA

音声を合成

POST /v1/voice/tts:最大 4096 文字のテキストに対する合成音声をストリーミングします。

POST /v1/voice/tts

最大 4096 文字のテキストに対する合成音声をストリーミングします。プロバイダーの本文はバッファリングせずにパイプされるため、合成完了前に最初の音声バイトが届きます。format は mp3(既定)、opus、wav のいずれかです。opus は OpenAI プロバイダーへルーティングされ、Telegram 形式のボイスメモに適しています。文単位で呼び出す場合は previous_text / next_text(各 600 文字に切り詰め)を渡すことで、ElevenLabs はリクエスト間で自然な韻律を保てます。返信の最初の文には first_chunk: true を指定すると、高速開始設定が有効な場合にゲートウェイが開始の速いモデルへ切り替えられます。provider でプレビューを openai または elevenlabs に固定できるため、プロバイダー固有の voice ID がフォールバック先で再利用されません。

メソッドPOST
パス/v1/voice/tts
認証GATEWAY_AUTH_TOKEN 設定時は Authorization: Bearer <token> が必要
カテゴリvoice

リクエスト本文

{ "text": "...", "voice": "optional", "provider": "openai", "format": "mp3", "first_chunk": false, "previous_text": "optional", "next_text": "optional" }

レスポンス本文

audio bytes (audio/mpeg | audio/ogg | audio/wav)

目次