음성 합성
POST /v1/voice/tts: 최대 4096자의 텍스트에 대한 합성 음성을 스트리밍합니다.
POST /v1/voice/tts
최대 4096자의 텍스트에 대한 합성 음성을 스트리밍합니다. 제공자 본문은 버퍼링 없이 전달되므로 합성이 끝나기 전에 첫 오디오 바이트를 받을 수 있습니다. format은 mp3(기본값), opus, wav 중 하나입니다. opus는 Telegram 스타일 음성 메모용으로 OpenAI 제공자에 연결됩니다. 문장 단위 호출자는 previous_text / next_text(각 600자로 잘림)를 전달해 ElevenLabs가 요청 간 운율을 자연스럽게 이어가도록 할 수 있습니다. 답변 첫 문장에 first_chunk: true를 지정하면 빠른 시작 설정이 켜진 경우 게이트웨이가 시작이 빠른 모델로 전환합니다. provider는 미리 보기를 openai 또는 elevenlabs에 고정해 제공자 고유 voice ID가 대체 제공자에서 재사용되지 않게 합니다.
| 메서드 | POST |
| 경로 | /v1/voice/tts |
| 인증 | GATEWAY_AUTH_TOKEN 설정 시 Authorization: Bearer <token> 필요 |
| 카테고리 | voice |
요청 본문
{ "text": "...", "voice": "optional", "provider": "openai", "format": "mp3", "first_chunk": false, "previous_text": "optional", "next_text": "optional" }응답 본문
audio bytes (audio/mpeg | audio/ogg | audio/wav)