MINARA

음성 합성

POST /v1/voice/tts: 최대 4096자의 텍스트에 대한 합성 음성을 스트리밍합니다.

POST /v1/voice/tts

최대 4096자의 텍스트에 대한 합성 음성을 스트리밍합니다. 제공자 본문은 버퍼링 없이 전달되므로 합성이 끝나기 전에 첫 오디오 바이트를 받을 수 있습니다. format은 mp3(기본값), opus, wav 중 하나입니다. opus는 Telegram 스타일 음성 메모용으로 OpenAI 제공자에 연결됩니다. 문장 단위 호출자는 previous_text / next_text(각 600자로 잘림)를 전달해 ElevenLabs가 요청 간 운율을 자연스럽게 이어가도록 할 수 있습니다. 답변 첫 문장에 first_chunk: true를 지정하면 빠른 시작 설정이 켜진 경우 게이트웨이가 시작이 빠른 모델로 전환합니다. provider는 미리 보기를 openai 또는 elevenlabs에 고정해 제공자 고유 voice ID가 대체 제공자에서 재사용되지 않게 합니다.

메서드POST
경로/v1/voice/tts
인증GATEWAY_AUTH_TOKEN 설정 시 Authorization: Bearer <token> 필요
카테고리voice

요청 본문

{ "text": "...", "voice": "optional", "provider": "openai", "format": "mp3", "first_chunk": false, "previous_text": "optional", "next_text": "optional" }

응답 본문

audio bytes (audio/mpeg | audio/ogg | audio/wav)

목차