인증
Gemini 네이티브 형식 (TTS)
{model}은 gemini-3.8-flash-tts 또는 gemini-3.1-flash-tts-preview입니다.
gemini-3.8-flash-tts
gemini-3.1-flash-tts-preview
응답
응답 처리
오디오는candidates[0].content.parts[0].inlineData로 반환됩니다:
3.1용 WAV 헤더 추가(Python, 샘플링 레이트는 응답의
mimeType에서 파싱하고 하드코딩하지 마세요):
파라미터 설명
인라인 태그(두 세대 공통, 본문에 작성하여 순간적인 이벤트 제어):
<laugh>, <sigh>, <cough>, <breath>, <short pause>.
멀티턴: 3.8은 긴 멀티턴 대화를 안정적으로 지원하며, 3.1은 단일 턴만 지원합니다. contents에는 user 턴이 하나만 있어야 하며 여러 턴이면 Multiturn chat is not enabled for this model이 반환됩니다. 멀티턴이 필요하면 gemini-3.8-flash-tts를 사용하세요.
다중 화자(3.8): 각 part에 speech_metadata.speaker를 지정하며, 화자는 speechConfig에 설정된 화자와 일치해야 합니다:
음성 라이브러리 조회
?model=로 지정한 모델에 따라 채널이 라우팅됩니다. 조회는 과금되지 않습니다.
요청 파라미터
요청 예시
응답
음성 라이브러리는
ar-001(현대 표준 아랍어), ar-EG(이집트 아랍어) 등 지역 변형을 포함하여 130개 이상의 언어를 지원합니다.
모델 비교
두 모델 모두 음성 라이브러리 조회(
/v1beta/voices)와 프리빌트 음성(voiceName)을 지원합니다.
입력 / 출력 토큰 한도: 둘 다 8,192 / 16,384(출력 16,384 토큰은 약 11분 분량의 오디오).
과금
실제 사용량 기준으로 정산되며, 응답의usageMetadata를 따릅니다:
음성 라이브러리 조회(
/v1beta/voices)는 과금되지 않습니다.
