Skip to main content
이 페이지는 오디오 (Audio) 페이지의 Gemini 네이티브 형식을 확장하며, 차세대 TTS 모델을 다룹니다.

인증

Gemini 네이티브 형식 (TTS)

{model}은 gemini-3.8-flash-tts 또는 gemini-3.1-flash-tts-preview입니다.

gemini-3.8-flash-tts

gemini-3.1-flash-tts-preview

응답

응답 처리

오디오는 candidates[0].content.parts[0].inlineData로 반환됩니다:
3.1용 WAV 헤더 추가(Python, 샘플링 레이트는 응답의 mimeType에서 파싱하고 하드코딩하지 마세요):

파라미터 설명

인라인 태그(두 세대 공통, 본문에 작성하여 순간적인 이벤트 제어): <laugh>, <sigh>, <cough>, <breath>, <short pause>. 멀티턴: 3.8은 긴 멀티턴 대화를 안정적으로 지원하며, 3.1은 단일 턴만 지원합니다. contents에는 user 턴이 하나만 있어야 하며 여러 턴이면 Multiturn chat is not enabled for this model이 반환됩니다. 멀티턴이 필요하면 gemini-3.8-flash-tts를 사용하세요. 다중 화자(3.8): 각 part에 speech_metadata.speaker를 지정하며, 화자는 speechConfig에 설정된 화자와 일치해야 합니다:

음성 라이브러리 조회

사용 가능한 음성(프리빌트 / 확장 음성 라이브러리)을 조회합니다. ?model=로 지정한 모델에 따라 채널이 라우팅됩니다. 조회는 과금되지 않습니다.

요청 파라미터

요청 예시

응답

음성 라이브러리는 ar-001(현대 표준 아랍어), ar-EG(이집트 아랍어) 등 지역 변형을 포함하여 130개 이상의 언어를 지원합니다.

모델 비교

두 모델 모두 음성 라이브러리 조회(/v1beta/voices)와 프리빌트 음성(voiceName)을 지원합니다. 입력 / 출력 토큰 한도: 둘 다 8,192 / 16,384(출력 16,384 토큰은 약 11분 분량의 오디오).

과금

실제 사용량 기준으로 정산되며, 응답의 usageMetadata를 따릅니다: 음성 라이브러리 조회(/v1beta/voices)는 과금되지 않습니다.

자주 발생하는 오류

관련 링크