Skip to main content
本页为 音频(Audio) 页 Gemini 原生格式的扩展,覆盖新一代 TTS 模型。

鉴权

Gemini 原生格式(TTS)

{model} 为 gemini-3.8-flash-tts 或 gemini-3.1-flash-tts-preview。

gemini-3.8-flash-tts

gemini-3.1-flash-tts-preview

响应

响应处理

音频在 candidates[0].content.parts[0].inlineData 中返回:
3.1 补 WAV 头(Python,采样率从响应的 mimeType 解析,勿硬编码):

参数说明

内嵌标记(两代通用,写在正文中控制瞬时事件):<laugh>、<sigh>、<cough>、<breath>、<short pause>。 多轮: 3.8 支持长对话多轮稳定;3.1 仅单轮——contents 只能有一个 user turn,多轮返回 Multiturn chat is not enabled for this model,需要多轮请使用 gemini-3.8-flash-tts。 多说话人(3.8): 每轮 part 各自带 speech_metadata.speaker,说话人需与 speechConfig 配置的说话人匹配:

音色库查询

查询可用音色(预置 / 扩展音色库),按 ?model= 指定模型路由渠道。查询不产生计费。

请求参数

请求示例

响应

音色库覆盖 130+ 种语言(含区域变体,如 ar-001 现代标准阿拉伯语、ar-EG 埃及阿拉伯语)。

模型对照

两个模型均支持音色库查询(/v1beta/voices)与预置音色(voiceName)。 输入 / 输出 token 上限:均为 8,192 / 16,384(16,384 输出 token 约合 11 分钟音频)。

计费

按实际用量结算,以响应的 usageMetadata 为准: 音色库查询(/v1beta/voices)不计费。

常见错误

相关链接