Skip to main content

소개

GravitexAI 오디오 API는 두 그룹으로 나뉩니다:
  • OpenAI 형식: /v1/audio/speech(TTS), /v1/audio/transcriptions(STT), /v1/audio/translations — OpenAI Audio API와 호환
  • Gemini 네이티브 형식: POST /v1beta/models/{model}:generateContentresponseModalities: ["AUDIO"]speechConfig 설정(예: gemini-2.5-flash-preview-tts)
Base URL: https://api.gravitex.ai. Gemini 인증은 Gemini 네이티브 형식을 참고하세요.

인증

string
필수
Bearer Token, 예: Bearer sk-xxxxxxxxxx(OpenAI 및 Gemini)
string
Gemini 선택 사항: x-goog-api-key: sk-xxxxxxxxxx

요청 예제

POST /v1/audio/speech

공통 매개변수

OpenAI 형식

Speech
  • model: 예: tts-1, tts-1-hd
  • input: 읽을 텍스트(최대 4096자)
  • voice: alloy, echo, fable, onyx, nova, shimmer
Transcriptions / translations
  • file: 오디오 파일(multipart)
  • model: 예: whisper-1

Gemini 형식 (TTS)

  • model(경로): 예: gemini-2.5-flash-preview-tts, gemini-2.5-pro-preview-tts
  • contents[].parts[].text: 텍스트 또는 스타일 지시
  • generationConfig.responseModalities: "AUDIO" 포함 필수
  • generationConfig.speechConfig.voiceConfig.prebuiltVoiceConfig.voiceName: 예: Kore, Puck, Charon
Gemini 오디오는 /v1/audio/*가 아닌 generateContent로만 생성됩니다. 전체 매개변수는 Gemini 네이티브 형식을 참고하세요.