Skip to main content
POST
GPT-Image-2

소개

GPT-Image-2는 실세계 지능, 다국어 이해, 4K 해상도 지원, 스마트 라우팅 계층을 제공하며 두 개의 엔드포인트로 구성됩니다: 두 엔드포인트의 응답 형식은 동일하며, 항상 Base64(b64_json)와 usage 토큰 통계를 반환합니다.

기능 비교

OpenAI 공식 정의에서 gpt-image-2/v1/images/generations는 텍스트 prompt만 받는 순수 텍스트-이미지 엔드포인트이며, 이미지를 전달한 이미지-이미지는 지원하지 않습니다. 공식 I2I 기능은 /v1/images/edits에서만 제공됩니다. 저희는 /v1/images/generations이미지-이미지(image-to-image) 기능을 추가로 확장했습니다. 텍스트 prompt와 이미지를 함께 전달하면 모델이 입력 이미지를 기반으로 재창작, 스타일 전환, 참조 생성, 부분 리터치를 수행합니다.
전체 매개변수 및 다른 이미지 모델은 이미지 생성을 참고하세요.

인증

string
필수
Bearer Token, 예: Bearer sk-xxxxxxxxxx
string
필수
JSON 요청은 application/json, 파일 업로드는 multipart/form-data

지원 모델

매개변수

두 엔드포인트의 매개변수 집합은 완전히 동일합니다.
string
필수
고정값 gpt-image-2
string
필수
이미지 설명(텍스트-이미지) 또는 편집 지시(이미지-이미지)
string | string[]
이미지-이미지용 입력 이미지. 단일 이미지는 문자열, 다중 이미지는 배열. URL 또는 base64 data URI 지원. 텍스트-이미지에서는 전달하지 않습니다
integer
기본값:"1"
생성 이미지 수, 범위 1-10
string
기본값:"1024x1024"
이미지 크기, 아래 size 값 참고
string
기본값:"high"
이미지 품질: low, medium, high, auto
string
기본값:"auto"
배경 투명도: auto, opaque. transparent 전달 시 오류가 발생합니다
string
기본값:"png"
반환 이미지 형식: png, jpeg
number
기본값:"100"
압축률 0–100, jpeg에서만 적용
string
기본값:"auto"
콘텐츠 검수 강도: auto, low(더 완화)
string
최종 사용자 식별자, 남용 탐지에 사용

size 값

quality 값

텍스트-이미지: POST /v1/images/generations

텍스트 설명으로 이미지를 생성합니다. modelprompt만 전달하면 지정한 크기·품질로 이미지가 반환되며, 텍스트만으로 진행하는 창작 및 소재 제작에 적합합니다.

요청 예제

응답 예제

이 엔드포인트는 이미지-이미지도 지원합니다. 텍스트-이미지 요청에 image 필드(URL 또는 base64 data URI, 단일 이미지는 문자열·다중 이미지는 배열)를 추가하면 엔드포인트 변경 없이 자동으로 이미지 편집 처리로 라우팅되어, 하나의 엔드포인트로 간단하게 사용할 수 있습니다.입력 이미지 수에 고정된 상한은 없으며 업스트림 총 토큰 한도의 제약을 받습니다. 이미지 한 장의 최대 크기는 50MB입니다.
이미지-이미지 응답 구조는 텍스트-이미지와 동일하며, 입력 이미지가 소비한 토큰을 반영해 usage.input_tokens_details.image_tokens가 0보다 큽니다:

이미지-이미지: POST /v1/images/edits

표준 OpenAI 이미지 편집 엔드포인트로, 참조 이미지를 기반으로 재창작, 스타일 전환, 부분 리터치, 다중 이미지 합성을 수행합니다. JSON과 multipart/form-data 두 가지 형식을 지원합니다.

방식 1: multipart/form-data

로컬 이미지 파일을 직접 업로드할 때 사용합니다.
이미지 필드는 image[]를 사용합니다(이미지가 한 장이어도 image[] 사용 가능).

방식 2: JSON

이미지 URL 또는 base64 인코딩 이미지를 전달할 때 사용하며, 매개변수는 generations 엔드포인트의 이미지-이미지와 완전히 동일합니다.
이 엔드포인트는 텍스트-이미지도 지원합니다. image 필드를 생략하고 modelprompt만 전달하면 순수 텍스트 생성으로 처리되며, /v1/images/generations의 텍스트-이미지와 동일한 결과를 반환합니다. 이미 edits를 연동한 애플리케이션은 단일 엔드포인트만 사용할 수 있습니다.

응답 필드 설명

두 엔드포인트의 반환 형식은 동일합니다:

usage 필드 설명

  • GPT-Image-2는 항상 base64 인코딩 이미지 데이터(b64_json)를 반환하며 response_format=url을 지원하지 않습니다.
  • output_tokens는 모두 이미지 출력 토큰이며, 이 모델은 텍스트를 출력하지 않습니다.
  • 과금은 토큰 단위로 구분되며 텍스트 입력, 이미지 입력, 이미지 출력에 각각 별도 단가가 적용됩니다.

가격

모든 가격은 업스트림이 반환한 usage 토큰 기준, 1M 토큰당 미국 달러 가격입니다.

주의 사항

  1. 이미지 생성은 크기와 품질 설정에 따라 보통 10~30초가 소요됩니다
  2. 이미지 데이터는 항상 base64 인코딩으로 반환됩니다
  3. 지원 입력 이미지 형식: PNG, JPEG, WebP; 출력 이미지 형식: PNG, JPEG
  4. 4K 해상도는 생성 시간이 더 길므로 표준 크기 사용을 권장합니다
  5. qualitylow로 설정하면 생성 속도가 크게 빨라집니다
  6. gpt-image-2는 항상 고충실도로 입력 이미지를 처리하므로 input_fidelity 매개변수는 필요하지 않으며 지원되지도 않습니다
  7. 업로드 이미지 한 장의 최대 크기는 50MB입니다
  8. 출력 이미지 수 n의 범위는 1~10입니다
  9. 입력 이미지 수에 고정된 상한은 없으며 업스트림 총 토큰 한도의 제약을 받습니다
  10. 이 모델은 텍스트를 출력하지 않으며 output_tokens는 모두 이미지 출력 토큰입니다
  11. backgroundauto(기본값)와 opaque만 지원하며 transparent 전달 시 오류가 발생합니다

관련 자료

이미지 생성

다중 모델 이미지 생성 API 개요

이미지 편집

edits 엔드포인트 추가 사용법과 예제