Skip to main content
POST
GPT-Image-2

简介

GPT-Image-2 具备真实世界智能、多语言理解、4K 分辨率支持和智能路由层,提供双端点适配方案 两个端点响应格式一致,始终返回 Base64(b64_json)并附带 usage token 统计。

能力对比

在 OpenAI 官方定义中,gpt-image-2/v1/images/generations 端点为纯文生图接口,仅接收文本 prompt不支持传入图片进行图生图,官方的图生图能力仅通过 /v1/images/edits 端点提供。我们对 /v1/images/generations 做了能力扩展:额外支持图生图(image-to-image),你可以在该端点同时传入文本 prompt 与图片,由模型基于输入图片进行再创作、风格迁移、内容参考或局部重绘。
完整参数与多模型说明请参见 图片生成

认证

string
必填
Bearer Token,如 Bearer sk-xxxxxxxxxx
string
必填
JSON 请求为 application/json;multipart 上传为 multipart/form-data

支持的模型

通用参数说明

两个端点的参数集合完全一致,说明如下。
string
必填
固定值 gpt-image-2
string
必填
图像描述文本(文生图)或编辑描述文本(图生图)
string | string[]
图生图的输入图片。单张传字符串、多张传数组;支持 URL 或 base64 data URI。文生图时不传该字段
integer
默认值:"1"
生成图片数量,范围 1-10
string
默认值:"1024x1024"
图片尺寸,见下方 size 可选值
string
默认值:"high"
图片质量:lowmediumhighauto
string
默认值:"auto"
背景透明度,可选 autoopaquetransparent 会直接报错
string
默认值:"png"
返回图片格式:pngjpeg
number
默认值:"100"
压缩率,取值 0–100,仅 jpeg 生效
string
默认值:"auto"
内容审核严格度:autolow(更宽松)
string
终端用户标识,用于滥用检测

size 可选值

quality 可选值

文生图:POST /v1/images/generations

以文本描述生成图像。只需传入 modelprompt,即可按指定尺寸、质量输出图片,适用于创意生成、素材生产等纯文本驱动的场景。

请求示例

响应示例

该端点同样支持图生图。 在文生图请求的基础上额外携带 image 字段(URL 或 base64 data URI,单图传字符串、多图传数组),系统会自动将请求路由到图像编辑处理流程,无需切换端点,接口统一、使用简单。image 字段的输入图片数量无硬性上限,受上游总 token 限制约束;单张图片最大 50MB
图生图的响应结构与文生图一致,区别在于 usage.input_tokens_details.image_tokens 大于 0,反映输入图片消耗的 token 数:

图生图:POST /v1/images/edits

标准的 OpenAI 图像编辑端点,以参考图为基础进行再创作、风格迁移、局部重绘与多图融合,支持 JSON 和 multipart/form-data 两种请求格式。

方式一:multipart/form-data

适用于直接上传本地图片文件。
图片字段使用 image[](即使只有一张图片也可用 image[])。

方式二:JSON

适用于传入图片 URL 或 base64 编码的图片,请求参数与 generations 端点的图生图完全一致。
该端点同样支持文生图。 不传 image 字段、仅提供 modelprompt 时,请求会按纯文本生成处理,输出结果与 /v1/images/generations 的文生图一致,方便已接入 edits 的应用统一走单一端点。

响应字段说明

所有端点返回格式一致:

usage 字段说明

  • GPT-Image-2 始终返回 base64 编码的图片数据(b64_json),不支持 response_format=url
  • output_tokens 全部为图片输出 token,该模型无文本输出。
  • 计费按 token 维度区分:文本输入、图片输入、图片输出各有独立单价。

定价

所有价格均为每 1M tokens 的美元价格,基于上游返回的 usage tokens 计费。

注意事项

  1. 图片生成通常需要 10-30 秒,具体取决于尺寸和质量设置
  2. 始终返回 base64 编码的图片数据
  3. 支持的输入图片格式:PNG、JPEG、WebP;输出图片格式:PNG、JPEG
  4. 4K 分辨率生成时间更长,建议优先使用标准尺寸
  5. quality 设置为 low 可以显著加快生成速度
  6. gpt-image-2 始终以高保真处理输入图片,无需也不支持传 input_fidelity 参数
  7. 单张上传图片最大 50MB
  8. 输出图片数量 n 范围为 1-10
  9. 输入图片数量无硬性上限,受上游总 token 限制约束
  10. 该模型无文本输出,output_tokens 全部为图片输出 token
  11. background 只支持 auto(默认)和 opaque,传 transparent 会直接报错

相关资源

图片生成

多模型图片生成接口总览

图像编辑

更多 edits 端点用法与示例