Skip to main content
本文档介绍如何使用 Gemini 原生 API 协议(generateContent)调用图像生成模型,适用于需要完整参数控制的高级场景。
对于大多数用户,推荐使用更简单的 OpenAI 兼容接口

接口地址

支持的模型


基础请求


请求参数

contents 数组(必填)

每个 content 对象包含 parts 数组:

generationConfig 对象

generationConfig.imageConfig 对象


宽高比设置

常用宽高比如下:

分辨率档位说明

imageConfig.imageSize 支持三个档位: 不同宽高比在各档位下的典型像素,可以参考《Gemini 图像生成》中的分辨率与宽高比表格,例如:
  • Gemini 2.5 Flash(1K 档):
    • 1:1 → 1024×1024
    • 16:9 → 1344×768
    • 9:16 → 768×1344
  • Gemini 3 Pro Image 预览版:
    • 1K / 2K / 4K + 各宽高比(1:1、2:3、3:2、3:4、4:3、4:5、5:4、9:16、16:9、21:9)都有对应的标准分辨率栅格。
  • gemini-2.5-flash-image 仅支持 1K,指定更高档位会自动降级到 1K;
  • gemini-3-pro-image-preview 支持 1K / 2K / 4K 三档。

参考图编辑

通过 inline_data 传入参考图进行图像编辑:

多参考图

可以在 parts 数组中添加多个 inline_data,最多支持 15 张参考图

响应结构


计费说明

采用混合计费: 大致规则(仅用于缺省情况下的近似计费):
  • Gemini 2.5 Flash(1K 档):输出每张约 1290 image tokens;
  • Gemini 3 Pro Image 预览版:
    • 1K / 2K 档:每张约 1210 image tokens;
    • 4K 档:每张约 2000 image tokens。

选择建议


相关文档