跳到主要内容

图像生成

图标说明

输入: 文本 · 图像

Gemini Nano Banana

详细使用方式请参考 Nano Banana API 指南

厂商接口模型ID模型能力endpoint价格(每百万 Tokens)上线时间预计下线时间负载能力支持访问地区备注
Vertex AIturing/gemini-2.5-flash-image输入:
输出:
Tools: 不支持
v1/chat/completions输入: $0.3
输出: $30
2025-09-12-Vertex AI 多项目中国区
欧洲区
北美区
-
Vertex AIturing/gemini-3-pro-image输入:
输出:
Tools: 不支持
v1/chat/completions输入: $2
输出: $60
2025-09-12-Vertex AI 多项目中国区
欧洲区
北美区
-
Vertex AIturing/gemini-3.1-flash-lite-image输入:
输出:
Tools: 不支持
v1/chat/completions输入: $0.25
文本输出: $1.50
图像输出: $30
2026-07-01-Vertex AI 多项目中国区
欧洲区
北美区
Nano Banana 2 Lite,最高 1K 输出

Azure OpenAI

厂商接口模型ID模型能力endpoint价格(每张图片)上线时间预计下线时间负载能力支持访问地区备注
Azureturing/gpt-image-2输入:
输出:
Tools: 不支持
v1/images/generations按 token 计费 (per 1M tokens):
文本输入: $5.00 / 缓存 $1.25
图像输入: $8.00 / 缓存 $2.00
图像输出: $30.00
2026-04-23-全球中国区
欧洲区
北美区
公开预览。支持任意分辨率(4K)、可选透明背景
Azureturing/gpt-image-1输入:
输出:
Tools: 不支持
v1/images/generationsLow Quality: $0.011 (1024x1024) $0.016 (1024x1536) $0.016 (1536x1024)
Medium Quality: $0.042 (1024x1024) $0.063 (1024x1536) $0.063 (1536x1024)
High Quality: $0.167 (1024x1024) $0.25 (1024x1536) $0.25 (1536x1024)
2025-06-19-全球中国区
欧洲区
北美区
-
Azureturing/dall-e-3输入:
输出:
Tools: 不支持
v1/images/generations$0.04 (1024x1024)
$0.08 (1024x1536)
$0.08 (1536x1024)
2025-04-222026-02-18全球中国区
欧洲区
北美区
-

GPT-image-2 技术规格

公开预览阶段,详见 图像生成 API → GPT-image-2

分辨率支持

gpt-image-2 不再受限于固定的几个分辨率,可传入任意尺寸字符串(格式 <w>x<h>),需满足:

  • 两条边均为 16 像素的整数倍
  • 长边 ≤ 3840 px(支持 4K)
  • 宽高比 ≤ 3:1
  • 总像素数655,360 ~ 8,294,400 之间

也可以传 size="auto",由模型自动选择尺寸。

图像生成能力

能力说明
文本到图像POST /v1/images/generations
透明背景background="transparent"(仅 output_format="png"

字节火山

厂商接口模型ID模型能力endpoint价格(每张图片)上线时间预计下线时间负载能力支持访问地区备注
字节火山doubao-seedream-4-0-250828输入:
输出:
Tools: 不支持
v1/images/generations¥0.2 per image2025-12-12-字节火山中国区-
字节火山doubao-seedream-4-5-251128输入:
输出:
Tools: 不支持
v1/images/generations¥0.25 per image2025-12-12-字节火山中国区-
字节火山doubao-seedream-5-0-260128输入:
输出:
Tools: 联网搜索
v1/images/generations¥0.22 per image2026-01-28-字节火山中国区即 Seedream 5.0-lite,支持联网搜索(web_search)、流式输出与批量生成(n)。旧 id doubao-seedream-5-0-lite-260128 仍可用
字节火山doubao-seedream-5-0-pro-260628输入:
输出:
Tools: 联网搜索
v1/images/generations单图生成:≤261万像素 ¥0.30 / >261万像素 ¥0.60
图层拆分:≤261万像素 ¥0.15 / >261万像素 ¥0.30
输入图 ¥0.02 per image(首张免费)
2026-06-28-字节火山中国区旗舰版,支持交互编辑、图层拆分与多图融合。不支持流式输出,也不支持批量生成(n)。按生图场景和每张图的实际输出像素分档计费

Seedream 技术规格

分辨率支持

模型支持分辨率
doubao-seedream-4-0-2508281K、2K、4K
doubao-seedream-4-5-2511282K、4K
doubao-seedream-5-0-2601282K、3K、4K
doubao-seedream-5-0-pro-2606281K、1.5K、2K(图层拆分场景另支持 auto
  • 宽高比范围: [1/16, 16]
  • 支持图像格式: JPEG, PNG, WEBP, BMP, TIFF, GIF(doubao-seedream-5-0-260128 额外支持 HEIC、HEIF)

图像生成能力

  • 文本到图像: 根据文本描述生成高质量图像
  • 图像到图像: 基于参考图像生成新图像
  • 多图像融合: 支持 2-14 张参考图像 + 文本提示生成图像
  • 批量图像生成: 最多 15 张图像(输入图像数 + 生成图像数 ≤ 15)

n 参数与批量生成

当使用 Seedream 模型时,n 参数会自动转换为批量图像生成参数(doubao-seedream-5-0-pro-260628 除外:该模型不支持批量生成,n 会被忽略,始终返回一张图):

# 设置 n=3 时,平台自动转换为:
payload["sequential_image_generation"] = "auto"
payload["sequential_image_generation_options"] = {"max_images": 3}

sequential_image_generation 可选值:

  • "auto": 模型自动决定是否返回多张图像及数量
  • "disabled": 仅生成一张图像

Seedream 5.0 各版本支持的参数差异

参数doubao-seedream-5-0-260128doubao-seedream-5-0-pro-260628
image(图生图)支持支持
watermark支持支持
optimize_prompt_options支持支持
output_formatpng/jpeg支持支持
backgroundopaque/transparent不支持支持(仅图生图,且输入图需带透明通道)
layer_decomposition不支持支持(图层拆分,仅单张输入图)
tools(联网搜索)支持不支持
guidance_scale不支持不支持
stream支持不支持
sequential_image_generation / n支持不支持

上游不支持的参数不会被转发,传了会被忽略(stream: true 会在入参校验阶段直接报错)。

联网搜索传 tools: [{"type": "web_search"}],响应的 usage.tool_usage 里会带检索次数。

图层拆分(仅 doubao-seedream-5-0-pro-260628

layer_decomposition: true 即可把单张输入图拆成 1 张底图 + 最多 16 个带透明通道的 PNG 图层。

  • image 变为必选,且只能传 1 张(png / jpeg,总像素 [262144, 3600万])
  • prompt 变为可选:不传时模型自动识别并拆分图中所有主要元素;传了则按描述拆(支持 <bbox> 归一化坐标精确指定)
  • size 在该场景只接受档位 1K / 1.5K / 2K / auto不传时平台会自动发 auto(默认的 1024x1024 是像素值,上游会拒)
  • output_format 只控制底图格式,图层恒为 png
  • 响应的 data 数组同时包含底图和图层,靠 z_index 区分(底图恒为 0),并额外返回 bounding_box.absolute / bounding_box.normalized / name / description
  • 图层可以作为输入图再次调用做单独编辑;要保留透明背景需同时配 background: "transparent"output_format: "png"
计费

按响应里 usage.generated_images 的张数计费,底图也算一张,且每张按自己的实际像素分档 —— 图层拆分的单价是单图生成的一半。实测「自动全拆」出 14 张(底图 1760×2176 + 13 个图层)计 ¥2.25。

阿里百炼

厂商接口模型ID模型能力endpoint价格(每张图片)上线时间预计下线时间负载能力支持访问地区备注
阿里百炼wan2.7-image输入:
输出:
Tools: 不支持
v1/images/generations¥0.20 per image2026-04-01-阿里百炼中国区通义万相 2.7,最高 2K
阿里百炼wan2.7-image-pro输入:
输出:
Tools: 不支持
v1/images/generations¥0.50 per image2026-04-01-阿里百炼中国区通义万相 2.7 旗舰版,文生图支持 4K

万相技术规格

分辨率支持

模型支持分辨率
wan2.7-image1K、2K,或 宽x高
wan2.7-image-pro1K、2K、4K(4K 仅文生图),或 宽x高

size宽x高 时平台会转成上游要求的 宽*高 格式,调用方按 OpenAI 习惯写 1024x1024 即可。

图像生成能力

  • 文本到图像: 根据文本描述生成图像
  • 图像到图像: 通过 image 传入一张或多张参考图(URL 或 base64)
  • 组图生成: enable_sequential: true

支持的参数

promptmodelimagesize 外,以下参数会原样转发给上游:

参数类型说明
ninteger关闭组图模式时为生成张数,取值 1–4(默认 1);开启组图模式时为最大张数,取值 1–12(默认 12
enable_sequentialboolean是否启用组图输出模式,默认 false
thinking_modeboolean是否开启思考模式,默认 true。仅在关闭组图且无图片输入时生效,开启会增加耗时
color_palettearray自定义颜色主题,3–10 个 {hex, ratio}ratio 总和须为 100.00%。仅关闭组图模式时可用
bbox_listarray交互式编辑的框选坐标,按输入图顺序给出
watermarkboolean是否加「AI 生成」水印,默认 false
seedinteger随机数种子,取值 [0, 2147483647]
n 直接影响费用

计费按成功返回的图片张数结算(失败调用不计费)。开启组图模式时 n 若不传,上游默认按 12 张生成 —— 请显式指定 n。价格见阿里云百炼计费说明