图像生成
输入: 文本 · 图像
Gemini Nano Banana
详细使用方式请参考 Nano Banana API 指南。
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 上线时间 | 预计下线时间 | 负载能力 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|---|---|
| Vertex AI | turing/gemini-2.5-flash-image | 输入: 输出: Tools: 不支持 | v1/chat/completions | 输入: $0.3输出: $30 | 2025-09-12 | - | Vertex AI 多项目 | 中国区 欧洲区 北美区 | - |
| Vertex AI | turing/gemini-3-pro-image | 输入: 输出: Tools: 不支持 | v1/chat/completions | 输入: $2输出: $60 | 2025-09-12 | - | Vertex AI 多项目 | 中国区 欧洲区 北美区 | - |
| Vertex AI | turing/gemini-3.1-flash-lite-image | 输入: 输出: Tools: 不支持 | v1/chat/completions | 输入: $0.25文本输出: $1.50图像输出: $30 | 2026-07-01 | - | Vertex AI 多项目 | 中国区 欧洲区 北美区 | Nano Banana 2 Lite,最高 1K 输出 |
Azure OpenAI
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每张图片) | 上线时间 | 预计下线时间 | 负载能力 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|---|---|
| Azure | turing/gpt-image-2 | 输入: 输出: Tools: 不支持 | v1/images/generations | 按 token 计费 (per 1M tokens):文本输入: $5.00 / 缓存 $1.25图像输入: $8.00 / 缓存 $2.00图像输出: $30.00 | 2026-04-23 | - | 全球 | 中国区 欧洲区 北美区 | 公开预览。支持任意分辨率(4K)、可选透明背景 |
| Azure | turing/gpt-image-1 | 输入: 输出: Tools: 不支持 | v1/images/generations | Low Quality: $0.011 (1024x1024) $0.016 (1024x1536) $0.016 (1536x1024)Medium Quality: $0.042 (1024x1024) $0.063 (1024x1536) $0.063 (1536x1024)High Quality: $0.167 (1024x1024) $0.25 (1024x1536) $0.25 (1536x1024) | 2025-06-19 | - | 全球 | 中国区 欧洲区 北美区 | - |
| Azure | turing/dall-e-3 | 输入: 输出: Tools: 不支持 | v1/images/generations | $0.04 (1024x1024)$0.08 (1024x1536)$0.08 (1536x1024) | 2025-04-22 | 2026-02-18 | 全球 | 中国区 欧洲区 北美区 | - |
GPT-image-2 技术规格
公开预览阶段,详见 图像生成 API → GPT-image-2。
分辨率支持
gpt-image-2 不再受限于固定的几个分辨率,可传入任意尺寸字符串(格式 <w>x<h>),需满足:
- 两条边均为 16 像素的整数倍
- 长边 ≤ 3840 px(支持 4K)
- 宽高比 ≤ 3:1
- 总像素数在
655,360~8,294,400之间
也可以传 size="auto",由模型自动选择尺寸。
图像生成能力
| 能力 | 说明 |
|---|---|
| 文本到图像 | POST /v1/images/generations |
| 透明背景 | background="transparent"(仅 output_format="png") |
字节火山
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每张图片) | 上线时间 | 预计下线时间 | 负载能力 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|---|---|
| 字节火山 | doubao-seedream-4-0-250828 | 输入: 输出: Tools: 不支持 | v1/images/generations | ¥0.2 per image | 2025-12-12 | - | 字节火山 | 中国区 | - |
| 字节火山 | doubao-seedream-4-5-251128 | 输入: 输出: Tools: 不支持 | v1/images/generations | ¥0.25 per image | 2025-12-12 | - | 字节火山 | 中国区 | - |
| 字节火山 | doubao-seedream-5-0-260128 | 输入: 输出: Tools: 联网搜索 | v1/images/generations | ¥0.22 per image | 2026-01-28 | - | 字节火山 | 中国区 | 即 Seedream 5.0-lite,支持联网搜索(web_search)、流式输出与批量生成(n)。旧 id doubao-seedream-5-0-lite-260128 仍可用 |
| 字节火山 | doubao-seedream-5-0-pro-260628 | 输入: 输出: Tools: 联网搜索 | v1/images/generations | 单图生成:≤261万像素 ¥0.30 / >261万像素 ¥0.60图层拆分:≤261万像素 ¥0.15 / >261万像素 ¥0.30输入图 ¥0.02 per image(首张免费) | 2026-06-28 | - | 字节火山 | 中国区 | 旗舰版,支持交互编辑、图层拆分与多图融合。不支持流式输出,也不支持批量生成(n)。按生图场景和每张图的实际输出像素分档计费 |
Seedream 技术规格
分辨率支持
| 模型 | 支持分辨率 |
|---|---|
| doubao-seedream-4-0-250828 | 1K、2K、4K |
| doubao-seedream-4-5-251128 | 2K、4K |
| doubao-seedream-5-0-260128 | 2K、3K、4K |
| doubao-seedream-5-0-pro-260628 | 1K、1.5K、2K(图层拆分场景另支持 auto) |
- 宽高比范围: [1/16, 16]
- 支持图像格式: JPEG, PNG, WEBP, BMP, TIFF, GIF(
doubao-seedream-5-0-260128额外支持 HEIC、HEIF)
图像生成能力
- 文本到图像: 根据文本描述生成高质量图像
- 图像到图像: 基于参考图像生成新图像
- 多图像融合: 支持 2-14 张参考图像 + 文本提示生成图像
- 批量图像生成: 最多 15 张图像(输入图像数 + 生成图像数 ≤ 15)
n 参数与批量生成
当使用 Seedream 模型时,n 参数会自动转换为批量图像生成参数(doubao-seedream-5-0-pro-260628 除外:该模型不支持批量生成,n 会被忽略,始终返回一张图):
# 设置 n=3 时,平台自动转换为:
payload["sequential_image_generation"] = "auto"
payload["sequential_image_generation_options"] = {"max_images": 3}
sequential_image_generation 可选值:
"auto": 模型自动决定是否返回多张图像及数量"disabled": 仅生成一张图像
Seedream 5.0 各版本支持的参数差异
| 参数 | doubao-seedream-5-0-260128 | doubao-seedream-5-0-pro-260628 |
|---|---|---|
image(图生图) | 支持 | 支持 |
watermark | 支持 | 支持 |
optimize_prompt_options | 支持 | 支持 |
output_format(png/jpeg) | 支持 | 支持 |
background(opaque/transparent) | 不支持 | 支持(仅图生图,且输入图需带透明通道) |
layer_decomposition | 不支持 | 支持(图层拆分,仅单张输入图) |
tools(联网搜索) | 支持 | 不支持 |
guidance_scale | 不支持 | 不支持 |
stream | 支持 | 不支持 |
sequential_image_generation / n | 支持 | 不支持 |
上游不支持的参数不会被转发,传了会被忽略(stream: true 会在入参校验阶段直接报错)。
联网搜索传 tools: [{"type": "web_search"}],响应的 usage.tool_usage 里会带检索次数。
图层拆分(仅 doubao-seedream-5-0-pro-260628)
传 layer_decomposition: true 即可把单张输入图拆成 1 张底图 + 最多 16 个带透明通道的 PNG 图层。
image变为必选,且只能传 1 张(png / jpeg,总像素 [262144, 3600万])prompt变为可选:不传时模型自动识别并拆分图中所有主要元素;传了则按描述拆(支持<bbox>归一化坐标精确指定)size在该场景只接受档位1K/1.5K/2K/auto。不传时平台会自动发auto(默认的1024x1024是像素值,上游会拒)output_format只控制底图格式,图层恒为png- 响应的
data数组同时包含底图和图层,靠z_index区分(底图恒为 0),并额外返回bounding_box.absolute/bounding_box.normalized/name/description - 图层可以作为输入图再次调用做单独编辑;要保留透明背景需同时配
background: "transparent"与output_format: "png"
按响应里 usage.generated_images 的张数计费,底图也算一张,且每张按自己的实际像素分档 —— 图层拆分的单价是单图生成的一半。实测「自动全拆」出 14 张(底图 1760×2176 + 13 个图层)计 ¥2.25。
阿里百炼
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每张图片) | 上线时间 | 预计下线时间 | 负载能力 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|---|---|
| 阿里百炼 | wan2.7-image | 输入: 输出: Tools: 不支持 | v1/images/generations | ¥0.20 per image | 2026-04-01 | - | 阿里百炼 | 中国区 | 通义万相 2.7,最高 2K |
| 阿里百炼 | wan2.7-image-pro | 输入: 输出: Tools: 不支持 | v1/images/generations | ¥0.50 per image | 2026-04-01 | - | 阿里百炼 | 中国区 | 通义万相 2.7 旗舰版,文生图支持 4K |
万相技术规格
分辨率支持
| 模型 | 支持分辨率 |
|---|---|
| wan2.7-image | 1K、2K,或 宽x高 |
| wan2.7-image-pro | 1K、2K、4K(4K 仅文生图),或 宽x高 |
size 传 宽x高 时平台会转成上游要求的 宽*高 格式,调用方按 OpenAI 习惯写 1024x1024 即可。
图像生成能力
- 文本到图像: 根据文本描述生成图像
- 图像到图像: 通过
image传入一张或多张参考图(URL 或 base64) - 组图生成:
enable_sequential: true
支持的参数
除 prompt、model、image、size 外,以下参数会原样转发给上游:
| 参数 | 类型 | 说明 |
|---|---|---|
n | integer | 关闭组图模式时为生成张数,取值 1–4(默认 1);开启组图模式时为最大张数,取值 1–12(默认 12) |
enable_sequential | boolean | 是否启用组图输出模式,默认 false |
thinking_mode | boolean | 是否开启思考模式,默认 true。仅在关闭组图且无图片输入时生效,开启会增加耗时 |
color_palette | array | 自定义颜色主题,3–10 个 {hex, ratio},ratio 总和须为 100.00%。仅关闭组图模式时可用 |
bbox_list | array | 交互式编辑的框选坐标,按输入图顺序给出 |
watermark | boolean | 是否加「AI 生成」水印,默认 false |
seed | integer | 随机数种子,取值 [0, 2147483647] |
计费按成功返回的图片张数结算(失败调用不计费)。开启组图模式时 n 若不传,上游默认按 12 张生成 —— 请显式指定 n。价格见阿里云百炼计费说明。