跳到主要内容

聊天模型列表

OpenAI​

新增模型:turing/gpt-6-sol / turing/gpt-6-luna

GPT-6 Sol 兼顾智能与速度,适合推理与编码;GPT-6 Luna 面向成本敏感、高吞吐的场景。两者与 GPT-6 Astra 使用同一套请求约定:推荐使用 v1/responses;v1/chat/completions 仅有限支持文本请求,工具调用请使用 Responses API;推理强度支持 low / medium / high / xhigh / max,不支持 none / minimal。短上下文价格:Sol 输入 $2 / 输出 $10 / 缓存读 $0.2,Luna 输入 $0.1 / 输出 $0.5 / 缓存读 $0.01;超过 272K 输入 token 的整次请求按长上下文价格计费。

筛选28/36
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
Azureturing/gpt-6-astra
max_input_tokens: 922,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions(有限支持), v1/responses
SDK: OpenAI SDK
输入: $10
输出: $50
缓存读: $1
缓存写 5m: $12.5
网页搜索: $10 / 1K
>272K 输入时整次请求按长上下文价计费(输入 $20 / 缓存读 $2 / 缓存写 $25 / 输出 $75);缓存写按输入价 1.25× 计费;Azure 当前定价页显示价格发布中,请以 Azure 账单为准 →
Azure全球
上线: 2026-09-03
中国区
欧洲区
北美区
亚太区
GPT-6 Astra,面向复杂推理、编码、研究和文档创作;v1/chat/completions 仅有限支持(文本);reasoning effort 支持 low/medium/high/xhigh/max;工具调用请使用 Responses API
Azureturing/gpt-6-sol
max_input_tokens: 922,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions(有限支持), v1/responses
SDK: OpenAI SDK
输入: $2
输出: $10
缓存读: $0.2
缓存写 5m: $2.5
>272K 输入时整次请求按长上下文价计费(输入 $4 / 缓存读 $0.4 / 缓存写 $5 / 输出 $15);缓存写按输入价 1.25× 计费 →
Azure全球
上线: 2026-09-23
中国区
欧洲区
北美区
亚太区
GPT-6 Sol,兼顾智能与速度的推理与编码模型;v1/chat/completions 仅有限支持(文本);reasoning effort 支持 low/medium/high/xhigh/max;工具调用请使用 Responses API
Azureturing/gpt-6-luna
max_input_tokens: 922,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions(有限支持), v1/responses
SDK: OpenAI SDK
输入: $0.1
输出: $0.5
缓存读: $0.01
缓存写 5m: $0.125
>272K 输入时整次请求按长上下文价计费(输入 $0.2 / 缓存读 $0.02 / 缓存写 $0.25 / 输出 $0.75);缓存写按输入价 1.25× 计费 →
Azure全球
上线: 2026-09-23
中国区
欧洲区
北美区
亚太区
GPT-6 Luna,面向成本敏感、高吞吐场景的高性价比模型;v1/chat/completions 仅有限支持(文本);reasoning effort 支持 low/medium/high/xhigh/max;工具调用请使用 Responses API
Azureturing/gpt-5.6-sol
max_input_tokens: 922,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $5 $4
输出: $30 $20
缓存读: $0.5
短上下文促销价 2026-09-01 生效,至少延续至 2026-11-30,仅下调输入与输出:缓存读 $0.5、缓存写 $6.25 不变。>272K 输入时整次请求按长上下文价计费:输入 $10 / 缓存读 $1 / 缓存写 $12.5 / 输出 $45 →
Azure全球
上线: 2026-07-10
中国区
欧洲区
北美区
亚太区
GPT-5.6 旗舰型号,适合复杂推理任务;支持 max 推理强度
Azureturing/gpt-5.6-terra
max_input_tokens: 922,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $2.5 $2
输出: $15 $12
缓存读: $0.25 $0.2
>272K 输入时整次请求按长上下文价计费:输入 $5 / 缓存读 $0.5 / 输出 $22.5;缓存写按输入价 1.25× 计费 →
Azure全球
上线: 2026-07-10
中国区
欧洲区
北美区
亚太区
GPT-5.6 均衡型号,兼顾能力与成本;支持 max 推理强度
Azureturing/gpt-5.6-luna
max_input_tokens: 922,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1 $0.2
输出: $6 $1.2
缓存读: $0.1 $0.02
>272K 输入时整次请求按长上下文价计费:输入 $2 / 缓存读 $0.2 / 输出 $9;缓存写按输入价 1.25× 计费 →
Azure全球
上线: 2026-07-10
中国区
欧洲区
北美区
亚太区
GPT-5.6 最快、成本最低的型号,适合高吞吐任务;支持 max 推理强度
Azureturing/gpt-5.5
max_input_tokens: 922,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $5
输出: $30
缓存读: $0.5
Azure全球
中国区
欧洲区
北美区
亚太区
新一代旗舰模型,思考功能推荐使用 Response API
Azureturing/gpt-5.4
max_input_tokens: 922,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $2.5
输出: $15
缓存读: $0.25
Azure全球
中国区
欧洲区
北美区
亚太区
上一代升级版本,思考功能推荐使用 Response API
Azureturing/gpt-5.4-mini
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.75
输出: $4.5
缓存读: $0.07
Azure全球
中国区
欧洲区
北美区
亚太区
高性价比mini模型,思考功能推荐使用 Response API
Azureturing/gpt-5.4-nano
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.2
输出: $1.25
缓存读: $0.02
Azure全球
中国区
欧洲区
北美区
亚太区
超低成本nano模型,适合分类和子代理任务
Azureturing/gpt-5.3-codex
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/responses
SDK: OpenAI SDK
输入: $1.75
输出: $14
缓存读: $0.17
Azure全球
上线: 2026-02-26
中国区
欧洲区
北美区
亚太区
仅支持 Response API, 支持推理token
Azureturing/gpt-5.3-chat
max_input_tokens: 128,000
max_output_tokens: 16,384
输入:
输出:
工具: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.75
输出: $14
缓存读: $0.17
Azure全球
上线: 2026-03-16
中国区
欧洲区
北美区
亚太区
Azureturing/gpt-5.2
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.75
输出: $14
缓存读: $0.17
Azure全球
上线: 2025-12-11
中国区
欧洲区
北美区
亚太区
升级版本,思考功能推荐使用 Response API
Azureturing/gpt-5.2-chat
max_input_tokens: 1,047,576
max_output_tokens: 32,768
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.75
输出: $14
缓存读: $0.17
Azure 全球
上线: 2025-12-11
中国区
欧洲区
北美区
亚太区
升级版本,思考功能推荐使用 Response API
Azureturing/gpt-5.2-codex
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/responses
SDK: OpenAI SDK
输入: $1.75
输出: $14
缓存读: $0.17
Azure 全球
上线: 2025-12-11
中国区
欧洲区
北美区
亚太区
仅支持 Response API
Azureturing/gpt-5.1
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.25
输出: $10
缓存读: $0.12
Azure 全球
上线: 2025-11-13
中国区
欧洲区
北美区
亚太区
升级版本,思考功能推荐使用 Response API
Azureturing/gpt-5.1-chat
max_input_tokens: 1,047,576
max_output_tokens: 32,768
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.25
输出: $10
缓存读: $0.12
Azure 全球
上线: 2025-11-13
中国区
欧洲区
北美区
亚太区
升级版本,思考功能推荐使用 Response API
Azureturing/gpt-5.1-codex
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
输入: $1.25
输出: $10
缓存读: $0.12
Azure 全球
上线: 2025-08-10
中国区
欧洲区
北美区
亚太区
思考功能推荐使用 Response API
Azureturing/gpt-5.1-codex-mini
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
输入: $0.25
输出: $2
缓存读: $0.03
Azure 全球
上线: 2025-08-10
中国区
欧洲区
北美区
亚太区
思考功能推荐使用 Response API
Azureturing/gpt-5
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.25
输出: $10
缓存读: $0.12
Azure 全球
上线: 2025-08-10
中国区
欧洲区
北美区
亚太区
思考功能推荐使用 Response API
Azureturing/gpt-5-mini
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.25
输出: $2
缓存读: $0.03
Azure 全球
上线: 2025-08-10
中国区
欧洲区
北美区
亚太区
思考功能推荐使用 Response API
Azureturing/gpt-5-nano
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.05
输出: $0.4
缓存读: $0.01
Azure 全球
上线: 2025-08-10
中国区
欧洲区
北美区
亚太区
思考功能推荐使用 Response API
Azureturing/gpt-5-chat
max_input_tokens: 1,047,576
max_output_tokens: 32,768
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.25
输出: $10
缓存读: $0.12
Azure 全球
上线: 2025-08-10
预计下线: 2026-04-15
中国区
欧洲区
北美区
亚太区
思考功能推荐使用 Response API
Azureturing/o3
max_input_tokens: 200,000
max_output_tokens: 100,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $2
输出: $8
缓存读: $0.5
Azure 全球
上线: 2025-04-17
中国区
欧洲区
北美区
亚太区
思考模型,推荐使用 Response API
Azureturing/gpt-4.1
max_input_tokens: 1,024,000
max_output_tokens: 32,768
输入:
输出:
工具: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $2
输出: $8
缓存读: $0.50
Azure 全球
上线: 2025-04-16
中国区
欧洲区
北美区
亚太区
Azureturing/o4-mini
max_input_tokens: 200,000
max_output_tokens: 100,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.1
输出: $4.4
缓存读: $0.275
Azure 全球
上线: 2025-04-16
中国区
欧洲区
北美区
亚太区
思考模型,推荐使用 Response API
Azureturing/gpt-4.1-mini
max_input_tokens: 1,024,000
max_output_tokens: 32,768
输入:
输出:
工具: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.4
输出: $1.6
缓存读: $0.10
Azure 全球
上线: 2025-04-14
中国区
欧洲区
北美区
亚太区
Azureturing/gpt-4.1-nano
max_input_tokens: 1,024,000
max_output_tokens: 32,768
输入:
输出:
工具: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.1
输出: $0.4
缓存读: $0.03
Azure 全球
上线: 2025-04-14
中国区
欧洲区
北美区
亚太区

Gemini​

Gemini 模型负载说明

Gemini 系列模型基于 Google Cloud Vertex AI 共享配额运行,吞吐量无法保证,高并发场景下可能频繁触发 429 限流。不推荐在对稳定性有严格要求的生产环境中直接使用。 图灵平台提供 Retry 与 Fallback 作为工程化缓解手段,但无法根本解决共享配额问题,且 Fallback 切换模型后输出可能不一致。如需根本解决,需额外购买 Provisioned Throughput(预配吞吐量)。 详见:Gemini 429 限流与预配吞吐量

筛选10/23
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
Vertex AIturing/gemini-3.8-flash
max_input_tokens: 1,048,576
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $1.50 $0.75
输出: $7.50 $3.75
缓存读: $0.15 $0.075
网页搜索: $14 / 1K
优惠价有效期至 2026-12-31(通过净支出 50% 额度返还实现);2027-01-01 起标准价为输入 $1.50 / 输出 $7.50 / 缓存读 $0.15 →
Vertex AI 共享配额
上线: 2026-09-03
中国区
欧洲区
北美区
亚太区
最新 Flash 模型,面向长周期软件工程、自主 Agent 与复杂企业工作流;支持 PDF 输入、思考模式与内置网页搜索
Vertex AIturing/gemini-3.7-flash
max_input_tokens: 1,048,576
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $1.50 $0.75
输出: $7.50 $3.75
缓存读: $0.15 $0.075
网页搜索: $14 / 1K
优惠价有效期至 2026-12-31(通过净支出 50% 额度返还实现);2027-01-01 起标准价为输入 $1.50 / 输出 $7.50 / 缓存读 $0.15 →
Vertex AI 共享配额
上线: 2026-08-17
中国区
欧洲区
北美区
亚太区
面向通用 Agent 工作流、多步编排与代码任务;支持 PDF 输入、思考模式与内置网页搜索
Vertex AIturing/gemini-3.6-flash
max_input_tokens: 1,048,576
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $1.5
输出: $7.5
缓存读: $0.15
网页搜索: $14 / 1K
Vertex AI 共享配额
上线: 2026-07-23
中国区
欧洲区
北美区
亚太区
针对多步编排、全栈代码重构、Agent 执行与空间推理优化;支持 PDF 输入、思考模式与内置网页搜索
Vertex AIturing/gemini-3.5-flash
max_input_tokens: 1,048,576
max_output_tokens: 65,535
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $1.5
输出: $9
缓存读: $0.15
网页搜索: $14 / 1K
Vertex AI 共享配额
上线: 2026-05-19
中国区
欧洲区
北美区
亚太区
支持思考模式 & 内置网页搜索
Vertex AIturing/gemini-3.1-pro-latest
max_input_tokens: 1,048,576
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $2
输出: $12
缓存读: $0.4
网页搜索: $14 / 1K
分阶梯收费:超过 200K 输入后 输入: $4 / 输出: $18 →
Vertex AI 共享配额
上线: 2026-02-19
中国区
欧洲区
北美区
亚太区
最新版本 支持思考模式(含 MEDIUM 级别)& 内置网页搜索
Vertex AIturing/gemini-3.1-flash-lite-latest
max_input_tokens: 1,048,576
max_output_tokens: 65,535
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.25
输出: $1.5
网页搜索: $14 / 1K
Vertex AI 共享配额
上线: 2025-12-18
中国区
欧洲区
北美区
亚太区
最新版本 支持思考模式 & 内置网页搜索
Vertex AIturing/gemini-3.1-flash-image
max_input_tokens: 131,072
max_output_tokens: 32,768
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.50
输出: $3(Text)/$60(Image)
网页搜索: $14 / 1K
Vertex AI 共享配额
上线: 2025-12-18
中国区
欧洲区
北美区
亚太区
最新版本 支持思考模式 & 输出图像
Vertex AIturing/gemini-3.1-flash-lite-image
max_input_tokens: 65,536
max_output_tokens: 4,096
输入:
输出:
工具: 不支持
思考: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.25
输出: $1.5(Text)/$30(Image)
Vertex AI 共享配额
上线: 2026-07-01
中国区
欧洲区
北美区
亚太区
Nano Banana 2 Lite,轻量图像生成,输出分辨率最高 1K
Vertex AIturing/gemini-3-flash-latest
max_input_tokens: 1,048,576
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.5
输出: $3
网页搜索: $14 / 1K
Vertex AI 共享配额
上线: 2025-12-18
预计下线: 2026-06-15
中国区
欧洲区
北美区
亚太区
支持思考模式 & 内置网页搜索
Vertex AIturing/gemini-3-pro-image
max_input_tokens: 65,000
max_output_tokens: 32,000
输入:
输出:
工具: -
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $2
输出: $12(Text)/$120(Image)
网页搜索: $14 / 1K
阶梯收费 →
Vertex AI 共享配额
上线: 2025-11-19
中国区
欧洲区
北美区
亚太区
最新版本 支持思考模式

Claude​

警告

由于 Anthropic 政策限制,Claude 系列模型随时可能不可用,建议仅在个人项目中试用。

筛选6/20
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
Anthropicturing/claude-sonnet-5
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $2
输出: $10
缓存读: $0.2
缓存写 5m: $2.5
缓存写 1h: $4
网页搜索: $10 / 1K
Vertex AI(全球部署)
上线: 2026-07-01
中国区
欧洲区
北美区
亚太区
最新 Sonnet 模型,默认开启 adaptive 思考;不支持 enabled/budget_tokens,支持工具、显式缓存与联网搜索
Anthropicturing/claude-opus-4.8
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $5
输出: $25
缓存读: $0.5
缓存写 5m: $6.25
缓存写 1h: $10
网页搜索: $10 / 1K
Vertex AI(全球部署)
上线: 2026-06-01
中国区
欧洲区
北美区
亚太区
支持工具,仅支持 adaptive 思考模式(默认关闭,需显式传 thinking.type=adaptive)
Anthropicturing/claude-opus-4.7
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $5
输出: $25
缓存读: $0.5
缓存写 5m: $6.25
缓存写 1h: $10
网页搜索: $10 / 1K
Vertex AI(全球部署)
上线: 2026-04-15
中国区
欧洲区
北美区
亚太区
支持工具,仅支持 adaptive 思考模式(默认关闭,需显式传 thinking.type=adaptive)
Anthropicturing/claude-opus-4.6
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $5
输出: $25
缓存读: $0.5
缓存写 5m: $6.25
缓存写 1h: $10
网页搜索: $10 / 1K
Vertex AI(全球部署)
上线: 2026-02-25
中国区
欧洲区
北美区
亚太区
支持工具,推荐使用 adaptive 思考模式
Anthropicturing/claude-sonnet-4.6
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $3
输出: $15
缓存读: $0.3
缓存写 5m: $3.75
缓存写 1h: $6
网页搜索: $10 / 1K
Vertex AI(全球部署)
上线: 2026-02-25
中国区
欧洲区
北美区
亚太区
最新版本 支持工具
Anthropicturing/claude-haiku-4.5
max_input_tokens: 200,000
max_output_tokens: 64,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $1
输出: $5
缓存读: $0.1
缓存写 5m: $1.25
缓存写 1h: $2
网页搜索: $10 / 1K
Vertex AI(全球部署)
上线: 2026-01-19
中国区
欧洲区
北美区
亚太区
支持工具

字节火山​

筛选8/22
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
字节火山doubao-seed-2.1-pro
max_input_tokens: 262,144
max_output_tokens: 262,144
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥6
输出: ¥30
缓存读: ¥1.2
字节火山
上线: 2026-06-24
中国区Seed 2.1 旗舰版,支持视频理解
字节火山doubao-seed-2.1-turbo
max_input_tokens: 262,144
max_output_tokens: 262,144
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥3
输出: ¥15
缓存读: ¥0.6
字节火山
上线: 2026-06-24
中国区Seed 2.1 均衡版,支持视频理解 + GUI Agent
字节火山doubao-seed-character
max_input_tokens: 131,072
max_output_tokens: 32,768
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥0.8
输出: ¥2
缓存读: ¥0.16
字节火山
上线: 2026-06-28
中国区角色扮演/虚拟陪伴,支持图文理解、深度思考与工具调用
字节火山doubao-seed-2-0-pro-260215
max_input_tokens: 262,144
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
字节火山
上线: 2026-02-25
中国区最新版本 Seed 2.0 旗舰版,支持视频理解
字节火山doubao-seed-2-0-lite-260215
max_input_tokens: 262,144
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
字节火山
上线: 2026-02-25
中国区最新版本 Seed 2.0 中端版,支持视频理解
字节火山doubao-seed-2-0-lite-260428
max_input_tokens: 262,144
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
字节火山
上线: 2026-04-28
中国区Seed 2.0 全模态版,支持文本/图像/视频/音频统一理解 + 深度思考
字节火山doubao-seed-2-0-mini-260215
max_input_tokens: 262,144
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
字节火山
上线: 2026-02-25
中国区最新版本 Seed 2.0 轻量版,支持视频理解
字节火山doubao-seed-2-0-code-preview-260215
max_input_tokens: 262,144
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
字节火山
上线: 2026-02-25
中国区代码预览版

阿里 DashScope​

筛选11/43
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
阿里DashScopeqwen3.8-max
max_input_tokens: 991,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥12
输出: ¥36
缓存读: ¥1.5
阿里云
上线: 2026-08-03
中国区旗舰版 3.8,视觉-语言(图像/视频输入)
阿里DashScopeqwen3.8-flash
max_input_tokens: 991,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥0.8
输出: ¥2.7
缓存读: ¥0.1
阿里云
上线: 2026-08-31
中国区轻量版 3.8,视觉-语言(图像/视频输入)
阿里DashScopeqwen3.8-27b
max_input_tokens: 991,808
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥3
输出: ¥12
缓存读: ¥0.6
显式缓存创建 ¥3.75 / 显式缓存命中 ¥0.3 →
阿里云
上线: 2026-09-10
中国区27B 版本 3.8,视觉-语言(图像/视频输入)
阿里DashScopeqwen3.7-plus
max_input_tokens: 991,000
max_output_tokens: 64,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
阿里云
上线: 2026-06-08
中国区高性价比版 3.7,视觉-语言(图像输入)
阿里DashScopeqwen3.7-flash
max_input_tokens: 991,000
max_output_tokens: 64,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥0.2
输出: ¥0.8
缓存读: ¥0.04
阿里云
上线: 2026-07-28
中国区轻量版 3.7,视觉-语言(图像输入)
阿里DashScopeqwen3.7-max
max_input_tokens: 991,000
max_output_tokens: 64,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥6
输出: ¥18
缓存读: ¥1.2
阿里云
上线: 2026-05-28
中国区旗舰版 3.7
阿里DashScopeqwen3.6-plus
max_input_tokens: 983,616
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
阿里云
上线: 2026-04-03
中国区稳定版,当前与 qwen3.6-plus-2026-04-02 能力相同
阿里DashScopeqwen3.6-flash
max_input_tokens: 983,616
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
阿里云
上线: 2026-04-23
中国区轻量版 3.6
阿里DashScopeqwen3.6-max
max_input_tokens: 229,376
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
阿里云
上线: 2026-04-23
预计下线: 2026-09-08
中国区旗舰版 3.6
阿里DashScopeqwen3.5-plus
max_input_tokens: 983,616
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
阿里云
上线: 2026-02-25
中国区快照版本
阿里DashScopeqwen3.5-flash
max_input_tokens: 983,616
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
阿里云
上线: 2026-02-25
中国区快照版本

Deepseek​

筛选7/17
厂商接口模型ID模型能力endpoint价格(每百万 Tokens,实付 = 标价 × 折扣)负载与上下线支持访问地区备注
Deepseekdeepseek-v4.1-flash
max_input_tokens: 1,000,000
max_output_tokens: 393,216
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥2
输出: ¥8
缓存读: ¥0.04
峰谷定价:高峰时段为东八区周一至周五 09:00-12:00、14:00-18:00(以账单时间为准),周末全天与工作日其余时间均为闲时,输入 ¥1 / 输出 ¥4 / 缓存命中 ¥0.02 →
DeepSeek 官方
上线: 2026-09-11
中国区新增:V4.1 Flash 正式版,直连 DeepSeek 官方;原生支持图像输入,与 deepseek-v4-flash-0731 共用同一份限流额度,取代已下线的 V4 Flash 旧版
字节火山bytedance/deepseek-v4.1-flash
max_input_tokens: 1,048,576
max_output_tokens: 393,216
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
4折
输入: ¥2
输出: ¥8
缓存读: ¥0.04
北京时间 2026-09-24 09:52:17 起 4 折优惠(高峰、闲时价均按 4 折计);峰谷定价:高峰时段为东八区周一至周五 09:00-12:00、14:00-18:00(以账单时间为准),周末全天与工作日其余时间均为闲时,输入 ¥1 / 输出 ¥4 / 缓存命中 ¥0.02 →
字节火山
上线: 2026-09-17
中国区新增:DeepSeek V4.1 Flash 的火山部署(Ark 快照 deepseek-v4-1-flash-260910);原生支持图像输入,与 deepseek-v4.1-flash 共用同一份限流额度、单独计价;内置联网搜索仅在 v1/responses 上可用
Deepseekdeepseek-v4-pro-0813
max_input_tokens: 1,000,000
max_output_tokens: 393,216
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥9
输出: ¥27
缓存读: ¥0.9
峰谷定价:闲时(东八区 22:00 至次日 08:00,以账单时间为准)输入 ¥4.5 / 输出 ¥13.5 / 缓存命中 ¥0.45
阿里云
上线: 2026-08-13
中国区新增:V4 Pro 正式版(固定版本 id),与 deepseek-v4-pro 并存、共用同一份限流额度;两者价格不同,本模型按峰谷计价
阿里DashScopealiyun/deepseek-v4-flash-0731
max_input_tokens: 1,000,000
max_output_tokens: 393,216
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥3
输出: ¥9
缓存读: ¥0.3
峰谷定价:闲时(东八区 22:00 至次日 08:00,以账单时间为准)输入 ¥1.5 / 输出 ¥4.5 / 缓存命中 ¥0.15 →
阿里云
上线: 2026-07-31
中国区旧 V4 Flash(0731 快照)的阿里云百炼线路,官方直连线路已下线;缓存命中价 ¥0.3,闲时为东八区每日 22:00 至次日 08:00
Deepseekdeepseek-v4-pro
max_input_tokens: 1,000,000
max_output_tokens: 393,216
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥12
输出: ¥24
缓存读: ¥1
阿里云
上线: 2026-04-25
中国区
字节火山bytedance/deepseek-v4-flash
max_input_tokens: 1,048,576
max_output_tokens: 393,216
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥1
输出: ¥2
字节火山
上线: 2026-07-28
中国区DeepSeek V4 Flash 的火山部署;内置联网搜索仅在 v1/responses 上可用
Deepseekturing/deepseek-v3-2
max_input_tokens: 64,000
max_output_tokens: 8,192
输入:
输出:
工具: 不支持
思考: 支持
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: ¥2
输出: ¥3
[0, 32] 输入: ¥2 输出: ¥3 / (32, 128] 输入: ¥4 输出: ¥6
火山引擎(中国)
上线: 2025-12-11
中国区v1/responses 仅支持流式

智谱​

筛选9/20
厂商接口模型ID模型能力endpoint价格(每百万 Tokens,实付 = 标价 × 折扣)负载与上下线支持访问地区备注
智谱glm-5.3-flash
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥0.8
输出: ¥2.8
缓存读: ¥0.23
智谱
上线: 2026-08-26
中国区原生多模态,1M 上下文;思考始终开启,支持 low、high、max 推理强度 →
智谱glm-5.3
max_input_tokens: 1,048,576
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥8
输出: ¥28
缓存读: ¥2
智谱
上线: 2026-08-19
中国区开源旗舰,1M 上下文
阿里DashScopedashscope/glm-5.3
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
8折
输入: ¥8
输出: ¥28
缓存读: ¥2
北京时间 2026-09-24 09:52:17 起 8 折优惠 →
阿里云
上线: 2026-09-20
中国区新增:GLM-5.3 的阿里云百炼线路(百炼自营 glm-5.3),与 glm-5.3 共用同一份限流额度、单独计价;仅支持思考模式,1M 上下文,隐式缓存命中按输入价 25% 计
智谱glm-5.2
max_input_tokens: 1,048,576
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥8
输出: ¥28
缓存读: ¥2
智谱
上线: 2026-06-17
中国区最新旗舰,1M 上下文
阿里DashScopedashscope/glm-5.2
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
5折
输入: ¥8
输出: ¥28
缓存读: ¥2
北京时间 2026-09-24 09:52:17 起 5 折优惠 →
阿里云
上线: 2026-09-20
中国区新增:GLM-5.2 的阿里云百炼线路(百炼自营 glm-5.2),与 glm-5.2 共用同一份限流额度、单独计价;支持思考/非思考模式,1M 上下文,隐式缓存命中按输入价 25% 计
智谱glm-5.1
max_input_tokens: 204,800
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
智谱
上线: 2026-04-09
中国区
智谱glm-5
max_input_tokens: 204,800
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
智谱
上线: 2026-02-24
中国区
智谱glm-4.7
max_input_tokens: 204,800
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
智谱
上线: 2025-12-23
中国区
智谱glm-4.6
max_input_tokens: 204,800
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
智谱
上线: 2025-11-11
中国区

MiniMax​

筛选5/11
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
MiniMaxminimax-m3
max_input_tokens: 1,048,576
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: ¥4.2 ¥2.1
输出: ¥16.8 ¥8.4
缓存读: ¥0.84 ¥0.42
限时 5 折;上下文 512K-1M 输入 ¥4.2 / 输出 ¥16.8 / 缓存读 ¥0.84 →
MiniMax
上线: 2026-06-17
中国区MiniMax M3;v1/responses 仅支持流式
MiniMaxminimax-m2.7
max_input_tokens: 204,800
max_output_tokens: 131,072
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK / Anthropic SDK
输入: ¥2.1
输出: ¥8.4
阿里云
上线: 2026-03-23
中国区最新版本 M2.7
MiniMaxminimax-m2.5-highspeed
max_input_tokens: 204,800
max_output_tokens: 204,800
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: ¥4.2
输出: ¥16.8
MiniMax
上线: 2026-02-25
中国区
MiniMaxminimax-m2.5
max_input_tokens: 204,800
max_output_tokens: 204,800
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK / Anthropic SDK
输入: ¥2.1
输出: ¥8.4
MiniMax
上线: 2026-02-25
中国区
MiniMaxminimax-text-01
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: ¥1
输出: ¥8
MiniMax
上线: 2025-04-02
中国区

KIMI​

筛选1/6
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
KIMIkimi-k3
max_input_tokens: 1,048,576
max_output_tokens: 1,048,576
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions
SDK: OpenAI SDK / Anthropic SDK
输入: ¥20
输出: ¥100
缓存读: ¥2
阿里云
上线: 2026-07-21
中国区Kimi 旗舰模型,支持 1M 上下文、图像理解、深度思考与工具调用;v1/responses 仅支持流式

小米 MiMo​

筛选1/1
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
Xiaomimimo-v2.5-pro
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥7
输出: ¥21
缓存读: ¥1.4
阿里云
上线: 2026-05-28
中国区小米开源推理模型

Bedrock​

筛选4/4
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
Bedrockturing/nova-lite-v2
max_input_tokens: 1,000,000
max_output_tokens: 64,000
输入:
输出:
工具: 支持
缓存: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.30
输出: $2.50
缓存读: $0.075
AWS Bedrock(美国)
上线: 2026-07-22
中国区
欧洲区
北美区
亚太区
Nova 2 Lite
Bedrockturing/nova-pro
max_input_tokens: 300,000
max_output_tokens: 10,000
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.80
输出: $3.20
AWS Bedrock(美国)
上线: 2026-07-22
中国区
欧洲区
北美区
亚太区
Nova Pro
Bedrocknova-lite-v1
max_input_tokens: 290,000
max_output_tokens: 10,000
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.06
输出: $0.24
AWS Bedrock(美国)
上线: 2025-08-21
中国区
欧洲区
北美区
亚太区
Bedrockturing/titan-nove-lite-v1
max_input_tokens: 290,000
max_output_tokens: 10,000
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.06
输出: $0.24
AWS Bedrock(美国)
上线: 2025-08-21
中国区
欧洲区
北美区
亚太区

Grok​

筛选1/5
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
Bedrockturing/grok-4.6
max_input_tokens: 500,000
max_output_tokens: 500,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $2
输出: $6
缓存读: $0.5
≥200K 输入时整次请求按 2× 输入 / 2× 输出计价,缓存输入同样按 2× 计费
AWS Bedrock(美国)
上线: 2026-08-21
中国区
欧洲区
北美区
亚太区
支持 Grok Build;配置见接入指南 →