跳到主要内容

聊天模型列表

新增模型:deepseek-v4-flash-0731

deepseek-v4-flash-0731 现在直连 DeepSeek 官方;阿里云百炼托管的同一份快照另以 aliyun/deepseek-v4-flash-0731 提供。两者上下文上限、请求参数、限流额度都一致,输入/输出单价也相同,差别只在缓存命中价(官方 ¥0.1 / 百炼 ¥0.3)和闲时时段。详见 Deepseek

OpenAI

降价:turing/gpt-5.6-terra / turing/gpt-5.6-luna

两个型号的短上下文 Token 单价已下调,调用方式、上下文上限、限流额度均不变,无需改代码:

  • turing/gpt-5.6-terra:输入 $2.5 → $2,输出 $15 → $12,缓存读 $0.25 → $0.2
  • turing/gpt-5.6-luna:输入 $1 → $0.2,输出 $6 → $1.2,缓存读 $0.1 → $0.02

turing/gpt-5.6-sol 价格不变。>272K 长上下文价格不在本次下调范围内,以表内价格备注为准。

筛选25/33
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
Azureturing/gpt-5.6-sol
max_input_tokens: 922,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $5
输出: $30
缓存读: $0.5
>272K 输入时整次请求按 2× 输入 / 1.5× 输出计价;缓存写按输入价 1.25× 计费
Azure全球
上线: 2026-07-10
中国区
欧洲区
北美区
亚太区
GPT-5.6 旗舰型号,适合复杂推理任务;支持 max 推理强度
Azureturing/gpt-5.6-terra
max_input_tokens: 922,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $2.5 $2
输出: $15 $12
缓存读: $0.25 $0.2
>272K 输入时整次请求按长上下文价计费:输入 $5 / 缓存读 $0.5 / 输出 $22.5;缓存写按输入价 1.25× 计费
Azure全球
上线: 2026-07-10
中国区
欧洲区
北美区
亚太区
GPT-5.6 均衡型号,兼顾能力与成本;支持 max 推理强度
Azureturing/gpt-5.6-luna
max_input_tokens: 922,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1 $0.2
输出: $6 $1.2
缓存读: $0.1 $0.02
>272K 输入时整次请求按长上下文价计费:输入 $2 / 缓存读 $0.2 / 输出 $9;缓存写按输入价 1.25× 计费
Azure全球
上线: 2026-07-10
中国区
欧洲区
北美区
亚太区
GPT-5.6 最快、成本最低的型号,适合高吞吐任务;支持 max 推理强度
Azureturing/gpt-5.5
max_input_tokens: 922,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $5
输出: $30
缓存读: $0.5
Azure全球
中国区
欧洲区
北美区
亚太区
新一代旗舰模型,思考功能推荐使用 Response API
Azureturing/gpt-5.4
max_input_tokens: 922,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $2.5
输出: $15
缓存读: $0.25
Azure全球
中国区
欧洲区
北美区
亚太区
上一代升级版本,思考功能推荐使用 Response API
Azureturing/gpt-5.4-mini
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.75
输出: $4.5
缓存读: $0.07
Azure全球
中国区
欧洲区
北美区
亚太区
高性价比mini模型,思考功能推荐使用 Response API
Azureturing/gpt-5.4-nano
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.2
输出: $1.25
缓存读: $0.02
Azure全球
中国区
欧洲区
北美区
亚太区
超低成本nano模型,适合分类和子代理任务
Azureturing/gpt-5.3-codex
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/responses
SDK: OpenAI SDK
输入: $1.75
输出: $14
缓存读: $0.17
Azure全球
上线: 2026-02-26
中国区
欧洲区
北美区
亚太区
仅支持 Response API, 支持推理token
Azureturing/gpt-5.3-chat
max_input_tokens: 128,000
max_output_tokens: 16,384
输入:
输出:
工具: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.75
输出: $14
缓存读: $0.17
Azure全球
上线: 2026-03-16
中国区
欧洲区
北美区
亚太区
Azureturing/gpt-5.2
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.75
输出: $14
缓存读: $0.17
Azure全球
上线: 2025-12-11
中国区
欧洲区
北美区
亚太区
升级版本,思考功能推荐使用 Response API
Azureturing/gpt-5.2-chat
max_input_tokens: 1,047,576
max_output_tokens: 32,768
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.75
输出: $14
缓存读: $0.17
Azure 全球
上线: 2025-12-11
中国区
欧洲区
北美区
亚太区
升级版本,思考功能推荐使用 Response API
Azureturing/gpt-5.2-codex
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/responses
SDK: OpenAI SDK
输入: $1.75
输出: $14
缓存读: $0.17
Azure 全球
上线: 2025-12-11
中国区
欧洲区
北美区
亚太区
仅支持 Response API
Azureturing/gpt-5.1
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.25
输出: $10
缓存读: $0.12
Azure 全球
上线: 2025-11-13
中国区
欧洲区
北美区
亚太区
升级版本,思考功能推荐使用 Response API
Azureturing/gpt-5.1-chat
max_input_tokens: 1,047,576
max_output_tokens: 32,768
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.25
输出: $10
缓存读: $0.12
Azure 全球
上线: 2025-11-13
中国区
欧洲区
北美区
亚太区
升级版本,思考功能推荐使用 Response API
Azureturing/gpt-5.1-codex
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
输入: $1.25
输出: $10
缓存读: $0.12
Azure 全球
上线: 2025-08-10
中国区
欧洲区
北美区
亚太区
思考功能推荐使用 Response API
Azureturing/gpt-5.1-codex-mini
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
输入: $0.25
输出: $2
缓存读: $0.03
Azure 全球
上线: 2025-08-10
中国区
欧洲区
北美区
亚太区
思考功能推荐使用 Response API
Azureturing/gpt-5
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.25
输出: $10
缓存读: $0.12
Azure 全球
上线: 2025-08-10
中国区
欧洲区
北美区
亚太区
思考功能推荐使用 Response API
Azureturing/gpt-5-mini
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.25
输出: $2
缓存读: $0.03
Azure 全球
上线: 2025-08-10
中国区
欧洲区
北美区
亚太区
思考功能推荐使用 Response API
Azureturing/gpt-5-nano
max_input_tokens: 400,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.05
输出: $0.4
缓存读: $0.01
Azure 全球
上线: 2025-08-10
中国区
欧洲区
北美区
亚太区
思考功能推荐使用 Response API
Azureturing/gpt-5-chat
max_input_tokens: 1,047,576
max_output_tokens: 32,768
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.25
输出: $10
缓存读: $0.12
Azure 全球
上线: 2025-08-10
预计下线: 2026-04-15
中国区
欧洲区
北美区
亚太区
思考功能推荐使用 Response API
Azureturing/o3
max_input_tokens: 200,000
max_output_tokens: 100,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $2
输出: $8
缓存读: $0.5
Azure 全球
上线: 2025-04-17
中国区
欧洲区
北美区
亚太区
思考模型,推荐使用 Response API
Azureturing/gpt-4.1
max_input_tokens: 1,024,000
max_output_tokens: 32,768
输入:
输出:
工具: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $2
输出: $8
缓存读: $0.50
Azure 全球
上线: 2025-04-16
中国区
欧洲区
北美区
亚太区
Azureturing/o4-mini
max_input_tokens: 200,000
max_output_tokens: 100,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.1
输出: $4.4
缓存读: $0.275
Azure 全球
上线: 2025-04-16
中国区
欧洲区
北美区
亚太区
思考模型,推荐使用 Response API
Azureturing/gpt-4.1-mini
max_input_tokens: 1,024,000
max_output_tokens: 32,768
输入:
输出:
工具: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.4
输出: $1.6
缓存读: $0.10
Azure 全球
上线: 2025-04-14
中国区
欧洲区
北美区
亚太区
Azureturing/gpt-4.1-nano
max_input_tokens: 1,024,000
max_output_tokens: 32,768
输入:
输出:
工具: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.1
输出: $0.4
缓存读: $0.03
Azure 全球
上线: 2025-04-14
中国区
欧洲区
北美区
亚太区

Gemini

Gemini 模型负载说明

Gemini 系列模型基于 Google Cloud Vertex AI 共享配额运行,吞吐量无法保证,高并发场景下可能频繁触发 429 限流。不推荐在对稳定性有严格要求的生产环境中直接使用。 图灵平台提供 Retry 与 Fallback 作为工程化缓解手段,但无法根本解决共享配额问题,且 Fallback 切换模型后输出可能不一致。如需根本解决,需额外购买 Provisioned Throughput(预配吞吐量)。 详见:Gemini 429 限流与预配吞吐量

筛选9/22
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
Vertex AIturing/gemini-3.7-flash
max_input_tokens: 1,048,576
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $1.50 $0.75
输出: $7.50 $3.75
缓存读: $0.15 $0.075
网页搜索: $14 / 1K
优惠价有效期至 2026-12-31(通过净支出 50% 额度返还实现);2027-01-01 起标准价为输入 $1.50 / 输出 $7.50 / 缓存读 $0.15
Vertex AI 共享配额
上线: 2026-08-17
中国区
欧洲区
北美区
亚太区
最新 Flash 模型;支持 PDF 输入、思考模式与内置网页搜索
Vertex AIturing/gemini-3.6-flash
max_input_tokens: 1,048,576
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $1.5
输出: $7.5
缓存读: $0.15
网页搜索: $14 / 1K
Vertex AI 共享配额
上线: 2026-07-23
中国区
欧洲区
北美区
亚太区
针对多步编排、全栈代码重构、Agent 执行与空间推理优化;支持 PDF 输入、思考模式与内置网页搜索
Vertex AIturing/gemini-3.5-flash
max_input_tokens: 1,048,576
max_output_tokens: 65,535
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $1.5
输出: $9
缓存读: $0.15
网页搜索: $14 / 1K
Vertex AI 共享配额
上线: 2026-05-19
中国区
欧洲区
北美区
亚太区
支持思考模式 & 内置网页搜索
Vertex AIturing/gemini-3.1-pro-latest
max_input_tokens: 1,048,576
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $2
输出: $12
缓存读: $0.4
网页搜索: $14 / 1K
分阶梯收费:超过 200K 输入后 输入: $4 / 输出: $18
Vertex AI 共享配额
上线: 2026-02-19
中国区
欧洲区
北美区
亚太区
最新版本 支持思考模式(含 MEDIUM 级别)& 内置网页搜索
Vertex AIturing/gemini-3.1-flash-lite-latest
max_input_tokens: 1,048,576
max_output_tokens: 65,535
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.25
输出: $1.5
网页搜索: $14 / 1K
Vertex AI 共享配额
上线: 2025-12-18
中国区
欧洲区
北美区
亚太区
最新版本 支持思考模式 & 内置网页搜索
Vertex AIturing/gemini-3.1-flash-image
max_input_tokens: 131,072
max_output_tokens: 32,768
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.50
输出: $3(Text)/$60(Image)
网页搜索: $14 / 1K
Vertex AI 共享配额
上线: 2025-12-18
中国区
欧洲区
北美区
亚太区
最新版本 支持思考模式 & 输出图像
Vertex AIturing/gemini-3.1-flash-lite-image
max_input_tokens: 65,536
max_output_tokens: 4,096
输入:
输出:
工具: 不支持
思考: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.25
输出: $1.5(Text)/$30(Image)
Vertex AI 共享配额
上线: 2026-07-01
中国区
欧洲区
北美区
亚太区
Nano Banana 2 Lite,轻量图像生成,输出分辨率最高 1K
Vertex AIturing/gemini-3-flash-latest
max_input_tokens: 1,048,576
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.5
输出: $3
网页搜索: $14 / 1K
Vertex AI 共享配额
上线: 2025-12-18
预计下线: 2026-06-15
中国区
欧洲区
北美区
亚太区
支持思考模式 & 内置网页搜索
Vertex AIturing/gemini-3-pro-image
max_input_tokens: 65,000
max_output_tokens: 32,000
输入:
输出:
工具: -
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions
SDK: OpenAI SDK
输入: $2
输出: $12(Text)/$120(Image)
网页搜索: $14 / 1K
阶梯收费
Vertex AI 共享配额
上线: 2025-11-19
中国区
欧洲区
北美区
亚太区
最新版本 支持思考模式

Claude

警告

由于 Anthropic 政策限制,Claude 系列模型随时可能不可用,建议仅在个人项目中试用。

筛选8/20
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
Anthropicturing/claude-sonnet-5
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $3 $2
输出: $15 $10
缓存读: $0.3 $0.2
缓存写 5m: $3.75 $2.5
缓存写 1h: $6 $4
网页搜索: $10 / 1K
促销价有效期至 2026-08-31;2026-09-01 起标准价为输入 $3 / 输出 $15 / 缓存读 $0.3 / 缓存写 $3.75(5m)、$6(1h)
Vertex AI(全球部署)
上线: 2026-07-01
中国区
欧洲区
北美区
亚太区
最新 Sonnet 模型,默认开启 adaptive 思考;不支持 enabled/budget_tokens,支持工具、显式缓存与联网搜索
Anthropicturing/claude-fable-5
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $10
输出: $50
缓存读: $1
缓存写 5m: $12.5
缓存写 1h: $20
网页搜索: $10 / 1K
Vertex AI(全球部署)
中国区
欧洲区
北美区
亚太区
新一代 Claude 模型,adaptive 思考始终开启且不可禁用;支持工具、显式缓存与联网搜索;严禁用于模型蒸馏,违者图灵平台有权追究责任
Anthropicturing/claude-opus-5
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $5
输出: $25
缓存读: $0.5
缓存写 5m: $6.25
缓存写 1h: $10
网页搜索: $10 / 1K
Vertex AI(全球部署)
中国区
欧洲区
北美区
亚太区
新增:最新 Opus 旗舰型号,仅支持 adaptive 思考模式;支持工具、显式缓存与联网搜索
Anthropicturing/claude-opus-4.8
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $5
输出: $25
缓存读: $0.5
缓存写 5m: $6.25
缓存写 1h: $10
网页搜索: $10 / 1K
Vertex AI(全球部署)
上线: 2026-06-01
中国区
欧洲区
北美区
亚太区
支持工具,仅支持 adaptive 思考模式(默认关闭,需显式传 thinking.type=adaptive)
Anthropicturing/claude-opus-4.7
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $5
输出: $25
缓存读: $0.5
缓存写 5m: $6.25
缓存写 1h: $10
网页搜索: $10 / 1K
Vertex AI(全球部署)
上线: 2026-04-15
中国区
欧洲区
北美区
亚太区
支持工具,仅支持 adaptive 思考模式(默认关闭,需显式传 thinking.type=adaptive)
Anthropicturing/claude-opus-4.6
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $5
输出: $25
缓存读: $0.5
缓存写 5m: $6.25
缓存写 1h: $10
网页搜索: $10 / 1K
Vertex AI(全球部署)
上线: 2026-02-25
中国区
欧洲区
北美区
亚太区
支持工具,推荐使用 adaptive 思考模式
Anthropicturing/claude-sonnet-4.6
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $3
输出: $15
缓存读: $0.3
缓存写 5m: $3.75
缓存写 1h: $6
网页搜索: $10 / 1K
Vertex AI(全球部署)
上线: 2026-02-25
中国区
欧洲区
北美区
亚太区
最新版本 支持工具
Anthropicturing/claude-haiku-4.5
max_input_tokens: 200,000
max_output_tokens: 64,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: $1
输出: $5
缓存读: $0.1
缓存写 5m: $1.25
缓存写 1h: $2
网页搜索: $10 / 1K
Vertex AI(全球部署)
上线: 2026-01-19
中国区
欧洲区
北美区
亚太区
支持工具

字节火山

筛选8/22
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
字节火山doubao-seed-2.1-pro
max_input_tokens: 262,144
max_output_tokens: 262,144
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥6
输出: ¥30
缓存读: ¥1.2
字节火山
上线: 2026-06-24
中国区Seed 2.1 旗舰版,支持视频理解
字节火山doubao-seed-2.1-turbo
max_input_tokens: 262,144
max_output_tokens: 262,144
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥3
输出: ¥15
缓存读: ¥0.6
字节火山
上线: 2026-06-24
中国区Seed 2.1 均衡版,支持视频理解 + GUI Agent
字节火山doubao-seed-character
max_input_tokens: 131,072
max_output_tokens: 32,768
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥0.8
输出: ¥2
缓存读: ¥0.16
字节火山
上线: 2026-06-28
中国区角色扮演/虚拟陪伴,支持图文理解、深度思考与工具调用
字节火山doubao-seed-2-0-pro-260215
max_input_tokens: 262,144
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
字节火山
上线: 2026-02-25
中国区最新版本 Seed 2.0 旗舰版,支持视频理解
字节火山doubao-seed-2-0-lite-260215
max_input_tokens: 262,144
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
字节火山
上线: 2026-02-25
中国区最新版本 Seed 2.0 中端版,支持视频理解
字节火山doubao-seed-2-0-lite-260428
max_input_tokens: 262,144
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
字节火山
上线: 2026-04-28
中国区Seed 2.0 全模态版,支持文本/图像/视频/音频统一理解 + 深度思考
字节火山doubao-seed-2-0-mini-260215
max_input_tokens: 262,144
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
字节火山
上线: 2026-02-25
中国区最新版本 Seed 2.0 轻量版,支持视频理解
字节火山doubao-seed-2-0-code-preview-260215
max_input_tokens: 262,144
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK
字节火山
上线: 2026-02-25
中国区代码预览版

阿里 DashScope

筛选9/41
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
阿里DashScopeqwen3.8-max
max_input_tokens: 991,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥12
输出: ¥36
缓存读: ¥1.5
阿里云
上线: 2026-08-03
中国区旗舰版 3.8,视觉-语言(图像/视频输入)
阿里DashScopeqwen3.7-plus
max_input_tokens: 991,000
max_output_tokens: 64,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
阿里云
上线: 2026-06-08
中国区高性价比版 3.7,视觉-语言(图像输入)
阿里DashScopeqwen3.7-flash
max_input_tokens: 991,000
max_output_tokens: 64,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥0.2
输出: ¥0.8
缓存读: ¥0.04
阿里云
上线: 2026-07-28
中国区轻量版 3.7,视觉-语言(图像输入)
阿里DashScopeqwen3.7-max
max_input_tokens: 991,000
max_output_tokens: 64,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥6
输出: ¥18
缓存读: ¥1.2
阿里云
上线: 2026-05-28
中国区旗舰版 3.7
阿里DashScopeqwen3.6-plus
max_input_tokens: 983,616
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
阿里云
上线: 2026-04-03
中国区稳定版,当前与 qwen3.6-plus-2026-04-02 能力相同
阿里DashScopeqwen3.6-flash
max_input_tokens: 983,616
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
阿里云
上线: 2026-04-23
中国区轻量版 3.6
阿里DashScopeqwen3.6-max
max_input_tokens: 229,376
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
阿里云
上线: 2026-04-23
预计下线: 2026-09-08
中国区旗舰版 3.6
阿里DashScopeqwen3.5-plus
max_input_tokens: 983,616
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
阿里云
上线: 2026-02-25
中国区快照版本
阿里DashScopeqwen3.5-flash
max_input_tokens: 983,616
max_output_tokens: 65,536
输入:
输出:
工具: 支持
思考: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
阿里云
上线: 2026-02-25
中国区快照版本

Deepseek

带日期的正式版

deepseek-v4-pro-0813(2026-08-13)与 deepseek-v4-flash-0731(2026-07-31)是 DeepSeek V4 两个档位的正式版,以固定版本 id 提供;不带日期的 deepseek-v4-pro / deepseek-v4-flash 继续保留,行为不变。调用方式相同,改模型名即可切换。

注意计费差异:两个带日期的版本按峰谷价计费,不带日期的两个仍是单一价;限流额度按档位共用(pro 与 pro-0813 共用,flash 与 flash-0731 共用,aliyun/deepseek-v4-flash-0731 也算在 flash 这一份里)。峰谷时段随上游走:deepseek-v4-flash-0731 直连 DeepSeek 官方,忙时只有东八区 09:00-12:00、14:00-18:00deepseek-v4-pro-0813aliyun/deepseek-v4-flash-0731 在阿里云百炼上,闲时为东八区 22:00 至次日 08:00。均以账单时间为准,明细见用量与计费

新增模型:bytedance/deepseek-v4-flash

DeepSeek V4 Flash 的火山部署,与阿里云上的 deepseek-v4-flash token 单价相同。额外支持 Ark 内置联网搜索,但该能力只在 /v1/responses 上可用,详见 联网搜索 → 字节火山 Ark

筛选7/14
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
Deepseekdeepseek-v4-flash-0731
max_input_tokens: 1,000,000
max_output_tokens: 393,216
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥3
输出: ¥9
缓存读: ¥0.3 ¥0.1
峰谷定价:高峰时段为东八区 09:00-12:00、14:00-18:00(以账单时间为准),其余时间均为闲时,输入 ¥1.5 / 输出 ¥4.5 / 缓存命中 ¥0.05
DeepSeek 官方
上线: 2026-07-31
中国区直连 DeepSeek 官方,实测长会话缓存命中率 99%;Agent 接入见 DeepSeek Harness 指南
阿里DashScopealiyun/deepseek-v4-flash-0731
max_input_tokens: 1,000,000
max_output_tokens: 393,216
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥3
输出: ¥9
缓存读: ¥0.3
峰谷定价:闲时(东八区 22:00 至次日 08:00,以账单时间为准)输入 ¥1.5 / 输出 ¥4.5 / 缓存命中 ¥0.15
阿里云
上线: 2026-07-31
中国区阿里云百炼托管的 V4 Flash 正式版,与直连官方的 deepseek-v4-flash-0731 是同一快照、共用同一份限流额度;缓存命中价(¥0.3 对 ¥0.1)与闲时时段(夜间 对 非高峰)不同
Deepseekdeepseek-v4-pro
max_input_tokens: 1,000,000
max_output_tokens: 393,216
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥12
输出: ¥24
缓存读: ¥1
阿里云
上线: 2026-04-25
中国区
Deepseekdeepseek-v4-pro-0813
max_input_tokens: 1,000,000
max_output_tokens: 393,216
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥9
输出: ¥27
缓存读: ¥0.9
峰谷定价:闲时(东八区 22:00 至次日 08:00,以账单时间为准)输入 ¥4.5 / 输出 ¥13.5 / 缓存命中 ¥0.45
阿里云
上线: 2026-08-13
中国区新增:V4 Pro 正式版(固定版本 id),与 deepseek-v4-pro 并存、共用同一份限流额度;两者价格不同,本模型按峰谷计价
Deepseekdeepseek-v4-flash
max_input_tokens: 1,000,000
max_output_tokens: 393,216
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥1
输出: ¥2
缓存读: ¥0.2
阿里云
上线: 2026-04-25
中国区
字节火山bytedance/deepseek-v4-flash
max_input_tokens: 1,048,576
max_output_tokens: 393,216
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥1
输出: ¥2
字节火山
上线: 2026-07-28
中国区DeepSeek V4 Flash 的火山部署;内置联网搜索仅在 v1/responses 上可用
Deepseekturing/deepseek-v3-2
max_input_tokens: 64,000
max_output_tokens: 8,192
输入:
输出:
工具: 不支持
思考: 支持
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: ¥2
输出: ¥3
[0, 32] 输入: ¥2 输出: ¥3 / (32, 128] 输入: ¥4 输出: ¥6
火山引擎(中国)
上线: 2025-12-11
中国区v1/responses 仅支持流式

智谱

筛选6/17
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
智谱glm-5.3
max_input_tokens: 1,048,576
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥8
输出: ¥28
缓存读: ¥2
智谱
上线: 2026-08-19
中国区开源旗舰,1M 上下文
智谱glm-5.2
max_input_tokens: 1,048,576
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥8
输出: ¥28
缓存读: ¥2
智谱
上线: 2026-06-17
中国区最新旗舰,1M 上下文
智谱glm-5.1
max_input_tokens: 204,800
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
智谱
上线: 2026-04-09
中国区
智谱glm-5
max_input_tokens: 204,800
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
内置工具: 🔍 网页搜索
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
智谱
上线: 2026-02-24
中国区
智谱glm-4.7
max_input_tokens: 204,800
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
智谱
上线: 2025-12-23
中国区
智谱glm-4.6
max_input_tokens: 204,800
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
智谱
上线: 2025-11-11
中国区

MiniMax

筛选5/11
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
MiniMaxminimax-m3
max_input_tokens: 1,048,576
max_output_tokens: 131,072
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages
SDK: OpenAI SDK / Anthropic SDK
输入: ¥4.2 ¥2.1
输出: ¥16.8 ¥8.4
缓存读: ¥0.84 ¥0.42
限时 5 折;上下文 512K-1M 输入 ¥4.2 / 输出 ¥16.8 / 缓存读 ¥0.84
MiniMax
上线: 2026-06-17
中国区MiniMax M3;v1/responses 仅支持流式
MiniMaxminimax-m2.7
max_input_tokens: 204,800
max_output_tokens: 131,072
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK / Anthropic SDK
输入: ¥2.1
输出: ¥8.4
阿里云
上线: 2026-03-23
中国区最新版本 M2.7
MiniMaxminimax-m2.5-highspeed
max_input_tokens: 204,800
max_output_tokens: 204,800
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: ¥4.2
输出: ¥16.8
MiniMax
上线: 2026-02-25
中国区
MiniMaxminimax-m2.5
max_input_tokens: 204,800
max_output_tokens: 204,800
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK / Anthropic SDK
输入: ¥2.1
输出: ¥8.4
MiniMax
上线: 2026-02-25
中国区
MiniMaxminimax-text-01
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: ¥1
输出: ¥8
MiniMax
上线: 2025-04-02
中国区

KIMI

筛选1/6
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
KIMIkimi-k3
max_input_tokens: 1,048,576
max_output_tokens: 1,048,576
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions
SDK: OpenAI SDK / Anthropic SDK
输入: ¥20
输出: ¥100
缓存读: ¥2
阿里云
上线: 2026-07-21
中国区Kimi 旗舰模型,支持 1M 上下文、图像理解、深度思考与工具调用;v1/responses 仅支持流式

小米 MiMo

筛选1/1
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
Xiaomimimo-v2.5-pro
max_input_tokens: 1,000,000
max_output_tokens: 128,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: ¥7
输出: ¥21
缓存读: ¥1.4
阿里云
上线: 2026-05-28
中国区小米开源推理模型

Bedrock

筛选4/4
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
Bedrockturing/nova-lite-v2
max_input_tokens: 1,000,000
max_output_tokens: 64,000
输入:
输出:
工具: 支持
缓存: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.30
输出: $2.50
缓存读: $0.075
AWS Bedrock(美国)
上线: 2026-07-22
中国区
欧洲区
北美区
亚太区
Nova 2 Lite
Bedrockturing/nova-pro
max_input_tokens: 300,000
max_output_tokens: 10,000
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.80
输出: $3.20
AWS Bedrock(美国)
上线: 2026-07-22
中国区
欧洲区
北美区
亚太区
Nova Pro
Bedrocknova-lite-v1
max_input_tokens: 290,000
max_output_tokens: 10,000
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.06
输出: $0.24
AWS Bedrock(美国)
上线: 2025-08-21
中国区
欧洲区
北美区
亚太区
Bedrockturing/titan-nove-lite-v1
max_input_tokens: 290,000
max_output_tokens: 10,000
输入:
输出:
工具: 支持
API: v1/chat/completions
SDK: OpenAI SDK
输入: $0.06
输出: $0.24
AWS Bedrock(美国)
上线: 2025-08-21
中国区
欧洲区
北美区
亚太区

Grok

筛选4/4
厂商接口模型ID模型能力endpoint价格(每百万 Tokens)负载与上下线支持访问地区备注
xAIturing/grok-4.3
max_input_tokens: 1,000,000
max_output_tokens: 1,000,000
输入:
输出:
工具: 支持
思考: 支持
缓存: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $1.25
输出: $2.5
缓存读: $0.2
xAI API
上线: 2026-05-28
中国区
欧洲区
北美区
亚太区
xAIturing/grok-4-0709
max_input_tokens: 256,000
max_output_tokens: 256,000
输入:
输出:
工具: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $3
输出: $15
xAI API
上线: 2025-10-13
中国区
欧洲区
北美区
亚太区
xAIturing/grok-4-fast-non-reasoning
max_input_tokens: 2,000,000
max_output_tokens: 2,000,000
输入:
输出:
工具: 不支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.2
输出: $0.5
xAI API
上线: 2025-10-13
中国区
欧洲区
北美区
亚太区
xAIturing/grok-4-fast-reasoning
max_input_tokens: 2,000,000
max_output_tokens: 2,000,000
输入:
输出:
工具: 支持
思考: 支持
API: v1/chat/completions, v1/messages, v1/responses
SDK: OpenAI SDK / Anthropic SDK
输入: $0.2
输出: $0.5
xAI API
上线: 2025-10-13
中国区
欧洲区
北美区
亚太区