聊天模型列表
OpenAI
新增模型:
turing/gpt-6-sol / turing/gpt-6-lunaGPT-6 Sol 兼顾智能与速度,适合推理与编码;GPT-6 Luna 面向成本敏感、高吞吐的场景。两者与 GPT-6 Astra 使用同一套请求约定:推荐使用 v1/responses;v1/chat/completions 仅有限支持文本请求,工具调用请使用 Responses API;推理强度支持 low / medium / high / xhigh / max,不支持 none / minimal。短上下文价格:Sol 输入 $2 / 输出 $10 / 缓存读 $0.2,Luna 输入 $0.1 / 输出 $0.5 / 缓存读 $0.01;超过 272K 输入 token 的整次请求按长上下文价格计费。
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| Azure | turing/gpt-6-astra | API: v1/chat/completions(有限支持), v1/responses SDK: OpenAI SDK | 输入: $10输出: $50缓存读: $1缓存写 5m: $12.5网页搜索: $10 / 1K>272K 输入时整次请求按长上下文价计费(输入 $20 / 缓存读 $2 / 缓存写 $25 / 输出 $75);缓存写按输入价 1.25× 计费;Azure 当前定价页显示价格发布中,请以 Azure 账单为准 → | Azure全球 上线: 2026-09-03 | 中国区 欧洲区 北美区 亚太区 | GPT-6 Astra,面向复杂推理、编码、研究和文档创作;v1/chat/completions 仅有限支持(文本);reasoning effort 支持 low/medium/high/xhigh/max;工具调用请使用 Responses API | |
| Azure | turing/gpt-6-sol | API: v1/chat/completions(有限支持), v1/responses SDK: OpenAI SDK | 输入: $2输出: $10缓存读: $0.2缓存写 5m: $2.5>272K 输入时整次请求按长上下文价计费(输入 $4 / 缓存读 $0.4 / 缓存写 $5 / 输出 $15);缓存写按输入价 1.25× 计费 → | Azure全球 上线: 2026-09-23 | 中国区 欧洲区 北美区 亚太区 | GPT-6 Sol,兼顾智能与速度的推理与编码模型;v1/chat/completions 仅有限支持(文本);reasoning effort 支持 low/medium/high/xhigh/max;工具调用请使用 Responses API | |
| Azure | turing/gpt-6-luna | API: v1/chat/completions(有限支持), v1/responses SDK: OpenAI SDK | 输入: $0.1输出: $0.5缓存读: $0.01缓存写 5m: $0.125>272K 输入时整次请求按长上下文价计费(输入 $0.2 / 缓存读 $0.02 / 缓存写 $0.25 / 输出 $0.75);缓存写按输入价 1.25× 计费 → | Azure全球 上线: 2026-09-23 | 中国区 欧洲区 北美区 亚太区 | GPT-6 Luna,面向成本敏感、高吞吐场景的高性价比模型;v1/chat/completions 仅有限支持(文本);reasoning effort 支持 low/medium/high/xhigh/max;工具调用请使用 Responses API | |
| Azure | turing/gpt-5.6-sol | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: 输出: 缓存读: $0.5短上下文促销价 2026-09-01 生效,至少延续至 2026-11-30,仅下调输入与输出:缓存读 $0.5、缓存写 $6.25 不变。>272K 输入时整次请求按长上下文价计费:输入 $10 / 缓存读 $1 / 缓存写 $12.5 / 输出 $45 → | Azure全球 上线: 2026-07-10 | 中国区 欧洲区 北美区 亚太区 | GPT-5.6 旗舰型号,适合复杂推理任务;支持 max 推理强度 | |
| Azure | turing/gpt-5.6-terra | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: 输出: 缓存读: >272K 输入时整次请求按长上下文价计费:输入 $5 / 缓存读 $0.5 / 输出 $22.5;缓存写按输入价 1.25× 计费 → | Azure全球 上线: 2026-07-10 | 中国区 欧洲区 北美区 亚太区 | GPT-5.6 均衡型号,兼顾能力与成本;支持 max 推理强度 | |
| Azure | turing/gpt-5.6-luna | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: 输出: 缓存读: >272K 输入时整次请求按长上下文价计费:输入 $2 / 缓存读 $0.2 / 输出 $9;缓存写按输入价 1.25× 计费 → | Azure全球 上线: 2026-07-10 | 中国区 欧洲区 北美区 亚太区 | GPT-5.6 最快、成本最低的型号,适合高吞吐任务;支持 max 推理强度 | |
| Azure | turing/gpt-5.5 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $5输出: $30缓存读: $0.5 | Azure全球 | 中国区 欧洲区 北美区 亚太区 | 新一代旗舰模型,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.4 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $2.5输出: $15缓存读: $0.25 | Azure全球 | 中国区 欧洲区 北美区 亚太区 | 上一代升级版本,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.4-mini | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.75输出: $4.5缓存读: $0.07 | Azure全球 | 中国区 欧洲区 北美区 亚太区 | 高性价比mini模型,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.4-nano | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.2输出: $1.25缓存读: $0.02 | Azure全球 | 中国区 欧洲区 北美区 亚太区 | 超低成本nano模型,适合分类和子代理任务 | |
| Azure | turing/gpt-5.3-codex | API: v1/responses SDK: OpenAI SDK | 输入: $1.75输出: $14缓存读: $0.17 | Azure全球 上线: 2026-02-26 | 中国区 欧洲区 北美区 亚太区 | 仅支持 Response API, 支持推理token | |
| Azure | turing/gpt-5.3-chat | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.75输出: $14缓存读: $0.17 | Azure全球 上线: 2026-03-16 | 中国区 欧洲区 北美区 亚太区 | ||
| Azure | turing/gpt-5.2 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.75输出: $14缓存读: $0.17 | Azure全球 上线: 2025-12-11 | 中国区 欧洲区 北美区 亚太区 | 升级版本,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.2-chat | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.75输出: $14缓存读: $0.17 | Azure 全球 上线: 2025-12-11 | 中国区 欧洲区 北美区 亚太区 | 升级版本,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.2-codex | API: v1/responses SDK: OpenAI SDK | 输入: $1.75输出: $14缓存读: $0.17 | Azure 全球 上线: 2025-12-11 | 中国区 欧洲区 北美区 亚太区 | 仅支持 Response API | |
| Azure | turing/gpt-5.1 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.25输出: $10缓存读: $0.12 | Azure 全球 上线: 2025-11-13 | 中国区 欧洲区 北美区 亚太区 | 升级版本,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.1-chat | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.25输出: $10缓存读: $0.12 | Azure 全球 上线: 2025-11-13 | 中国区 欧洲区 北美区 亚太区 | 升级版本,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.1-codex | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 输入: $1.25输出: $10缓存读: $0.12 | Azure 全球 上线: 2025-08-10 | 中国区 欧洲区 北美区 亚太区 | 思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.1-codex-mini | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 输入: $0.25输出: $2缓存读: $0.03 | Azure 全球 上线: 2025-08-10 | 中国区 欧洲区 北美区 亚太区 | 思考功能推荐使用 Response API | |
| Azure | turing/gpt-5 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.25输出: $10缓存读: $0.12 | Azure 全球 上线: 2025-08-10 | 中国区 欧洲区 北美区 亚太区 | 思考功能推荐使用 Response API | |
| Azure | turing/gpt-5-mini | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.25输出: $2缓存读: $0.03 | Azure 全球 上线: 2025-08-10 | 中国区 欧洲区 北美区 亚太区 | 思考功能推荐使用 Response API | |
| Azure | turing/gpt-5-nano | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.05输出: $0.4缓存读: $0.01 | Azure 全球 上线: 2025-08-10 | 中国区 欧洲区 北美区 亚太区 | 思考功能推荐使用 Response API | |
| Azure | turing/gpt-5-chat | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.25输出: $10缓存读: $0.12 | Azure 全球 上线: 2025-08-10 预计下线: 2026-04-15 | 中国区 欧洲区 北美区 亚太区 | 思考功能推荐使用 Response API | |
| Azure | turing/o3 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | Azure 全球 上线: 2025-04-17 | 中国区 欧洲区 北美区 亚太区 | 思考模型,推荐使用 Response API | ||
| Azure | turing/gpt-4.1 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $2输出: $8缓存读: $0.50 | Azure 全球 上线: 2025-04-16 | 中国区 欧洲区 北美区 亚太区 | ||
| Azure | turing/o4-mini | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | Azure 全球 上线: 2025-04-16 | 中国区 欧洲区 北美区 亚太区 | 思考模型,推荐使用 Response API | ||
| Azure | turing/gpt-4.1-mini | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.4输出: $1.6缓存读: $0.10 | Azure 全球 上线: 2025-04-14 | 中国区 欧洲区 北美区 亚太区 | ||
| Azure | turing/gpt-4.1-nano | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.1输出: $0.4缓存读: $0.03 | Azure 全球 上线: 2025-04-14 | 中国区 欧洲区 北美区 亚太区 |
Gemini
Gemini 模型负载说明
Gemini 系列模型基于 Google Cloud Vertex AI 共享配额运行,吞吐量无法保证,高并发场景下可能频繁触发 429 限流。不推荐在对稳定性有严格要求的生产环境中直接使用。 图灵平台提供 Retry 与 Fallback 作为工程化缓解手段,但无法根本解决共享配额问题,且 Fallback 切换模型后输出可能不一致。如需根本解决,需额外购买 Provisioned Throughput(预配吞吐量)。 详见:Gemini 429 限流与预配吞吐量
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| Vertex AI | turing/gemini-3.8-flash | max_input_tokens: 1,048,576max_output_tokens: 65,536输出: 工具: 支持 思考: 支持 缓存: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | 输入: 输出: 缓存读: 网页搜索: $14 / 1K优惠价有效期至 2026-12-31(通过净支出 50% 额度返还实现);2027-01-01 起标准价为输入 $1.50 / 输出 $7.50 / 缓存读 $0.15 → | Vertex AI 共享配额 上线: 2026-09-03 | 中国区 欧洲区 北美区 亚太区 | 最新 Flash 模型,面向长周期软件工程、自主 Agent 与复杂企业工作流;支持 PDF 输入、思考模式与内置网页搜索 |
| Vertex AI | turing/gemini-3.7-flash | max_input_tokens: 1,048,576max_output_tokens: 65,536输出: 工具: 支持 思考: 支持 缓存: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | 输入: 输出: 缓存读: 网页搜索: $14 / 1K优惠价有效期至 2026-12-31(通过净支出 50% 额度返还实现);2027-01-01 起标准价为输入 $1.50 / 输出 $7.50 / 缓存读 $0.15 → | Vertex AI 共享配额 上线: 2026-08-17 | 中国区 欧洲区 北美区 亚太区 | 面向通用 Agent 工作流、多步编排与代码任务;支持 PDF 输入、思考模式与内置网页搜索 |
| Vertex AI | turing/gemini-3.6-flash | max_input_tokens: 1,048,576max_output_tokens: 65,536输出: 工具: 支持 思考: 支持 缓存: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2026-07-23 | 中国区 欧洲区 北美区 亚太区 | 针对多步编排、全栈代码重构、Agent 执行与空间推理优化;支持 PDF 输入、思考模式与内置网页搜索 | |
| Vertex AI | turing/gemini-3.5-flash | max_input_tokens: 1,048,576max_output_tokens: 65,535输出: 工具: 支持 思考: 支持 缓存: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2026-05-19 | 中国区 欧洲区 北美区 亚太区 | 支持思考模式 & 内置网页搜索 | |
| Vertex AI | turing/gemini-3.1-pro-latest | max_input_tokens: 1,048,576max_output_tokens: 65,536输出: 工具: 支持 思考: 支持 缓存: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2026-02-19 | 中国区 欧洲区 北美区 亚太区 | 最新版本 支持思考模式(含 MEDIUM 级别)& 内置网页搜索 | |
| Vertex AI | turing/gemini-3.1-flash-lite-latest | max_input_tokens: 1,048,576max_output_tokens: 65,535输出: 工具: 支持 思考: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2025-12-18 | 中国区 欧洲区 北美区 亚太区 | 最新版本 支持思考模式 & 内置网页搜索 | |
| Vertex AI | turing/gemini-3.1-flash-image | max_input_tokens: 131,072max_output_tokens: 32,768输出: 工具: 支持 思考: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2025-12-18 | 中国区 欧洲区 北美区 亚太区 | 最新版本 支持思考模式 & 输出图像 | |
| Vertex AI | turing/gemini-3.1-flash-lite-image | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2026-07-01 | 中国区 欧洲区 北美区 亚太区 | Nano Banana 2 Lite,轻量图像生成,输出分辨率最高 1K | ||
| Vertex AI | turing/gemini-3-flash-latest | max_input_tokens: 1,048,576max_output_tokens: 65,536输出: 工具: 支持 思考: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2025-12-18 预计下线: 2026-06-15 | 中国区 欧洲区 北美区 亚太区 | 支持思考模式 & 内置网页搜索 | |
| Vertex AI | turing/gemini-3-pro-image | max_input_tokens: 65,000max_output_tokens: 32,000输出: 工具: - 思考: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2025-11-19 | 中国区 欧洲区 北美区 亚太区 | 最新版本 支持思考模式 |
Claude
警告
由于 Anthropic 政策限制,Claude 系列模型随时可能不可用,建议仅在个人项目中试用。
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| Anthropic | turing/claude-sonnet-5 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | Vertex AI(全球部署) 上线: 2026-07-01 | 中国区 欧洲区 北美区 亚太区 | 最新 Sonnet 模型,默认开启 adaptive 思考;不支持 enabled/budget_tokens,支持工具、显式缓存与联网搜索 | ||
| Anthropic | turing/claude-opus-4.8 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: $5输出: $25缓存读: $0.5缓存写 5m: $6.25缓存写 1h: $10网页搜索: $10 / 1K | Vertex AI(全球部署) 上线: 2026-06-01 | 中国区 欧洲区 北美区 亚太区 | 支持工具,仅支持 adaptive 思考模式(默认关闭,需显式传 thinking.type=adaptive) | |
| Anthropic | turing/claude-opus-4.7 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: $5输出: $25缓存读: $0.5缓存写 5m: $6.25缓存写 1h: $10网页搜索: $10 / 1K | Vertex AI(全球部署) 上线: 2026-04-15 | 中国区 欧洲区 北美区 亚太区 | 支持工具,仅支持 adaptive 思考模式(默认关闭,需显式传 thinking.type=adaptive) | |
| Anthropic | turing/claude-opus-4.6 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: $5输出: $25缓存读: $0.5缓存写 5m: $6.25缓存写 1h: $10网页搜索: $10 / 1K | Vertex AI(全球部署) 上线: 2026-02-25 | 中国区 欧洲区 北美区 亚太区 | 支持工具,推荐使用 adaptive 思考模式 | |
| Anthropic | turing/claude-sonnet-4.6 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: $3输出: $15缓存读: $0.3缓存写 5m: $3.75缓存写 1h: $6网页搜索: $10 / 1K | Vertex AI(全球部署) 上线: 2026-02-25 | 中国区 欧洲区 北美区 亚太区 | 最新版本 支持工具 | |
| Anthropic | turing/claude-haiku-4.5 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: $1输出: $5缓存读: $0.1缓存写 5m: $1.25缓存写 1h: $2网页搜索: $10 / 1K | Vertex AI(全球部署) 上线: 2026-01-19 | 中国区 欧洲区 北美区 亚太区 | 支持工具 |
字节火山
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| 字节火山 | doubao-seed-2.1-pro | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 字节火山 上线: 2026-06-24 | 中国区 | Seed 2.1 旗舰版,支持视频理解 | ||
| 字节火山 | doubao-seed-2.1-turbo | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 字节火山 上线: 2026-06-24 | 中国区 | Seed 2.1 均衡版,支持视频理解 + GUI Agent | ||
| 字节火山 | doubao-seed-character | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 字节火山 上线: 2026-06-28 | 中国区 | 角色扮演/虚拟陪伴,支持图文理解、深度思考与工具调用 | ||
| 字节火山 | doubao-seed-2-0-pro-260215 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 字节火山 上线: 2026-02-25 | 中国区 | 最新版本 Seed 2.0 旗舰版,支持视频理解 | ||
| 字节火山 | doubao-seed-2-0-lite-260215 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 字节火山 上线: 2026-02-25 | 中国区 | 最新版本 Seed 2.0 中端版,支持视频理解 | ||
| 字节火山 | doubao-seed-2-0-lite-260428 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 字节火山 上线: 2026-04-28 | 中国区 | Seed 2.0 全模态版,支持文本/图像/视频/音频统一理解 + 深度思考 | ||
| 字节火山 | doubao-seed-2-0-mini-260215 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 字节火山 上线: 2026-02-25 | 中国区 | 最新版本 Seed 2.0 轻量版,支持视频理解 | ||
| 字节火山 | doubao-seed-2-0-code-preview-260215 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 字节火山 上线: 2026-02-25 | 中国区 | 代码预览版 |
阿里 DashScope
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| 阿里DashScope | qwen3.8-max | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-08-03 | 中国区 | 旗舰版 3.8,视觉-语言(图像/视频输入) | ||
| 阿里DashScope | qwen3.8-flash | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-08-31 | 中国区 | 轻量版 3.8,视觉-语言(图像/视频输入) | ||
| 阿里DashScope | qwen3.8-27b | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-09-10 | 中国区 | 27B 版本 3.8,视觉-语言(图像/视频输入) | ||
| 阿里DashScope | qwen3.7-plus | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-06-08 | 中国区 | 高性价比版 3.7,视觉-语言(图像输入) | ||
| 阿里DashScope | qwen3.7-flash | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-07-28 | 中国区 | 轻量版 3.7,视觉-语言(图像输入) | ||
| 阿里DashScope | qwen3.7-max | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-05-28 | 中国区 | 旗舰版 3.7 | ||
| 阿里DashScope | qwen3.6-plus | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-04-03 | 中国区 | 稳定版,当前与 qwen3.6-plus-2026-04-02 能力相同 | ||
| 阿里DashScope | qwen3.6-flash | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-04-23 | 中国区 | 轻量版 3.6 | ||
| 阿里DashScope | qwen3.6-max | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-04-23 预计下线: 2026-09-08 | 中国区 | 旗舰版 3.6 | ||
| 阿里DashScope | qwen3.5-plus | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-02-25 | 中国区 | 快照版本 | ||
| 阿里DashScope | qwen3.5-flash | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-02-25 | 中国区 | 快照版本 |
Deepseek
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens,实付 = 标价 × 折扣) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| Deepseek | deepseek-v4.1-flash | API: v1/chat/completions, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: ¥2输出: ¥8缓存读: ¥0.04峰谷定价:高峰时段为东八区周一至周五 09:00-12:00、14:00-18:00(以账单时间为准),周末全天与工作日其余时间均为闲时,输入 ¥1 / 输出 ¥4 / 缓存命中 ¥0.02 → | DeepSeek 官方 上线: 2026-09-11 | 中国区 | 新增:V4.1 Flash 正式版,直连 DeepSeek 官方;原生支持图像输入,与 deepseek-v4-flash-0731 共用同一份限流额度,取代已下线的 V4 Flash 旧版 | |
| 字节火山 | bytedance/deepseek-v4.1-flash | API: v1/chat/completions, v1/responses SDK: OpenAI SDK / Anthropic SDK | 4折 输入: ¥2输出: ¥8缓存读: ¥0.04北京时间 2026-09-24 09:52:17 起 4 折优惠(高峰、闲时价均按 4 折计);峰谷定价:高峰时段为东八区周一至周五 09:00-12:00、14:00-18:00(以账单时间为准),周末全天与工作日其余时间均为闲时,输入 ¥1 / 输出 ¥4 / 缓存命中 ¥0.02 → | 字节火山 上线: 2026-09-17 | 中国区 | 新增:DeepSeek V4.1 Flash 的火山部署(Ark 快照 deepseek-v4-1-flash-260910);原生支持图像输入,与 deepseek-v4.1-flash 共用同一份限流额度、单独计价;内置联网搜索仅在 v1/responses 上可用 | |
| Deepseek | deepseek-v4-pro-0813 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: ¥9输出: ¥27缓存读: ¥0.9峰谷定价:闲时(东八区 22:00 至次日 08:00,以账单时间为准)输入 ¥4.5 / 输出 ¥13.5 / 缓存命中 ¥0.45 | 阿里云 上线: 2026-08-13 | 中国区 | 新增:V4 Pro 正式版(固定版本 id),与 deepseek-v4-pro 并存、共用同一份限流额度;两者价格不同,本模型按峰谷计价 | |
| 阿里DashScope | aliyun/deepseek-v4-flash-0731 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-07-31 | 中国区 | 旧 V4 Flash(0731 快照)的阿里云百炼线路,官方直连线路已下线;缓存命中价 ¥0.3,闲时为东八区每日 22:00 至次日 08:00 | ||
| Deepseek | deepseek-v4-pro | API: v1/chat/completions, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: ¥12输出: ¥24缓存读: ¥1 | 阿里云 上线: 2026-04-25 | 中国区 | ||
| 字节火山 | bytedance/deepseek-v4-flash | API: v1/chat/completions, v1/responses SDK: OpenAI SDK / Anthropic SDK | 字节火山 上线: 2026-07-28 | 中国区 | DeepSeek V4 Flash 的火山部署;内置联网搜索仅在 v1/responses 上可用 | ||
| Deepseek | turing/deepseek-v3-2 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: ¥2输出: ¥3[0, 32] 输入: ¥2 输出: ¥3 / (32, 128] 输入: ¥4 输出: ¥6 | 火山引擎(中国) 上线: 2025-12-11 | 中国区 | v1/responses 仅支持流式 |
智谱
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens,实付 = 标价 × 折扣) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| 智谱 | glm-5.3-flash | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 智谱 上线: 2026-08-26 | 中国区 | 原生多模态,1M 上下文;思考始终开启,支持 low、high、max 推理强度 → | ||
| 智谱 | glm-5.3 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 智谱 上线: 2026-08-19 | 中国区 | 开源旗舰,1M 上下文 | ||
| 阿里DashScope | dashscope/glm-5.3 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-09-20 | 中国区 | 新增:GLM-5.3 的阿里云百炼线路(百炼自营 glm-5.3),与 glm-5.3 共用同一份限流额度、单独计价;仅支持思考模式,1M 上下文,隐式缓存命中按输入价 25% 计 | ||
| 智谱 | glm-5.2 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 智谱 上线: 2026-06-17 | 中国区 | 最新旗舰,1M 上下文 | ||
| 阿里DashScope | dashscope/glm-5.2 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-09-20 | 中国区 | 新增:GLM-5.2 的阿里云百炼线路(百炼自营 glm-5.2),与 glm-5.2 共用同一份限流额度、单独计价;支持思考/非思考模式,1M 上下文,隐式缓存命中按输入价 25% 计 | ||
| 智谱 | glm-5.1 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 智谱 上线: 2026-04-09 | 中国区 | |||
| 智谱 | glm-5 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 智谱 上线: 2026-02-24 | 中国区 | |||
| 智谱 | glm-4.7 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 智谱 上线: 2025-12-23 | 中国区 | |||
| 智谱 | glm-4.6 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 智谱 上线: 2025-11-11 | 中国区 |
MiniMax
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| MiniMax | minimax-m3 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | MiniMax 上线: 2026-06-17 | 中国区 | MiniMax M3;v1/responses 仅支持流式 | ||
| MiniMax | minimax-m2.7 | max_input_tokens: 204,800max_output_tokens: 131,072输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-03-23 | 中国区 | 最新版本 M2.7 | |
| MiniMax | minimax-m2.5-highspeed | max_input_tokens: 204,800max_output_tokens: 204,800输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK | MiniMax 上线: 2026-02-25 | 中国区 | ||
| MiniMax | minimax-m2.5 | max_input_tokens: 204,800max_output_tokens: 204,800输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK / Anthropic SDK | MiniMax 上线: 2026-02-25 | 中国区 | ||
| MiniMax | minimax-text-01 | 输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK | MiniMax 上线: 2025-04-02 | 中国区 |
KIMI
小米 MiMo
Bedrock
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| Bedrock | turing/nova-lite-v2 | API: v1/chat/completions SDK: OpenAI SDK | 输入: $0.30输出: $2.50缓存读: $0.075 | AWS Bedrock(美国) 上线: 2026-07-22 | 中国区 欧洲区 北美区 亚太区 | Nova 2 Lite | |
| Bedrock | turing/nova-pro | max_input_tokens: 300,000max_output_tokens: 10,000输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK | 输入: $0.80输出: $3.20 | AWS Bedrock(美国) 上线: 2026-07-22 | 中国区 欧洲区 北美区 亚太区 | Nova Pro |
| Bedrock | nova-lite-v1 | max_input_tokens: 290,000max_output_tokens: 10,000输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK | 输入: $0.06输出: $0.24 | AWS Bedrock(美国) 上线: 2025-08-21 | 中国区 欧洲区 北美区 亚太区 | |
| Bedrock | turing/titan-nove-lite-v1 | max_input_tokens: 290,000max_output_tokens: 10,000输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK | 输入: $0.06输出: $0.24 | AWS Bedrock(美国) 上线: 2025-08-21 | 中国区 欧洲区 北美区 亚太区 |