聊天模型列表
deepseek-v4-flash-0731deepseek-v4-flash-0731 现在直连 DeepSeek 官方;阿里云百炼托管的同一份快照另以 aliyun/deepseek-v4-flash-0731 提供。两者上下文上限、请求参数、限流额度都一致,输入/输出单价也相同,差别只在缓存命中价(官方 ¥0.1 / 百炼 ¥0.3)和闲时时段。详见 Deepseek。
OpenAI
turing/gpt-5.6-terra / turing/gpt-5.6-luna两个型号的短上下文 Token 单价已下调,调用方式、上下文上限、限流额度均不变,无需改代码:
turing/gpt-5.6-terra:输入 $2.5 → $2,输出 $15 → $12,缓存读 $0.25 → $0.2turing/gpt-5.6-luna:输入 $1 → $0.2,输出 $6 → $1.2,缓存读 $0.1 → $0.02
turing/gpt-5.6-sol 价格不变。>272K 长上下文价格不在本次下调范围内,以表内价格备注为准。
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| Azure | turing/gpt-5.6-sol | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | Azure全球 上线: 2026-07-10 | 中国区 欧洲区 北美区 亚太区 | GPT-5.6 旗舰型号,适合复杂推理任务;支持 max 推理强度 | ||
| Azure | turing/gpt-5.6-terra | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: 输出: 缓存读: >272K 输入时整次请求按长上下文价计费:输入 $5 / 缓存读 $0.5 / 输出 $22.5;缓存写按输入价 1.25× 计费 → | Azure全球 上线: 2026-07-10 | 中国区 欧洲区 北美区 亚太区 | GPT-5.6 均衡型号,兼顾能力与成本;支持 max 推理强度 | |
| Azure | turing/gpt-5.6-luna | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: 输出: 缓存读: >272K 输入时整次请求按长上下文价计费:输入 $2 / 缓存读 $0.2 / 输出 $9;缓存写按输入价 1.25× 计费 → | Azure全球 上线: 2026-07-10 | 中国区 欧洲区 北美区 亚太区 | GPT-5.6 最快、成本最低的型号,适合高吞吐任务;支持 max 推理强度 | |
| Azure | turing/gpt-5.5 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $5输出: $30缓存读: $0.5 | Azure全球 | 中国区 欧洲区 北美区 亚太区 | 新一代旗舰模型,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.4 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $2.5输出: $15缓存读: $0.25 | Azure全球 | 中国区 欧洲区 北美区 亚太区 | 上一代升级版本,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.4-mini | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.75输出: $4.5缓存读: $0.07 | Azure全球 | 中国区 欧洲区 北美区 亚太区 | 高性价比mini模型,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.4-nano | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.2输出: $1.25缓存读: $0.02 | Azure全球 | 中国区 欧洲区 北美区 亚太区 | 超低成本nano模型,适合分类和子代理任务 | |
| Azure | turing/gpt-5.3-codex | API: v1/responses SDK: OpenAI SDK | 输入: $1.75输出: $14缓存读: $0.17 | Azure全球 上线: 2026-02-26 | 中国区 欧洲区 北美区 亚太区 | 仅支持 Response API, 支持推理token | |
| Azure | turing/gpt-5.3-chat | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.75输出: $14缓存读: $0.17 | Azure全球 上线: 2026-03-16 | 中国区 欧洲区 北美区 亚太区 | ||
| Azure | turing/gpt-5.2 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.75输出: $14缓存读: $0.17 | Azure全球 上线: 2025-12-11 | 中国区 欧洲区 北美区 亚太区 | 升级版本,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.2-chat | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.75输出: $14缓存读: $0.17 | Azure 全球 上线: 2025-12-11 | 中国区 欧洲区 北美区 亚太区 | 升级版本,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.2-codex | API: v1/responses SDK: OpenAI SDK | 输入: $1.75输出: $14缓存读: $0.17 | Azure 全球 上线: 2025-12-11 | 中国区 欧洲区 北美区 亚太区 | 仅支持 Response API | |
| Azure | turing/gpt-5.1 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.25输出: $10缓存读: $0.12 | Azure 全球 上线: 2025-11-13 | 中国区 欧洲区 北美区 亚太区 | 升级版本,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.1-chat | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.25输出: $10缓存读: $0.12 | Azure 全球 上线: 2025-11-13 | 中国区 欧洲区 北美区 亚太区 | 升级版本,思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.1-codex | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 输入: $1.25输出: $10缓存读: $0.12 | Azure 全球 上线: 2025-08-10 | 中国区 欧洲区 北美区 亚太区 | 思考功能推荐使用 Response API | |
| Azure | turing/gpt-5.1-codex-mini | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 输入: $0.25输出: $2缓存读: $0.03 | Azure 全球 上线: 2025-08-10 | 中国区 欧洲区 北美区 亚太区 | 思考功能推荐使用 Response API | |
| Azure | turing/gpt-5 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.25输出: $10缓存读: $0.12 | Azure 全球 上线: 2025-08-10 | 中国区 欧洲区 北美区 亚太区 | 思考功能推荐使用 Response API | |
| Azure | turing/gpt-5-mini | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.25输出: $2缓存读: $0.03 | Azure 全球 上线: 2025-08-10 | 中国区 欧洲区 北美区 亚太区 | 思考功能推荐使用 Response API | |
| Azure | turing/gpt-5-nano | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.05输出: $0.4缓存读: $0.01 | Azure 全球 上线: 2025-08-10 | 中国区 欧洲区 北美区 亚太区 | 思考功能推荐使用 Response API | |
| Azure | turing/gpt-5-chat | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.25输出: $10缓存读: $0.12 | Azure 全球 上线: 2025-08-10 预计下线: 2026-04-15 | 中国区 欧洲区 北美区 亚太区 | 思考功能推荐使用 Response API | |
| Azure | turing/o3 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | Azure 全球 上线: 2025-04-17 | 中国区 欧洲区 北美区 亚太区 | 思考模型,推荐使用 Response API | ||
| Azure | turing/gpt-4.1 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $2输出: $8缓存读: $0.50 | Azure 全球 上线: 2025-04-16 | 中国区 欧洲区 北美区 亚太区 | ||
| Azure | turing/o4-mini | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | Azure 全球 上线: 2025-04-16 | 中国区 欧洲区 北美区 亚太区 | 思考模型,推荐使用 Response API | ||
| Azure | turing/gpt-4.1-mini | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.4输出: $1.6缓存读: $0.10 | Azure 全球 上线: 2025-04-14 | 中国区 欧洲区 北美区 亚太区 | ||
| Azure | turing/gpt-4.1-nano | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.1输出: $0.4缓存读: $0.03 | Azure 全球 上线: 2025-04-14 | 中国区 欧洲区 北美区 亚太区 |
Gemini
Gemini 系列模型基于 Google Cloud Vertex AI 共享配额运行,吞吐量无法保证,高并发场景下可能频繁触发 429 限流。不推荐在对稳定性有严格要求的生产环境中直接使用。 图灵平台提供 Retry 与 Fallback 作为工程化缓解手段,但无法根本解决共享配额问题,且 Fallback 切换模型后输出可能不一致。如需根本解决,需额外购买 Provisioned Throughput(预配吞吐量)。 详见:Gemini 429 限流与预配吞吐量
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| Vertex AI | turing/gemini-3.7-flash | max_input_tokens: 1,048,576max_output_tokens: 65,536输出: 工具: 支持 思考: 支持 缓存: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | 输入: 输出: 缓存读: 网页搜索: $14 / 1K优惠价有效期至 2026-12-31(通过净支出 50% 额度返还实现);2027-01-01 起标准价为输入 $1.50 / 输出 $7.50 / 缓存读 $0.15 → | Vertex AI 共享配额 上线: 2026-08-17 | 中国区 欧洲区 北美区 亚太区 | 最新 Flash 模型;支持 PDF 输入、思考模式与内置网页搜索 |
| Vertex AI | turing/gemini-3.6-flash | max_input_tokens: 1,048,576max_output_tokens: 65,536输出: 工具: 支持 思考: 支持 缓存: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2026-07-23 | 中国区 欧洲区 北美区 亚太区 | 针对多步编排、全栈代码重构、Agent 执行与空间推理优化;支持 PDF 输入、思考模式与内置网页搜索 | |
| Vertex AI | turing/gemini-3.5-flash | max_input_tokens: 1,048,576max_output_tokens: 65,535输出: 工具: 支持 思考: 支持 缓存: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2026-05-19 | 中国区 欧洲区 北美区 亚太区 | 支持思考模式 & 内置网页搜索 | |
| Vertex AI | turing/gemini-3.1-pro-latest | max_input_tokens: 1,048,576max_output_tokens: 65,536输出: 工具: 支持 思考: 支持 缓存: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2026-02-19 | 中国区 欧洲区 北美区 亚太区 | 最新版本 支持思考模式(含 MEDIUM 级别)& 内置网页搜索 | |
| Vertex AI | turing/gemini-3.1-flash-lite-latest | max_input_tokens: 1,048,576max_output_tokens: 65,535输出: 工具: 支持 思考: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2025-12-18 | 中国区 欧洲区 北美区 亚太区 | 最新版本 支持思考模式 & 内置网页搜索 | |
| Vertex AI | turing/gemini-3.1-flash-image | max_input_tokens: 131,072max_output_tokens: 32,768输出: 工具: 支持 思考: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2025-12-18 | 中国区 欧洲区 北美区 亚太区 | 最新版本 支持思考模式 & 输出图像 | |
| Vertex AI | turing/gemini-3.1-flash-lite-image | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2026-07-01 | 中国区 欧洲区 北美区 亚太区 | Nano Banana 2 Lite,轻量图像生成,输出分辨率最高 1K | ||
| Vertex AI | turing/gemini-3-flash-latest | max_input_tokens: 1,048,576max_output_tokens: 65,536输出: 工具: 支持 思考: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2025-12-18 预计下线: 2026-06-15 | 中国区 欧洲区 北美区 亚太区 | 支持思考模式 & 内置网页搜索 | |
| Vertex AI | turing/gemini-3-pro-image | max_input_tokens: 65,000max_output_tokens: 32,000输出: 工具: - 思考: 支持 内容审核: 支持 content moderation 内置工具: 🔍 网页搜索 | API: v1/chat/completions SDK: OpenAI SDK | Vertex AI 共享配额 上线: 2025-11-19 | 中国区 欧洲区 北美区 亚太区 | 最新版本 支持思考模式 |
Claude
由于 Anthropic 政策限制,Claude 系列模型随时可能不可用,建议仅在个人项目中试用。
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| Anthropic | turing/claude-sonnet-5 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: 输出: 缓存读: 缓存写 5m: 缓存写 1h: 网页搜索: $10 / 1K促销价有效期至 2026-08-31;2026-09-01 起标准价为输入 $3 / 输出 $15 / 缓存读 $0.3 / 缓存写 $3.75(5m)、$6(1h) → | Vertex AI(全球部署) 上线: 2026-07-01 | 中国区 欧洲区 北美区 亚太区 | 最新 Sonnet 模型,默认开启 adaptive 思考;不支持 enabled/budget_tokens,支持工具、显式缓存与联网搜索 | |
| Anthropic | turing/claude-fable-5 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: $10输出: $50缓存读: $1缓存写 5m: $12.5缓存写 1h: $20网页搜索: $10 / 1K | Vertex AI(全球部署) | 中国区 欧洲区 北美区 亚太区 | 新一代 Claude 模型,adaptive 思考始终开启且不可禁用;支持工具、显式缓存与联网搜索;严禁用于模型蒸馏,违者图灵平台有权追究责任 | |
| Anthropic | turing/claude-opus-5 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: $5输出: $25缓存读: $0.5缓存写 5m: $6.25缓存写 1h: $10网页搜索: $10 / 1K | Vertex AI(全球部署) | 中国区 欧洲区 北美区 亚太区 | 新增:最新 Opus 旗舰型号,仅支持 adaptive 思考模式;支持工具、显式缓存与联网搜索 | |
| Anthropic | turing/claude-opus-4.8 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: $5输出: $25缓存读: $0.5缓存写 5m: $6.25缓存写 1h: $10网页搜索: $10 / 1K | Vertex AI(全球部署) 上线: 2026-06-01 | 中国区 欧洲区 北美区 亚太区 | 支持工具,仅支持 adaptive 思考模式(默认关闭,需显式传 thinking.type=adaptive) | |
| Anthropic | turing/claude-opus-4.7 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: $5输出: $25缓存读: $0.5缓存写 5m: $6.25缓存写 1h: $10网页搜索: $10 / 1K | Vertex AI(全球部署) 上线: 2026-04-15 | 中国区 欧洲区 北美区 亚太区 | 支持工具,仅支持 adaptive 思考模式(默认关闭,需显式传 thinking.type=adaptive) | |
| Anthropic | turing/claude-opus-4.6 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: $5输出: $25缓存读: $0.5缓存写 5m: $6.25缓存写 1h: $10网页搜索: $10 / 1K | Vertex AI(全球部署) 上线: 2026-02-25 | 中国区 欧洲区 北美区 亚太区 | 支持工具,推荐使用 adaptive 思考模式 | |
| Anthropic | turing/claude-sonnet-4.6 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: $3输出: $15缓存读: $0.3缓存写 5m: $3.75缓存写 1h: $6网页搜索: $10 / 1K | Vertex AI(全球部署) 上线: 2026-02-25 | 中国区 欧洲区 北美区 亚太区 | 最新版本 支持工具 | |
| Anthropic | turing/claude-haiku-4.5 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: $1输出: $5缓存读: $0.1缓存写 5m: $1.25缓存写 1h: $2网页搜索: $10 / 1K | Vertex AI(全球部署) 上线: 2026-01-19 | 中国区 欧洲区 北美区 亚太区 | 支持工具 |
字节火山
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| 字节火山 | doubao-seed-2.1-pro | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 字节火山 上线: 2026-06-24 | 中国区 | Seed 2.1 旗舰版,支持视频理解 | ||
| 字节火山 | doubao-seed-2.1-turbo | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 字节火山 上线: 2026-06-24 | 中国区 | Seed 2.1 均衡版,支持视频理解 + GUI Agent | ||
| 字节火山 | doubao-seed-character | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 字节火山 上线: 2026-06-28 | 中国区 | 角色扮演/虚拟陪伴,支持图文理解、深度思考与工具调用 | ||
| 字节火山 | doubao-seed-2-0-pro-260215 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 字节火山 上线: 2026-02-25 | 中国区 | 最新版本 Seed 2.0 旗舰版,支持视频理解 | ||
| 字节火山 | doubao-seed-2-0-lite-260215 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 字节火山 上线: 2026-02-25 | 中国区 | 最新版本 Seed 2.0 中端版,支持视频理解 | ||
| 字节火山 | doubao-seed-2-0-lite-260428 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 字节火山 上线: 2026-04-28 | 中国区 | Seed 2.0 全模态版,支持文本/图像/视频/音频统一理解 + 深度思考 | ||
| 字节火山 | doubao-seed-2-0-mini-260215 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 字节火山 上线: 2026-02-25 | 中国区 | 最新版本 Seed 2.0 轻量版,支持视频理解 | ||
| 字节火山 | doubao-seed-2-0-code-preview-260215 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK | 字节火山 上线: 2026-02-25 | 中国区 | 代码预览版 |
阿里 DashScope
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| 阿里DashScope | qwen3.8-max | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-08-03 | 中国区 | 旗舰版 3.8,视觉-语言(图像/视频输入) | ||
| 阿里DashScope | qwen3.7-plus | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-06-08 | 中国区 | 高性价比版 3.7,视觉-语言(图像输入) | ||
| 阿里DashScope | qwen3.7-flash | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-07-28 | 中国区 | 轻量版 3.7,视觉-语言(图像输入) | ||
| 阿里DashScope | qwen3.7-max | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-05-28 | 中国区 | 旗舰版 3.7 | ||
| 阿里DashScope | qwen3.6-plus | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-04-03 | 中国区 | 稳定版,当前与 qwen3.6-plus-2026-04-02 能力相同 | ||
| 阿里DashScope | qwen3.6-flash | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-04-23 | 中国区 | 轻量版 3.6 | ||
| 阿里DashScope | qwen3.6-max | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-04-23 预计下线: 2026-09-08 | 中国区 | 旗舰版 3.6 | ||
| 阿里DashScope | qwen3.5-plus | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-02-25 | 中国区 | 快照版本 | ||
| 阿里DashScope | qwen3.5-flash | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-02-25 | 中国区 | 快照版本 |
Deepseek
deepseek-v4-pro-0813(2026-08-13)与 deepseek-v4-flash-0731(2026-07-31)是 DeepSeek V4 两个档位的正式版,以固定版本 id 提供;不带日期的 deepseek-v4-pro / deepseek-v4-flash 继续保留,行为不变。调用方式相同,改模型名即可切换。
注意计费差异:两个带日期的版本按峰谷价计费,不带日期的两个仍是单一价;限流额度按档位共用(pro 与 pro-0813 共用,flash 与 flash-0731 共用,aliyun/deepseek-v4-flash-0731 也算在 flash 这一份里)。峰谷时段随上游走:deepseek-v4-flash-0731 直连 DeepSeek 官方,忙时只有东八区 09:00-12:00、14:00-18:00;deepseek-v4-pro-0813 与 aliyun/deepseek-v4-flash-0731 在阿里云百炼上,闲时为东八区 22:00 至次日 08:00。均以账单时间为准,明细见用量与计费。
bytedance/deepseek-v4-flashDeepSeek V4 Flash 的火山部署,与阿里云上的 deepseek-v4-flash token 单价相同。额外支持 Ark 内置联网搜索,但该能力只在 /v1/responses 上可用,详见 联网搜索 → 字节火山 Ark。
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| Deepseek | deepseek-v4-flash-0731 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: ¥3输出: ¥9缓存读: 峰谷定价:高峰时段为东八区 09:00-12:00、14:00-18:00(以账单时间为准),其余时间均为闲时,输入 ¥1.5 / 输出 ¥4.5 / 缓存命中 ¥0.05 → | DeepSeek 官方 上线: 2026-07-31 | 中国区 | 直连 DeepSeek 官方,实测长会话缓存命中率 99%;Agent 接入见 DeepSeek Harness 指南 → | |
| 阿里DashScope | aliyun/deepseek-v4-flash-0731 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-07-31 | 中国区 | 阿里云百炼托管的 V4 Flash 正式版,与直连官方的 deepseek-v4-flash-0731 是同一快照、共用同一份限流额度;缓存命中价(¥0.3 对 ¥0.1)与闲时时段(夜间 对 非高峰)不同 | ||
| Deepseek | deepseek-v4-pro | API: v1/chat/completions, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: ¥12输出: ¥24缓存读: ¥1 | 阿里云 上线: 2026-04-25 | 中国区 | ||
| Deepseek | deepseek-v4-pro-0813 | API: v1/chat/completions, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: ¥9输出: ¥27缓存读: ¥0.9峰谷定价:闲时(东八区 22:00 至次日 08:00,以账单时间为准)输入 ¥4.5 / 输出 ¥13.5 / 缓存命中 ¥0.45 | 阿里云 上线: 2026-08-13 | 中国区 | 新增:V4 Pro 正式版(固定版本 id),与 deepseek-v4-pro 并存、共用同一份限流额度;两者价格不同,本模型按峰谷计价 | |
| Deepseek | deepseek-v4-flash | API: v1/chat/completions, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: ¥1输出: ¥2缓存读: ¥0.2 | 阿里云 上线: 2026-04-25 | 中国区 | ||
| 字节火山 | bytedance/deepseek-v4-flash | API: v1/chat/completions, v1/responses SDK: OpenAI SDK / Anthropic SDK | 字节火山 上线: 2026-07-28 | 中国区 | DeepSeek V4 Flash 的火山部署;内置联网搜索仅在 v1/responses 上可用 | ||
| Deepseek | turing/deepseek-v3-2 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 输入: ¥2输出: ¥3[0, 32] 输入: ¥2 输出: ¥3 / (32, 128] 输入: ¥4 输出: ¥6 | 火山引擎(中国) 上线: 2025-12-11 | 中国区 | v1/responses 仅支持流式 |
智谱
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| 智谱 | glm-5.3 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 智谱 上线: 2026-08-19 | 中国区 | 开源旗舰,1M 上下文 | ||
| 智谱 | glm-5.2 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 智谱 上线: 2026-06-17 | 中国区 | 最新旗舰,1M 上下文 | ||
| 智谱 | glm-5.1 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 智谱 上线: 2026-04-09 | 中国区 | |||
| 智谱 | glm-5 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 智谱 上线: 2026-02-24 | 中国区 | |||
| 智谱 | glm-4.7 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 智谱 上线: 2025-12-23 | 中国区 | |||
| 智谱 | glm-4.6 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | 智谱 上线: 2025-11-11 | 中国区 |
MiniMax
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| MiniMax | minimax-m3 | API: v1/chat/completions, v1/messages SDK: OpenAI SDK / Anthropic SDK | MiniMax 上线: 2026-06-17 | 中国区 | MiniMax M3;v1/responses 仅支持流式 | ||
| MiniMax | minimax-m2.7 | max_input_tokens: 204,800max_output_tokens: 131,072输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK / Anthropic SDK | 阿里云 上线: 2026-03-23 | 中国区 | 最新版本 M2.7 | |
| MiniMax | minimax-m2.5-highspeed | max_input_tokens: 204,800max_output_tokens: 204,800输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK | MiniMax 上线: 2026-02-25 | 中国区 | ||
| MiniMax | minimax-m2.5 | max_input_tokens: 204,800max_output_tokens: 204,800输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK / Anthropic SDK | MiniMax 上线: 2026-02-25 | 中国区 | ||
| MiniMax | minimax-text-01 | 输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK | MiniMax 上线: 2025-04-02 | 中国区 |
KIMI
小米 MiMo
Bedrock
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| Bedrock | turing/nova-lite-v2 | API: v1/chat/completions SDK: OpenAI SDK | 输入: $0.30输出: $2.50缓存读: $0.075 | AWS Bedrock(美国) 上线: 2026-07-22 | 中国区 欧洲区 北美区 亚太区 | Nova 2 Lite | |
| Bedrock | turing/nova-pro | max_input_tokens: 300,000max_output_tokens: 10,000输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK | 输入: $0.80输出: $3.20 | AWS Bedrock(美国) 上线: 2026-07-22 | 中国区 欧洲区 北美区 亚太区 | Nova Pro |
| Bedrock | nova-lite-v1 | max_input_tokens: 290,000max_output_tokens: 10,000输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK | 输入: $0.06输出: $0.24 | AWS Bedrock(美国) 上线: 2025-08-21 | 中国区 欧洲区 北美区 亚太区 | |
| Bedrock | turing/titan-nove-lite-v1 | max_input_tokens: 290,000max_output_tokens: 10,000输入: 输出: 工具: 支持 | API: v1/chat/completions SDK: OpenAI SDK | 输入: $0.06输出: $0.24 | AWS Bedrock(美国) 上线: 2025-08-21 | 中国区 欧洲区 北美区 亚太区 |
Grok
| 厂商 | 接口模型ID | 模型能力 | endpoint | 价格(每百万 Tokens) | 负载与上下线 | 支持访问地区 | 备注 |
|---|---|---|---|---|---|---|---|
| xAI | turing/grok-4.3 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $1.25输出: $2.5缓存读: $0.2 | xAI API 上线: 2026-05-28 | 中国区 欧洲区 北美区 亚太区 | ||
| xAI | turing/grok-4-0709 | max_input_tokens: 256,000max_output_tokens: 256,000输入: 输出: 工具: 支持 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $3输出: $15 | xAI API 上线: 2025-10-13 | 中国区 欧洲区 北美区 亚太区 | |
| xAI | turing/grok-4-fast-non-reasoning | max_input_tokens: 2,000,000max_output_tokens: 2,000,000输入: 输出: 工具: 不支持 | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.2输出: $0.5 | xAI API 上线: 2025-10-13 | 中国区 欧洲区 北美区 亚太区 | |
| xAI | turing/grok-4-fast-reasoning | API: v1/chat/completions, v1/messages, v1/responses SDK: OpenAI SDK / Anthropic SDK | 输入: $0.2输出: $0.5 | xAI API 上线: 2025-10-13 | 中国区 欧洲区 北美区 亚太区 |