模型选型指南
按类型浏览
💬
聊天
GPT / Claude / Gemini / 通义千问 / 豆包等 150+ 模型
⌨️
AI 编程与 Agent
Coding Agent 评测网站与选型规则
🎨
图像生成
Seedream / Gemini Nano Banana 等文生图模型
🔊
语音合成
TTS 语音合成模型
🎙️
语音转写
会议纪要 ASR / 语音识别转文本
📐
向量化
Embedding 文本向量化模型
📊
重排序
Rerank 语义重排序模型
🔍
联网搜索
Web Search API 实时搜索
📄
文档转 Markdown
PDF / 图片 / Office 文档解析为 Markdown
🎬
视频生成
AI 视频生成模型
先确定选型目标
不要从“总榜第一名”开始选模型。建议按下面的顺序缩小范围:
- 硬约束:输入/输出模态、工具调用、上下文长度、API 协议、可访问地区。
- 任务形态:通用问答、复杂推理、中文业务、代码生成、仓库级 Coding Agent、视觉或音视频。
- 运行目标:质量优先、成本优先、低延迟,还是高并发。
- 真实验证:用自己的 Prompt、工具和数据跑一组代表性任务,再决定默认模型和 fallback。
不要混淆“模型”和“Agent”
Agent 的实际效果由模型、Agent harness、系统提示词、工具、推理强度和运行预算共同决定。同一个模型放在 Codex、Claude Code 或 OpenCode 中,结果可能明显不同;只看模型榜不能直接推出哪个 Agent 最好。
第三方评测平台
榜单适合用来缩小候选范围,不适合替代内部评测。进入榜单后先确认更新时间、测试版本、推理强度、Agent harness 和价格口径。
推荐入口
- 通用模型:先看 Artificial Analysis Models,同时筛选质量、价格、速度、延迟和上下文。
- Coding Agent:先看 Artificial Analysis Coding Agents,按 Model 和 Agent 两个视角比较完整组合。
它们适合作为选型入口;遇到中文、主观体验、仓库工程、前端或终端任务时,再使用下面的专项榜单交叉验证。
通用模型选择
| 选型问题 | 推荐平台 | 怎么看 |
|---|---|---|
| 用户更喜欢哪个模型的回答 | Arena | 匿名对战的人类偏好榜;适合看 Chat、Vision、Image、Video 等主观体验,不等同于事实正确率 |
| 哪个模型的客观能力更稳定 | LiveBench | 定期换题、自动判分,覆盖推理、数学、代码、数据分析、指令遵循和 Agentic Coding |
| API 质量、价格、速度和延迟怎么权衡 | Artificial Analysis Models | 同时比较 Intelligence、Token 价格、单任务成本、输出速度、首 Token 延迟和上下文 |
| 中文与国内模型怎么选 | OpenCompass 司南 | 通常每两周更新,覆盖开源与商业模型,适合中文和学术能力的可复现对比 |
| 中文行业和多模态任务怎么选 | SuperCLUE | 查看软件工程、营销、视频、具身智能等中文垂类榜;使用前确认子榜日期和参评模型范围 |
Coding Agent 与模型搭配
| 选型问题 | 推荐平台 | 怎么看 |
|---|---|---|
| 同一模型放在哪个 Coding Agent 更好 | Artificial Analysis Coding Agents | 可按 Model 或 Agent 查看,并对比 Claude Code、Cursor、OpenCode 等 harness;同时提供成功率、成本、Token 和执行时间 |
| 真实用户使用工具时哪个模型更稳 | Agent Arena | 基于真实 Agent 会话,关注任务完成、可操控性、Bash 恢复和工具幻觉 |
| 哪个模型更擅长长周期仓库工程 | DeepSWE | 113 个原创仓库级任务;所有模型使用同一 mini-swe-agent,适合隔离比较模型能力 |
| 前端和网页生成哪个好 | WebDev Arena | 人类盲测网页结果,支持 HTML、React 和不同业务类型筛选;适合前端视觉与可用性选型 |
| 完整终端 Agent 能否完成多步任务 | Terminal-Bench | 同时展示 Agent 与 Model 组合,适合 CLI、Shell、工具使用和端到端执行能力比较 |
选型规则
- 先建立候选集:从 模型列表 中筛出满足模态、API、上下文、地区和预算要求的型号。
- 选择匹配任务的榜单:综合问答、中文、仓库工程、前端和终端任务应使用不同评测,不用一个总榜覆盖所有场景。
- 固定比较条件:A/B 测试时保持 Agent harness、Prompt、工具、推理强度、超时和最大 Token 预算一致。
- 同时记录质量和运行指标:至少记录任务成功率、人工验收结果、端到端延迟、单任务成本和失败类型。
- 使用真实业务样本复测:外部榜单只负责缩小候选集;最终结论来自自己的代码库、业务 Prompt、工具权限和质量标准。
- 定期重新评估:模型版本、价格和榜单都会变化,生产默认项和 fallback 应按固定周期复测。
正确解读榜单
- 先看评测对象:固定 Agent 的榜单主要比较模型;Agent 与 Model 同时变化的榜单比较的是完整系统。
- 先看置信区间,再看名次:分数接近且区间重叠时,不应宣称一个模型明确胜出。
- 成本口径不能混用:榜单的 Token 单价、单任务成本和订阅价格不是一回事,也不等于图灵平台实际账单。
- 推理强度必须一致:
medium、high、xhigh、max可能显著改变质量、延迟和成本。 - 不要静态抄榜单名次:外部榜单更新很快,本页只说明该去哪里看、每个榜单适合回答什么问题。
- 最终回到自己的任务:用真实代码库、业务 Prompt、工具权限和质量标准复测候选组合,并为生产流量准备 fallback。