跳到主要内容

模型选型指南

按类型浏览


先确定选型目标

不要从“总榜第一名”开始选模型。建议按下面的顺序缩小范围:

  1. 硬约束:输入/输出模态、工具调用、上下文长度、API 协议、可访问地区。
  2. 任务形态:通用问答、复杂推理、中文业务、代码生成、仓库级 Coding Agent、视觉或音视频。
  3. 运行目标:质量优先、成本优先、低延迟,还是高并发。
  4. 真实验证:用自己的 Prompt、工具和数据跑一组代表性任务,再决定默认模型和 fallback。
不要混淆“模型”和“Agent”

Agent 的实际效果由模型、Agent harness、系统提示词、工具、推理强度和运行预算共同决定。同一个模型放在 Codex、Claude Code 或 OpenCode 中,结果可能明显不同;只看模型榜不能直接推出哪个 Agent 最好。

第三方评测平台

榜单适合用来缩小候选范围,不适合替代内部评测。进入榜单后先确认更新时间、测试版本、推理强度、Agent harness 和价格口径。

推荐入口

它们适合作为选型入口;遇到中文、主观体验、仓库工程、前端或终端任务时,再使用下面的专项榜单交叉验证。

通用模型选择

选型问题推荐平台怎么看
用户更喜欢哪个模型的回答Arena匿名对战的人类偏好榜;适合看 Chat、Vision、Image、Video 等主观体验,不等同于事实正确率
哪个模型的客观能力更稳定LiveBench定期换题、自动判分,覆盖推理、数学、代码、数据分析、指令遵循和 Agentic Coding
API 质量、价格、速度和延迟怎么权衡Artificial Analysis Models同时比较 Intelligence、Token 价格、单任务成本、输出速度、首 Token 延迟和上下文
中文与国内模型怎么选OpenCompass 司南通常每两周更新,覆盖开源与商业模型,适合中文和学术能力的可复现对比
中文行业和多模态任务怎么选SuperCLUE查看软件工程、营销、视频、具身智能等中文垂类榜;使用前确认子榜日期和参评模型范围

Coding Agent 与模型搭配

选型问题推荐平台怎么看
同一模型放在哪个 Coding Agent 更好Artificial Analysis Coding Agents可按 Model 或 Agent 查看,并对比 Claude Code、Cursor、OpenCode 等 harness;同时提供成功率、成本、Token 和执行时间
真实用户使用工具时哪个模型更稳Agent Arena基于真实 Agent 会话,关注任务完成、可操控性、Bash 恢复和工具幻觉
哪个模型更擅长长周期仓库工程DeepSWE113 个原创仓库级任务;所有模型使用同一 mini-swe-agent,适合隔离比较模型能力
前端和网页生成哪个好WebDev Arena人类盲测网页结果,支持 HTML、React 和不同业务类型筛选;适合前端视觉与可用性选型
完整终端 Agent 能否完成多步任务Terminal-Bench同时展示 Agent 与 Model 组合,适合 CLI、Shell、工具使用和端到端执行能力比较

选型规则

  1. 先建立候选集:从 模型列表 中筛出满足模态、API、上下文、地区和预算要求的型号。
  2. 选择匹配任务的榜单:综合问答、中文、仓库工程、前端和终端任务应使用不同评测,不用一个总榜覆盖所有场景。
  3. 固定比较条件:A/B 测试时保持 Agent harness、Prompt、工具、推理强度、超时和最大 Token 预算一致。
  4. 同时记录质量和运行指标:至少记录任务成功率、人工验收结果、端到端延迟、单任务成本和失败类型。
  5. 使用真实业务样本复测:外部榜单只负责缩小候选集;最终结论来自自己的代码库、业务 Prompt、工具权限和质量标准。
  6. 定期重新评估:模型版本、价格和榜单都会变化,生产默认项和 fallback 应按固定周期复测。

正确解读榜单

  • 先看评测对象:固定 Agent 的榜单主要比较模型;Agent 与 Model 同时变化的榜单比较的是完整系统。
  • 先看置信区间,再看名次:分数接近且区间重叠时,不应宣称一个模型明确胜出。
  • 成本口径不能混用:榜单的 Token 单价、单任务成本和订阅价格不是一回事,也不等于图灵平台实际账单。
  • 推理强度必须一致mediumhighxhighmax 可能显著改变质量、延迟和成本。
  • 不要静态抄榜单名次:外部榜单更新很快,本页只说明该去哪里看、每个榜单适合回答什么问题。
  • 最终回到自己的任务:用真实代码库、业务 Prompt、工具权限和质量标准复测候选组合,并为生产流量准备 fallback。

信息

本页不指定默认模型。了解候选模型的参数、价格、API、地区和上下线状态,请访问 模型列表;配置 Coding Agent 请访问 AI 编程工具指南