模型格局与怎么读模型卡¶
这一页会过时——所以它教你的不是"现在哪个最强",而是"怎么自己判断"。快照部分每月核实。 🔴 易变 | 对位:常备参考 | 最后核实:2026-09-08
为什么要懂¶
agent 系统的性能、成本和可维护性,一半取决于模型选型。而模型市场每 2–3 个月洗牌一次——你需要的是选型方法论 + 可靠的核查渠道,而不是一张很快过期的排名表。
怎么读模型卡:agent 开发者的六个维度¶
选型时按这张清单核对(重要性按你的场景排序):
| 维度 | 看什么 | 为什么(对 agent) |
|---|---|---|
| 工具调用质量 | 是否原生支持 function calling、并行调用、结构化输出 | agent 的发动机,一票否决项 |
| 上下文窗口 | 标称窗口 + 有效上下文评测(不是越大越好,看用得好不好) | 决定你的上下文工程策略 |
| 推理模式 | 有无 reasoning 模式、能否开关、思考 token 怎么计费 | 简单步骤用普通模式省钱,关键决策用推理模式 |
| 价格 | 输入/输出每百万 token 单价(输出通常贵 3–5 倍) | agent 循环是 token 碎钞机,长对话成本滚雪球 |
| 稳定性 | API 的 SLA、国内可达性、版本是否静默更新 | QC 思维:版本固定才能复现 |
| 权重 | 开源(可本地部署)还是纯 API | 阶段 4 本地部署模块的前瞻 |
当前格局快照(2026-09-08,🔴 每月核实)¶
你的主力线(已决策,不变):DeepSeek 为主力 + 一个备用渠道兜底。
- DeepSeek:V4 世代已发布(V4 Pro 主打低成本文本推理);今天(9/8)V4.1-Flash 开启内测,原生多模态、成本更低,base_url 不变、改模型名即可调用——值得关注,它可能是你 W2 之后的默认模型。开源 + 国内直连 + 价格杀手,对你的学习计划是最优解
- OpenAI:GPT-6 Astra(2026-09-04 发布,新华网报道):105 万 token 上下文、12.8 万输出上限,主打编程、计算机操作与复杂多步任务,可按用户模板产出文档/电子表格/演示文稿——「文档模板化生成」与你关注的临床写作自动化同向,值得留意。分批开放中(企业可信访问 → API → 订阅用户)。国内直连不便,仍是 Codex CLI 的参照系与备选
- Anthropic Claude:第 5 代——2026-06 发布 Fable 5,2026-09-01 发布 Fable 5.1 / Mythos 5.1(当前旗舰,编程与知识工作最强梯队、各榜单头部)。Coding Agent 场景的事实标杆——读 Codex 时会发现很多设计以 Claude Code 为参照
- Google Gemini:长上下文与原生多模态路线激进,frontier 对比常客(具体版本以官方为准)
- 阿里 Qwen(通义):开源线最活跃的国产模型之一,阶段 4 本地部署的主要候选
⚠️ 排名网站鱼龙混杂(很多是 SEO 内容农场编造的名字),只信两个渠道:官方文档 + LMArena(lmarena.ai)。
你的核查 SOP(每月复盘时 5 分钟)¶
- 打开 DeepSeek 平台文档:默认模型名、价格有没有变?(直接关系你的练习成本)
- 扫一眼 LMArena 总榜前 10:有没有新面孔值得知道?
- 有变化 → 更新本页快照并刷新「最后核实」日期;没变化 → 只刷新日期
常见误解¶
- ❌「最强模型 = 最适合我的模型」→ agent 场景的稳定性和成本往往比跑分重要。DeepSeek 对你的组合(中文 + 便宜 + 直连 + 开源)就是最优解
- ❌「模型名不变 = 模型不变」→ 部分厂商会静默更新同名校验。复现性要求高的实验,记录调用日期 + 返回的完整响应
- ❌「 benchmark 高分 = 我的任务表现好」→ 通用跑分和你的临床场景是两回事。W8 的 mini-eval 就是教你建立自己的小评测
深挖¶
- 雷达 L2(每周扫):Codex releases、DeepSeek 官方渠道——见 resources.md
- 价格对比快照参考:CometAPI 的 2026 frontier 模型对比(第三方聚合,价格以其官网为准)