Agent × 大模型:2026 全球主流
「框架 + 模型」组合能力评测与选型指南
2026 年选型的正确单位不再是"哪个模型最强",而是"哪个 Agent 框架 × 哪个模型"的组合最能打。本报告综合 LMArena、Artificial Analysis、SWE-bench、Terminal-Bench、Vals AI、GAIA/HAL、τ-Bench、OpenRouter 等 15 个权威评测源与流量数据,经独立加权计算,对 15 个主流组合进行五维评测,并按人群、行业与专业领域给出分层选型建议。
执行摘要 Executive Summary
30 秒版本:本报告回答"2026 年 9 月,谁该用哪个 Agent + 模型组合",全部结论可追溯至公开基准数据。
五维加权总分(0–100)
性价比组合,总分第二
两种口径的分差(DeepSeek V4 Pro)
三条关键发现
- ① 组合,而非模型,才是选型单位。同一模型换脚手架,Terminal-Bench 分差可达 5–30 个百分点,超过一次模型代际升级的收益。Terminal-Bench 2.0 官方榜前 12 名全部以「harness × model」形式提交,榜首是专用 harness(NexAU-AHE × GPT-5.5,84.7%),不是任何裸模型。
- ② Anthropic 协议成为事实标准,"Claude Code 挂国产脑"是本周期最大结构性变化。GLM、Kimi、Qwen 全部提供 Anthropic 兼容端点,两个环境变量即可让 Claude Code 直连 GLM-5.3。加权口径下,Claude Code + GLM-5.3 以 84.3 分位列第二,成本只有官方 Opus 5 组合的约 1/4。
- ③ 开源已进入前沿带,但"顶点"仍由闭源把守。Kimi K3 成为首个登顶 LMArena 编码类榜单(Frontend Code,1679 Elo)的开源模型,AA 智能指数 59.70 距离闭源第一梯队不足 4 分;但在 SWE-bench Pro、GAIA 等硬基准上,Claude / GPT-5.6 仍保持 5–15 分领先。
一句话选型结论
追求质量上限选 Claude Code + Opus 5 / Fable 5;追求性价比选 Claude Code + GLM-5.3 或 Codex + DeepSeek V4 Pro;高并发低预算选 Codex + GPT-5.6 Luna 或 Gemini 3.7 Flash;需要自部署与数据主权选 OpenHands + GLM-5.2(MIT);受监管行业在国内选 Qwen / DeepSeek / GLM / Kimi 的官方合规通道。没有"最好"的组合,只有与你的预算、合规约束、任务形态匹配的组合——第 08 节给出完整决策矩阵。
背景与问题定义 Background
为什么 2026 年的选型问题必须重新表述。
从"最强模型"到"最强组合"
2024–2025 年的模型评测默认一个隐含假设:能力住在模型里,买最好的模型就够了。2026 年的数据推翻了这个假设。Princeton HAL 榜单上,Anthropic 包揽前六的真正原因是 HAL Generalist Agent 脚手架——同一道 GAIA 题目,裸模型约 44.8%、HAL 脚手架 74.6%、自由工程化系统 92%+,三种口径相差 30 个百分点以上。Terminal-Bench 2.0 官方榜上,中立参考脚手架 Terminus 2 × Claude Opus 4.7 只拿到 69.4%,而专用 harness 上的同一代模型普遍在 80% 以上。LangChain 团队曾仅调整提示词与工具配置,就把一个 Top 30 的提交拉升到 Top 5。
与此同时,模型层的"可替换性"也在快速上升。Anthropic API 协议成为事实标准后,GLM、Kimi、Qwen 均提供兼容端点,Claude Code 这类官方绑定 CLI 实际上成了"通用框架壳"。评测网站已经先于采购决策完成了转向:Terminal-Bench、SWE-bench、SWE-Marathon、OSWorld 的榜单条目,都是「agent harness × model」的组合形式。
2026.09 格局速览
- 闭源前沿:Anthropic 以 Fable 5 / Opus 5 占据 AA 智能指数前 7 席;OpenAI GPT-5.6 家族(Sol / Terra / Luna 三档定价)于 7 月全面转正;Google Gemini 3.1 Pro 守住长上下文与科学推理,3.7 Flash 以 $0.75/$3.75 成为性价比标杆;xAI Grok 4.6 以 $2/$6 低价进入第一梯队,但缺少成熟的官方 Agent 框架。
- 开放权重:Kimi K3(登顶 LMArena 编码榜)、GLM-5.3(AA 59.51,但权重未开放)、DeepSeek V4(SWE-bench Verified 独立测 96.4%,开源最高)、Qwen 3.8(OSWorld-Verified 86.1%,计算机操作第一)构成国产四强。
- 流量结构:OpenRouter 8 月周榜 token 量前 10 被低价 MoE 模型主导(DeepSeek V4 Flash 12.3T、GLM 5.3 Flash 6.2T)——agent 流量"用便宜的,夸贵的",口碑榜(Stack Overflow 2026 最爱工具 46%)仍被 Claude Code 垄断。
本报告回答的问题
- 全球主流「Agent 框架 × 模型」组合的综合能力排名如何?(第 06 节)
- 不同权重偏好(质量优先 / 成本优先)下,排名如何变化?(第 06 节敏感性分析)
- 不同人群、企业规模、行业与专业背景,应该怎么选?(第 08 节)
- 哪些数据口径的风险需要提前对冲?(第 09 节)
数据与方法 Data & Method
本报告不直接搬运任何单一榜单,而是对多源数据做归一化与加权综合。所有口径与局限在此声明。
数据源清单与分级
| 层级 | 数据源 | 用途 | 口径类型 | 访问日期 |
|---|---|---|---|---|
| 核心 | Artificial Analysis Intelligence Index v4.1.1 | 通用智能综合分(GDPval-AA、τ³-Banking、Terminal-Bench v2.1、SciCode、HLE、GPQA Diamond 等 9 项) | 独立第三方 | 2026.09.02 |
| 核心 | SWE-bench Verified / Pro(swebench.com + Scale SEAL) | 软件工程能力(官方统一脚手架榜 + 厂商口径 + Vals 独立口径交叉) | 独立 + 自报 | 2026.09.03 |
| 核心 | Terminal-Bench 2.x(tbench.ai + Vals AI) | Agentic 长程终端任务(官方验证榜按组合列条目) | 独立 + 自报 | 2026.09.03 |
| 核心 | Vals AI(vals.ai) | 同 harness 独立复测,校准厂商自报口径的关键参照 | 独立第三方 | 2026.08.19 |
| 核心 | Princeton HAL / GAIA、τ²/τ³-Bench(Sierra)、BFCL V4(UC Berkeley) | 通用助理、工具调用与政策遵从、函数调用 | 独立学术 | 2026.05–08 |
| 辅助 | LMArena(Text / WebDev / Coding 分榜) | 人类盲测偏好(Elo) | 众包独立 | 2026.09.02 |
| 辅助 | OSWorld-Verified、SWE-Marathon、DeepSWE v1.1、MCPMark | 计算机操作、超长程工程、MCP 工具 | 独立 + 自报 | 2026.07–08 |
| 辅助 | OpenRouter 路由流量、Stack Overflow 2026 / JetBrains 开发者调查 | 真实使用份额与口碑 | 行业数据 | 2026.08–09 |
| 辅助 | 各厂商官方定价页与模型卡 | 价格、上下文、速度 | 厂商自报 | 2026.09.03 |
归一化与加权方法
- 归一化:各基准原始分按「同类口径内的当前最佳表现 = 100」线性映射到 0–100 分。同一基准存在厂商自报与独立复测两种口径时,优先采用独立口径(Vals AI、AA、官方统一脚手架榜),自报口径仅作区间参考并标注。
- 两级权重:维度层——通用智能 25% / Agentic 能力 25% / 编码能力 20% / 成本性价比 15% / 生态与工程化 15%(均衡方案,与报告主题的 Agent 属性对齐,又不让单项主导)。数据源层——独立第三方 70%、官方验证榜 20%、厂商自报 10%。
- 组合口径:组合的模型侧维度(智能、编码、成本)以模型数据计;Agentic 与生态维度按「模型 × 框架」交互效应计分(如同一模型在 Claude Code 与原生 CLI 上分数不同)。
- 成本口径:按「单任务成本」评估——40K 输入 + 8K 输出 tokens(典型 agent 任务:仓库上下文 + 计划 + diff),计入缓存折扣与订阅方案,而非只看单价。
评测对象与维度 Subjects & Dimensions
15 个组合、六个家族、五个维度。入选标准:评测数据可交叉验证 + 有可观测的真实采用度。
六个家族、15 个组合
| 家族 | 组合 | 定位 |
|---|---|---|
| A · Claude Code 系 (官方绑定) | Claude Code + Claude Opus 5 | 质量上限组合,$5/$25 |
| Claude Code + Claude Fable 5 | 能力天花板,$10/$50,按需升级用 | |
| Claude Code + Claude Sonnet 5 | 日常主力,$2/$10,口碑与成本平衡 | |
| B · Codex 系 (OpenAI) | Codex CLI + GPT-5.6 Sol | OpenAI 旗舰,DevOps/CI 强项,$4/$20(促销) |
| Codex CLI + GPT-5.6 Luna | 超低价高频档,$0.20/$1.20 | |
| C · Gemini 系 | Gemini CLI + Gemini 3.1 Pro | 1M 上下文 + Search grounding,企业 Code Assist 通道 |
| Gemini CLI + Gemini 3.7 Flash | 高吞吐性价比,$0.75/$3.75(入门价) | |
| D · 开源开放权重 (原生框架) | Kimi CLI / Kimi For Coding + Kimi K3 | 开源能力天花板,1M 上下文,100 并行子 Agent |
| Qwen Code + Qwen 3.8 Max | 计算机操作第一(OSWorld-V 86.1%),国内合规直连 | |
| OpenHands + GLM-5.2(自部署) | MIT 权重 + MIT 框架,数据主权完全可控 | |
| E · 跨协议兼容路由 ("换脑"组合) | Claude Code + GLM-5.3 | 本周期讨论度最高的性价比组合(Anthropic 兼容端点) |
| Claude Code + Kimi K3 | 开源旗舰挂成熟 harness | |
| Codex CLI + DeepSeek V4 Pro | OpenAI 协议兼容,SWE-V 独立测 96.4% | |
| (对照)Codex CLI + GPT-5.6 Terra | 中档对照,$2/$12 | |
| F · 商业云 Agent (多模型/自研) | Factory Droid | Terminal-Bench 官方榜常客,企业异步任务,客户含 Nvidia/Adobe/摩根士丹利 |
| Devin(Cognition) | 长时程自主工程 Agent,自研 SWE 1.7 + 前沿模型 |
五维评测框架
| 维度 | 权重 | 主要数据源 | 测什么 |
|---|---|---|---|
| 通用智能 | 25% | AA Index v4.1.1、LMArena Text | 知识工作、推理、长上下文的综合上限 |
| Agentic 能力 | 25% | Terminal-Bench 2.1(Vals 优先)、GAIA/HAL、τ³、OSWorld-V、SWE-Marathon、DeepSWE | 多步工具调用、错误恢复、长时程可靠性——「会做事」而非「会答题」 |
| 编码能力 | 20% | SWE-bench Verified(独立口径优先)/ Pro、LMArena WebDev | 真实仓库修 bug、写 patch 的工程能力 |
| 成本性价比 | 15% | 厂商定价页、单任务成本测算、订阅方案 | 每完成一个典型任务的钱 |
| 生态与工程化 | 15% | GitHub stars、OpenRouter 流量、开发者调查、协议兼容性、企业合规 | 框架成熟度、可替换性、团队落地摩擦 |
分维度分析 Analysis
每个维度:图表 + 解读 + 中间结论。
5.1 通用智能:Anthropic 把守前七,国产四强进入前沿带
Artificial Analysis Intelligence Index v4.1.1 · 2026.09.02 快照
- AA 指数前 7 席全部是 Anthropic 模型,头部 4.7 分内挤了 5 个模型——通用智能已进入"无显著差异"的贴身肉搏区,闭源第一梯队之间的选择应由编码/Agentic 分项和价格决定。
- LMArena 文本榜同口径:claude-opus-5-max 以 1569 Elo 居首,qwen3.8-max(1535)、kimi-k3-max(1529)、glm-5.3-max(1528)已进入 1520+ 前沿带。
- 值得注意的背离:DeepSeek V4 Pro 综合分 53 落后 Kimi K3 约 7 分,但其 SWE-V 独立测 96.4%——专项与综合的背离是国产模型的常态,按任务选模型比按总分选模型更重要。
5.2 编码能力:脚手架口径决定 15–20 分,独立复测是唯一硬通货
SWE-bench Verified · 独立口径 vs 厂商自报(2026.09 快照)
- SWE-bench Pro 才是分水岭:Verified 接近饱和(头部 5 个模型挤在 4 分内),Pro 上 Claude Mythos 5 / Fable 5 / Opus 5 以 79–80% 领先,GPT-5.6 Sol 64.6%、Qwen 3.8 Max 67.7%;Scale 标准化口径下第一名骤降至 59.1%(GPT-5.4)。公开集第一 ≠ 私有代码库表现。
- OpenAI 于 2026.02 以评测集污染为由停止提交 Verified;Scale AI 2026.07 审计称 Pro 公开集约 30% 任务损坏。本报告对无独立口径的厂商自报一律降权处理。
- LMArena WebDev 榜(人类盲测):Opus 5 Max 1688 > Kimi K3 Max 1674 > Qwen 3.8 Max 1669——国产模型占编码盲测榜前三中的两席;Kimi K3 曾于 7 月以 1679 成为首个登顶 LMArena 编码类榜的开源模型。
- Aider Polyglot 官方榜 2025 年中后停更,前沿模型全部缺席,已不具区分度,本报告未采用。
5.3 Agentic 能力:组合口径的主场,也是分歧最大的维度
这是「框架 × 模型」交互效应最强的维度,也是本报告权重最高(与通用智能并列 25%)的维度。三组关键证据:
Terminal-Bench 2.1 · 厂商自报 vs Vals AI 独立复测(同一 harness)
- 官方组合榜证明 harness 是第一变量:Terminal-Bench 2.0 官方榜前四:NexAU-AHE × GPT-5.5(84.7%)、LemonHarness × 多模型(84.5%)、Capy × GPT-5.5(83.1%)、Codex CLI × GPT-5.5(82.2%);Claude Opus 4.8 的三个公开数字——Anthropic 图表 74.6%、OpenAI 图表 78.9%、Vals 独立测 71.9%——同一模型三个故事。
- 长时程是真正的瓶颈:SWE-Marathon(平均 2720 万 token/任务)天花板仅 42.0%(Kimi K3,已验证),组合条目 Claude Code + Opus 4.8 仅 26%;τ³-Bench 新增的 banking_knowledge 域最好模型只有 26.7%;BFCL V4 多轮函数调用最好的模型 68.4%——多轮、长程、知识密集任务远未解决。
- 计算机操作已被国产拿下:OSWorld-Verified 上 Qwen 3.8 Max 以 86.1% 超过 Claude Mythos 5(85.0%)居首(2026.08.15),并已越过人类基线 72.36%。需要桌面自动化能力的场景应重新评估国产选项。
- 工具调用纪律:BFCL V4 显示所有前沿模型在「决定不调用工具」的多轮场景显著退化(o3 多轮仅 14.8%);τ²-Bench telecom 域 99% 接近饱和但 pass^8 可靠性口径下头部模型跌至 25% 以下——采购时应要求 pass^k 口径数据。
5.4 成本与性价比:单任务成本相差 45 倍,订阅锚点 $20/$100/$200
单任务成本测算 · 典型 Agent 任务(40K 输入 + 8K 输出 tokens,无缓存)
- 单任务成本极差 45 倍(Fable 5 $0.80 vs Luna $0.018),而独立口径的能力差距(SWE-V 95 vs 93)只有 2 分——低价模型的性价比故事在加权计算中天然占优,这正是第 06 节敏感性分析存在的意义。
- 缓存经济决定 agent 真实账单:多轮 agent 反复重放同一系统提示,DeepSeek 缓存命中 ¥0.025/M、Kimi $0.30/M、GLM $0.26/M。K3 与 GLM-5.3 账面 2.5 倍价差在缓存主导流量下缩至约 1.15 倍。按"每完成任务成本"而非单价评估。
- 订阅市场已收敛:Claude / Codex / Devin / Factory / Cursor Max 全部锚定 $20/$100/$200 三档;国产以 5–10 倍价差打兼容平替——Kimi 国内 ¥39/月起、GLM Coding Plan 天猫 ¥118/月(2026.09 入驻,适配 Claude Code / Codex / ZCode 等 20+ Agent)。
- 促销价风险要提前对冲:GPT-5.6 Sol 促销至 2026.11.21,Gemini 3.7/3.6 Flash 入门价至 2026.12.31,到期后预算跳升 50–100%。长期合同按列表价做压力测试。
5.5 生态与工程化:协议解绑与"按云选模型"两大格局
- Anthropic 协议成为事实标准:GLM、Kimi、Qwen 全部提供 Anthropic 兼容端点(Z.ai /api/anthropic 两个环境变量即可让 Claude Code 直连 GLM-5.3),框架与模型解绑是本周期最大的结构性变化。
- Claude Code 是口碑与协议双料霸主:Stack Overflow 2026「最爱工具」46%(Cursor 19%、Copilot 9%);JetBrains 职场采用调查与 Cursor 并列第一(18%);OpenRouter 端日耗 289B tokens 居第 4;初创公司(<50 人)渗透率约 75%。
- Codex CLI 是最开放的一线框架:Apache-2.0 开源(Rust,62K+ stars),社区共识是 DevOps/CI 强项、token 效率比 Claude Code 高 2–4 倍。
- Gemini CLI 经历动荡:106K stars(Apache-2.0)但 2026.06.18 关闭个人免费/Pro/Ultra 托管通道,个人用户被导向闭源后继 Antigravity CLI,企业 Code Assist 授权保留——生态分显著下调。
- OpenHands 是中立多模型的默认解:MIT 许可、84.5K+ stars、490+ 贡献者,可直连 OpenRouter/Ollama,且已转型支持把 Claude Code / Codex / ZCode 收进统一治理控制台——大团队做框架治理的务实选择。
- 企业按云选模型:Bedrock 上 Claude 超 10 万企业客户(AWS 追加十年千亿美元级 Anthropic 承诺)、Vertex 以 Gemini 长上下文 + BigQuery 拉新、Azure 承接 GPT——87% 大企业多平台并用,合规与云存量决定选型的权重不亚于模型本身。
- 流量与口碑倒挂:OpenRouter 8 月周榜 token 前 10 被廉价 MoE 主导(DeepSeek V4 Flash 12.3T、GLM 5.3 Flash 6.2T;厂商份额 DeepSeek 27.1%、Google 25.3%、OpenAI 16.9%)——token 量反映的是"多少任务在跑",不是"质量偏好"。
综合加权排名 Composite Ranking
均衡权重(智能 25 / Agentic 25 / 编码 20 / 成本 15 / 生态 15)下的总分,以及换权重后会发生什么。
综合加权总分 · 15 个组合(0–100)
排名解读
- 冠军不是碾压式胜利:Claude Code + Opus 5(86.0)领先第二名 1.7 分——在"差距 < 3 分无显著差异"的口径下,前四名应视为同一梯队,真正的差异在维度结构上:Opus 5 组合靠质量与生态,GLM-5.3 组合靠成本与协议兼容。
- 同一模型、不同框架的分差清晰可见:Kimi K3 挂 Claude Code(81.4)比挂 Kimi CLI(78.5)高 2.9 分——差距全部来自 harness 成熟度与生态,这就是"组合是选型单位"的量化证据。
- Gemini 3.1 Pro 组合排名垫底不是模型问题:模型本身 AA 57.2 / SWE-V 80.6 属第一梯队,拖分项是 Gemini CLI 个人通道关闭后的生态动荡(70 分)与相对偏高的单任务成本。
敏感性分析:换权重,排名怎么变
单一总分容易被权重设计操纵——诚实的方式是把不同权重方案的结果都摆出来。以下对头部 8 个组合测试三种权重方案:
| 组合 | 均衡方案 (本报告基准) | 质量优先方案 智35/Ag30/编20/成5/生10 | 成本优先方案 智20/Ag20/编15/成35/生10 |
|---|---|---|---|
| Claude Code + Opus 5 | 86.0 (#1) | 92.2(#1) | 72.7(#6) |
| Claude Code + GLM-5.3 | 84.3(#2) | 85.9(#4) | 80.1(#3) |
| Codex CLI + GPT-5.6 Sol | 82.7(#3) | 88.6(#3) | 73.2(#5) |
| Claude Code + Fable 5 | 82.5(#4) | 90.0(#2) | 61.5(#8) |
| Claude Code + Kimi K3 | 81.4(#5) | 86.6(#5) | 74.6(#4) |
| Codex CLI + DeepSeek V4 Pro | 80.2(#6) | 78.2(#7) | 82.3(#1) |
| Codex CLI + GPT-5.6 Luna | 77.7(#11) | 68.7(#8) | 81.4(#2) |
| Gemini CLI + 3.7 Flash | 77.7(#11) | 73.3(#6) | 77.3(#5*) |
- 质量优先:排名变为 Opus 5 > Fable 5 > GPT-5.6 Sol > GLM-5.3 > Kimi K3——闭源旗舰包揽前二,"一分钱一分货"回归。
- 成本优先:DeepSeek V4 Pro(82.3)、Luna(81.4)、GLM-5.3(80.1)占据前三——这就是为什么廉价 MoE 主导了 OpenRouter 流量榜。
- 稳健结论:Claude Code + GLM-5.3 是唯一在三种方案下都保持前四的组合——如果你的需求结构不明确,它是风险最小的默认选择(但需对冲第 09 节的供给风险)。
横向对比总表 Comparison Matrix
五维分数与总分一览。金色底 = 该维度冠军。† = 估算值。
| 组合 | 通用智能 | Agentic | 编码 | 成本 | 生态 | 总分 | 单任务成本 |
|---|---|---|---|---|---|---|---|
| Claude Code + Opus 5 | 96 | 93 | 96 | 30 | 100 | 86.0 | $0.40 |
| Claude Code + GLM-5.3 | 91 | 84 | 82 | 68 | 90 | 84.3 | $0.09 |
| Codex CLI + GPT-5.6 Sol | 93 | 91 | 91 | 35 | 88 | 82.7 | $0.32 |
| Claude Code + Fable 5 | 95 | 90 | 95 | 15 | 100 | 82.5 | $0.80 |
| Claude Code + Kimi K3 | 91 | 86 | 92 | 40 | 85 | 81.4 | $0.24 |
| Claude Code + Sonnet 5 | 84† | 84 | 82 | 45 | 100 | 80.2 | $0.16 |
| Codex CLI + DeepSeek V4 Pro | 81 | 65 | 85 | 90 | 88 | 80.2 | $0.023 |
| Kimi CLI + Kimi K3 | 91 | 88 | 92 | 40 | 62 | 78.5 | $0.24 |
| Qwen Code + Qwen 3.8 Max | 89 | 84 | 82 | 55 | 68 | 78.1 | $0.13 |
| OpenHands + GLM-5.2 | 78 | 76 | 80 | 70 | 85 | 77.8 | $0.09 / 自部署 |
| Gemini CLI + 3.7 Flash | 85† | 78 | 76 | 75 | 70 | 77.7 | $0.06 |
| Codex CLI + GPT-5.6 Luna | 68† | 65 | 85 | 95 | 88 | 77.7 | $0.018 |
| Factory Droid | 93 | 82 | 88 | 40 | 65 | 77.1 | 订阅 $20–200/月 |
| Devin | 88 | 78 | 84 | 38 | 65 | 73.8 | 订阅 $20–200/月 |
| Gemini CLI + 3.1 Pro | 87 | 70 | 72 | 45 | 70 | 70.9 | $0.18 |
选型建议 Recommendation
不做单一绝对推荐,只回答"什么情况下选谁"。三种切法:按人群 / 按行业 / 按应用领域。
8.1 按人群与企业规模
个人开发者 / 学生 预算 < ¥100/月
- 首选:Kimi Coding Plan(¥39/月起)+ Kimi CLI——开源旗舰 K3 + 1M 上下文,价格是 Claude Pro 的 1/4。
- 次选:GLM Coding Plan(天猫 ¥118/月)+ Claude Code——借用最成熟 harness,中文场景实测口碑第一梯队;注意套餐限额与断货。
- 海外用户可等 Claude Pro $20 促销节点;不建议为学习用途直接上 Opus 级 API。
独立开发者 / 自由职业者 预算 ¥100–500/月
- 首选:Claude Pro/Max + Claude Code(Sonnet 5 默认,关键任务切 Opus 5)——生态与质量双保险。
- 性价比路线:Claude Code + GLM-5.3 / Kimi K3 兼容路由,配合 Codex CLI(开源免费)+ Luna 做杂活。
- Cursor $20 适合偏好 IDE 形态、多模型切换的用户(2M+ 用户验证过的下限)。
创业团队(<50 人)速度优先
- 首选:Claude Max 5x($100/月)+ Opus 5——初创渗透率约 75% 的默认解,配额内不用算 token。
- 省钱变体:Codex CLI + GPT-5.6 Sol(促销 $4/$20,2026.11.21 前),token 效率号称高 2–4 倍,CI/DevOps 场景强。
- 警惕:把核心管线绑死在单一供应商上——协议兼容层(OpenHands / Kilo Code)留一条退路,成本不到 5%。
中大型企业 合规与治理优先
- 按云路由:已有 AWS 存量 → Bedrock + Claude(10 万企业客户路径);Azure → GPT-5.6;GCP → Vertex + Gemini。87% 大企业多平台并用。
- 异步长任务:Factory Droid(企业客户含 Nvidia/Adobe/摩根士丹利,承诺不用客户代码训练)或 Devin。
- 框架治理:用 OpenHands 控制台统一纳管 Claude Code / Codex / ZCode,集中审计与成本归因。
预算敏感 / 高并发运营 成本优先权重
- 性价比三巨头(成本优先方案前三):Codex CLI + DeepSeek V4 Pro(82.3)、Codex CLI + GPT-5.6 Luna(81.4)、Claude Code + GLM-5.3(80.1)。
- 批量非关键任务(客服初筛、内容初稿、数据清洗):Gemini 3.7 Flash($0.75/$3.75)+ 缓存。
- 记住两个到期日:Sol 促销 2026.11.21、Flash 入门价 2026.12.31。
研究机构 / 学术团队 可复现优先
- 首选:OpenHands(MIT)+ GLM-5.2(MIT 权重)——全链路可复现、可改造、可审计。
- 需要更强能力时叠加 Kimi K3(权重开放,注意 K3 许可对年收入 >$20M 的 MaaS 业务另有条款,科研用途不受限)。
- 基准研究自建 harness 时,参考 Vals AI 的统一脚手架方法而非厂商口径。
8.2 按行业(以合规约束为第一变量)
| 行业 | 核心约束 | 推荐组合 | 理由与注意 |
|---|---|---|---|
| 金融(国内持牌) | 数据不出境、留痕审计 | Qwen 3.8 Max / DeepSeek V4 / GLM-5.3 / Kimi K3 国内官方通道;核心系统私有化部署 DeepSeek(MIT)+ OpenHands | Claude/OpenAI/Gemini 官方均无国内合规直连路径,第三方中转存在合规风险;量化研究等长文档场景用 Qwen 3.8 的 1M 上下文,高频低价任务用 V4 Flash |
| 金融(海外/跨境) | 零保留、审计 | Bedrock + Claude(默认零保留);OpenAI 需主动申请 ZDR | 零保留条款差异显著:Anthropic 通用访问默认零保留,OpenAI 需申请;Vals Finance Agent v2 榜可作为业务能力参照 |
| 医疗 | HIPAA / 等保 | 海外:OpenAI(唯一明确 HIPAA BAA)或 Vertex 继承合规;国内:DeepSeek 本地化部署 | 审查成本最低路线是 MIT 权重 + 内网部署;涉及病历数据勿走第三方中转 |
| 电商 / 跨境 | 多语言、高并发、ROI | Listing 与客服初稿:Gemini 3.7 Flash / Luna;中文与多语言:Qwen 3.8 / GLM-5.3;爆款分析等深度任务:Claude Code + GLM-5.3 | 多语言是国产模型传统强项(LMArena 中文/多语言榜);缓存折扣对重复模板任务收益极大 |
| 制造 / 能源 | 内网、边缘、离线 | OpenHands + GLM-5.2(MIT 权重自部署);需要计算机操作能力加 Qwen 3.8 | 许可条款决定成本:DeepSeek/GLM-5.2 MIT 无限制;K3 对年收入 >$20M 的 MaaS 型业务需另行协议(纯内部使用豁免);GLM-5.3 当前无权重可部署 |
| 软件 / 互联网 | 质量与迭代速度 | 编码 Agent 主力见 8.3;初创见 8.1 | 本报告第 05.2/05.3 节的全部编码与 Agentic 分析适用 |
| 内容 / 媒体 | 创意自由度、时效 | Grok 4.6($2/$6,限制最少 + X 实时);写作质量:Claude Fable 5 | Fable 5 是 LMArena 文本榜前三中唯一全榜前三模型;Grok 无成熟 agent harness,适合对话式工作流 |
8.3 按应用领域(决策矩阵)
| 应用领域 | 质量优先 | 性价比优先 | 关键依据 |
|---|---|---|---|
| 编码 Agent / 软件工程 | Claude Code + Opus 5 / Fable 5 | Claude Code + GLM-5.3;Codex CLI + DeepSeek V4 Pro | SWE-V 独立口径 97(Opus 5)vs 96.4(DS V4 Pro);SWE-Pro 差距拉大到 15 分;DeepSeek 独立 TB 54.7 是警示 |
| 深度研究 / 文档分析 | Claude Code + Sonnet 5 / Fable 5(GAIA 血统) | Gemini CLI + 3.1 Pro(1M 原生 + Search grounding) | HAL/GAIA 榜 Anthropic 前 6;Gemini ARC-AGI-1 达人类面板水平、GDPval 表现强 |
| 客服 / 工作流自动化 | Claude Sonnet 5(τ² 政策遵从强) | Gemini 3.7 Flash;Codex CLI + Luna | τ² telecom 99% 饱和;要求供应商提供 pass^k 可靠性口径;BFCL 多轮衰减是主要风险 |
| 计算机操作 / 办公自动化 | Claude(computer use 先行者) | Qwen Code + Qwen 3.8 Max(OSWorld-V 86.1% 第一) | OSWorld-Verified 已越过人类基线;Qwen 3.8-27B 开源版 84.3% 可自部署 |
| 数据分析 / 量化研究 | Codex CLI + GPT-5.6 Sol(LiveBench 数学/推理第一) | Qwen 3.8 Max(1M 上下文 + 国内合规);DeepSeek V4(数学传统强项) | 长上下文 1M 对全量研报/年报流水分析是硬需求;注意行情数据时效性需外挂工具 |
| MCP 工具生态集成 | GPT-5.5/5.6(MCPMark 92.9%) | Kimi K2.7 Code(81.1%) | MCPMark-Verified(ICLR 2026)是 MCP 真实 CRUD 任务的目前最权威口径 |
| 超长时程自主任务 | Kimi CLI + Kimi K3(SWE-Marathon 42.0% 唯一破 40) | — | 天花板仍低(组合条目 Claude Code + Opus 4.8 仅 26%),任何方案都需人工检查点 |
风险与局限 Risks & Limits
本报告的结论强度受以下因素约束,采购决策前请通读本节。
结论与展望 Outlook
回扣核心判断,给出下一观察周期的跟踪信号。
三个核心判断
- 判断一:组合是选型单位,协议解绑是结构性趋势。Anthropic 协议成为事实标准后,"框架 × 模型"的笛卡尔积首次全部可组合——这既是选择自由,也是治理复杂度。任何 2026 年的采购决策都应包含"换脑成本"评估:框架层保留可替换性(OpenHands / 兼容端点),模型层按任务路由。
- 判断二:闭源守质量顶点,开源已进前沿带。AA 指数前 7 席仍是 Anthropic、SWE-Pro 前三仍是 Claude 系;但 Kimi K3(编码盲测榜登顶)、Qwen 3.8(OSWorld 第一)、DeepSeek V4 Pro(SWE-V 独立测开源最高 96.4%)意味着"开源不可用于生产"的旧假设已失效。开源的真实短板在 Agentic 独立口径(DeepSeek 54.7)与生态成熟度,而非编码能力。
- 判断三:成本带被重塑,$0.02/任务成为新地板。当 Luna 与 DeepSeek V4 Flash 把单任务成本压到 $0.02 级,"贵的模型一次做对 vs 便宜的模型多次重试"的经济边界需要按任务重算——这正是本报告把成本权重定为 15% 而非更高的原因:便宜本身不是优势,便宜且独立口径可靠才是。
下一观察周期(2026 Q4)跟踪信号
- GLM-5.3 开放权重与否——决定"自部署路线"是否有新旗舰(当前只有 GLM-5.2 可下载)。
- GPT-5.6 Sol 促销到期(2026.11.21)后的 OpenAI 定价策略——$4/$20 若转正,将直接改写成本维度的格局。
- Terminal-Bench 3.0 与 τ³ banking_knowledge 域的进度——长时程与知识密集任务的天花板在哪里。
- AA 智能指数中国厂商份额,与 OpenRouter 流量份额的收敛/发散——"用便宜的、夸贵的"格局是否会被打破。
- Gemini 3.5 Pro 是否发布、Antigravity CLI 能否修复 Gemini 生态分。
数据来源清单 Sources
本报告引用的全部数据源。访问日期均为 2026.09.03(另有注明者除外)。
| 数据源 | 类型 | 本报告用途 | 口径备注 |
|---|---|---|---|
| Artificial Analysis(artificialanalysis.ai) | 独立第三方 | Intelligence Index v4.1.1、输出速度、定价核对 | 2026.09.02 快照,经 DataLearner 镜像核对 |
| LMArena(lmarena.ai) | 众包盲测 | Text / WebDev / Coding 分榜 Elo | 2026.09.02 快照,58.7 万票 / 370 模型 |
| SWE-bench(swebench.com) | 学术基准 | Verified 官方统一脚手架榜 | mini-SWE-agent v2.0.0 口径 |
| Vals AI(vals.ai) | 独立第三方 | SWE-V、Terminal-Bench 2.1 同 harness 复测 | 2026.08.19 更新,独立口径首选参照 |
| Terminal-Bench(tbench.ai) | 学术基准 | 2.0 官方验证组合榜、2.1 厂商自报 | 142 条官方验证条目 |
| Princeton HAL / GAIA | 学术基准 | 通用助理 agent 能力 | 2026 上半年快照 |
| τ²/τ³-Bench(Sierra,sota2.com) | 学术基准 | 工具调用与政策遵从 | 2026.04–06 快照 |
| BFCL V4(UC Berkeley) | 学术基准 | 函数调用(单轮 AST + 多轮) | 2026.05.28 快照,榜体 2026.08.27 更新 |
| OSWorld-Verified(benchlm.ai 镜像) | 学术基准 | 计算机操作能力 | 2026.08.15 快照 |
| SWE-Marathon / DeepSWE v1.1 / MCPMark | 新兴基准 | 超长程工程、抗污染工程、MCP 工具 | 2026.07–08 快照 |
| OpenRouter(openrouter.ai/rankings) | 行业数据 | 模型路由流量份额 | 2026.08.30 周榜 |
| Stack Overflow 2026 / JetBrains 开发者调查 | 行业调查 | 框架口碑与采用度 | 2026 年度调查 |
| 各厂商官方(Anthropic / OpenAI / Google / Z.ai / Moonshot / DeepSeek / 阿里云 / xAI) | 厂商自报 | 定价、模型卡、发布数据 | 自报口径一律降权并标注 |
| 中金公司 / 广发证券 / 华泰证券研报 | 卖方研究 | 市场格局交叉验证 | 2026.03–08 |