本文基于公开资料综述(智谱 / DeepSeek / Kimi 3 家 AI 采集交叉一致,2026-07-20),非实机测试。
① 公开证据综合
Claude Opus 4.8 是 Anthropic 2026-05-28 发布的旗舰闭源模型,定位”面向复杂推理、长周期 Agent 编码、高自主性工作”(官方技术博客)。其上方还有更贵的 Fable 5($10/$50)。
编程与 Agent 是其强项:SWE-bench Pro 69.2%(显著高于 Opus 4.7 64.3%、GPT-5.5 58.6%、Gemini 3.1 Pro 54.2%)、FrontierSWE 83% 登顶、知识工作 GDPval-AA 1890 Elo(领先 GPT-5.5 1769)。LMSYS Arena Elo 约 1510,稳居第一梯队(官方 / EdenAI / LMSYS)。
诚实性是差异化卖点:主动报告代码缺陷概率比 4.7 高 4 倍(漏报降 4 倍),更倾向标注不确定,欺骗行为发生率接近 Mythos Preview 水平(官方)。SuperCLUE 中文评测代码生成 83.58、幻觉控制 87.48 均全球第一(DS)。
但部分维度被反超:Terminal-Bench 2.1 74.6%,低于 GPT-5.5(78.2%)和 Sonnet 5(80.4%);SuperCLUE 指令遵循从 4.7 的 56.19 降至 44.76(降 11 分)——终端编程与指令遵循有退步(DS)。
② 与同类模型横评
- vs Sonnet 5:Sonnet 5 Terminal-Bench 反超、API 仅 Opus 40%(促销),日常编码 Sonnet 性价比更高
- vs GPT-5.5:Opus 的 SWE-bench Pro 领先约 10.6 个百分点,但 GPT-5.5 LiveCodeBench / AIME 反超
- vs DeepSeek-V4-Pro:DS 开源可本地、SWE-bench 80.6% 已接近、成本低数十倍——本地 / 性价比维度碾压
③ 本地部署建议与 verdict
能不能本地跑?根本不能。 Opus 4.8 代码与权重均不开源,无任何官方 / 社区本地部署路径,只能通过 Anthropic API / Claude Code / AWS Bedrock / Vertex AI 调用(3 家一致,llm-stats / explainx.ai 标注 closed source)。任何”本地跑需 XX GB 显存”的说法均属推测,不应采信。
Verdict:not-recommend(不推荐本地)。 Opus 4.8 能力确属第一梯队、诚实性突出,但作为闭源模型根本不满足”本地部署”需求;API 高价且新 tokenizer 进一步抬升实际成本;同时 DeepSeek-V4-Pro / GLM-5.2 等开源模型编程能力已逼近且可本地。仅推荐预算充足、必须用 Claude 生态(Claude Code / Computer Use / MCP)完成复杂 Agent 工作流的企业通过云 API 使用——本地部署场景应选开源权重模型。