模型

Claude Opus 4.8 评测:能力第一梯队,但闭源不可本地部署

查看模型详情 →
结论:不推荐
优点
  • ✓ 编程 / Agent 顶尖:SWE-bench Pro 69.2%(领先 GPT-5.5 / Gemini 3.1 Pro)、FrontierSWE 83% 登顶、知识工作 GDPval-AA 1890 Elo(官方 / EdenAI)
  • ✓ 诚实性显著提升:主动报告代码缺陷概率比 4.7 高 4 倍,更愿说"我不确定"(官方技术报告)
  • ✓ 1M 上下文 + 多模态输入(文本 / 图像 / 音频 / 视频)
  • ✓ 动态工作流单次最多 1000 个子 Agent 并行处理大规模代码迁移(官方)
缺点
  • ✗ 闭源专有,权重不公开,**根本无法本地部署**,只能通过 Anthropic API / Claude Code / AWS Bedrock / Vertex AI 调用(llm-stats / explainx.ai 标注 closed source)
  • ✗ API 贵:输入 $5 / 输出 $25 每百万 token,新 tokenizer 使同文本 token 数涨 30-35%,实际成本更高
  • ✗ Terminal-Bench 2.1 74.6% 被 Sonnet 5(80.4%)和 GPT-5.5(78.2%)反超;SuperCLUE 指令遵循从 56.19 降至 44.76(降 11 分)
  • ✗ 开源替代逼近:DeepSeek-V4-Pro(SWE-bench 80.6%)、GLM-5.2(74.4%)已接近,且可本地部署
适合场景:云 API 复杂软件工程与代码库级任务(企业级、预算充足)、高诚实度 / 低幻觉的专业写作、法律 / 金融分析、Claude Code 动态工作流大规模代码迁移、1M 长上下文文档分析——但都走 API,非本地

本文基于公开资料综述(智谱 / DeepSeek / Kimi 3 家 AI 采集交叉一致,2026-07-20),非实机测试。

① 公开证据综合

Claude Opus 4.8 是 Anthropic 2026-05-28 发布的旗舰闭源模型,定位”面向复杂推理、长周期 Agent 编码、高自主性工作”(官方技术博客)。其上方还有更贵的 Fable 5($10/$50)。

编程与 Agent 是其强项:SWE-bench Pro 69.2%(显著高于 Opus 4.7 64.3%、GPT-5.5 58.6%、Gemini 3.1 Pro 54.2%)、FrontierSWE 83% 登顶、知识工作 GDPval-AA 1890 Elo(领先 GPT-5.5 1769)。LMSYS Arena Elo 约 1510,稳居第一梯队(官方 / EdenAI / LMSYS)。

诚实性是差异化卖点:主动报告代码缺陷概率比 4.7 高 4 倍(漏报降 4 倍),更倾向标注不确定,欺骗行为发生率接近 Mythos Preview 水平(官方)。SuperCLUE 中文评测代码生成 83.58、幻觉控制 87.48 均全球第一(DS)。

但部分维度被反超:Terminal-Bench 2.1 74.6%,低于 GPT-5.5(78.2%)和 Sonnet 5(80.4%);SuperCLUE 指令遵循从 4.7 的 56.19 降至 44.76(降 11 分)——终端编程与指令遵循有退步(DS)。

② 与同类模型横评

③ 本地部署建议与 verdict

能不能本地跑?根本不能。 Opus 4.8 代码与权重均不开源,无任何官方 / 社区本地部署路径,只能通过 Anthropic API / Claude Code / AWS Bedrock / Vertex AI 调用(3 家一致,llm-stats / explainx.ai 标注 closed source)。任何”本地跑需 XX GB 显存”的说法均属推测,不应采信。

Verdict:not-recommend(不推荐本地)。 Opus 4.8 能力确属第一梯队、诚实性突出,但作为闭源模型根本不满足”本地部署”需求;API 高价且新 tokenizer 进一步抬升实际成本;同时 DeepSeek-V4-Pro / GLM-5.2 等开源模型编程能力已逼近且可本地。仅推荐预算充足、必须用 Claude 生态(Claude Code / Computer Use / MCP)完成复杂 Agent 工作流的企业通过云 API 使用——本地部署场景应选开源权重模型。