本文基于公开资料综述(智谱 / DeepSeek / Kimi 3 家 AI 采集交叉一致,Kimi 2026-07-21 重采补全,非实机测试)。
① 公开证据综合
GLM-5 是智谱(Z.ai)2026-02-11 发布的新一代旗舰基础模型,定位”从 Vibe Coding 到 Agentic Engineering”——强调长程 Agent 与复杂软件工程。744B 总参 / 40B 激活的 MoE(稀疏度 5.9%),DSA 稀疏注意力,MIT 开源(官方技术报告 arXiv:2602.15763)。
编程与 Agent 是其强项:SWE-bench Verified 77.8%(2026-02 开源第一,逼近 Claude Opus 4.5 80.9%)、Terminal-Bench 2.0 56.2%(开源 SOTA)、τ²-Bench 89.7%、BrowseComp 75.9%。LMArena Elo 1451 开源第一。代码生成 EvalPlus 87.0%、中文 C-Eval 88.8% 突出。安全评测 Semgrep IDOR 检测 F1 39%(超 Claude Code 32%)。
但数学推理明显弱:GSM8K 68.8%(低于 Kimi-K2 92.1、DeepSeek-V3 87.6)、MATH 56.4%(官方 Table 11)。官方称刻意优化长程 Agent 而非单次问答,但数学短板客观存在。
② 与同类模型横评
- vs DeepSeek-V3.2:AIME 数学持平,但 GLM-5 SWE-bench(77.8 vs 73.1)、Terminal-Bench(56.2 vs 46.4)优势明显,长程工程更强
- vs Qwen3.5(397B):Qwen3.5 更均衡(MMLU 88.5 vs 88.3、LiveCodeBench 83.6 vs 52.0、原生多模态、1M 上下文、更便宜);GLM-5 仅 Agent 专项略胜,定位更垂直
- vs 后代 GLM-5.2:5.2(2026-06)FrontierSWE 等部分维度超越,但 5.2 知识/代码反而弱于 5.0(BenchLM)——两者互补,5.0 偏 Agent、5.2 偏推理特化
③ 本地部署建议与 verdict
能不能本地跑?能,门槛极高。 腾讯云显存拆解:FP8 权重 744GB + 1M 上下文 KV Cache 约 103GB ≈ 847GB,官方推荐 8×B200(1536GB 总显存)或 8×H100(短上下文勉强)。BF16 达 1488GB 基本排除单机。社区量化:INT4/GPTQ 可压到约 372GB(MoE INT4 精度损失风险,官方推荐 FP8 生产);消费级 2×RTX 4090(48GB)可 INT8/W8A8 轻量测试(上下文限 32K-64K、batch=1,公开资料未明确消费级能否跑 1M)。已适配昇腾/寒武纪等 7 国产平台。
Verdict:caution(有条件推荐)。 GLM-5 在编程 Agent 赛道能力顶尖、MIT 协议友好、1M 上下文独特、国产芯片适配完善,但本地部署硬件成本极高(8×B200 级集群),且数学推理、单轮代码(LiveCodeBench 52)非其强项、已被 GLM-5.2 部分超越。绝大多数用户 API 更务实(价格约 Claude 的 1/5-1/6);只有具备集群资源且明确需要长上下文代码 Agent 或数据主权的机构才值得本地投入。