模型

GLM-5 评测:开源编程 Agent 前代王者,744B 门槛高 + 数学弱

查看模型详情 →
结论:谨慎
优点
  • ✓ MIT 开源权重可下载可商用,HuggingFace 托管(zai-org/GLM-5.2)
  • ✓ 编程/Agent 开源 SOTA:SWE-bench Verified 77.8%(2026-02 发布时开源第一,逼近 Claude Opus 4.5 80.9%)、Terminal-Bench 2.0 56.2%、τ²-Bench 89.7%(官方技术报告 arXiv:2602.15763)
  • ✓ LMArena Chatbot Arena Elo 1451 开源第一;代码生成 EvalPlus 87.0%、中文 C-Eval 88.8% 突出
  • ✓ 原生适配华为昇腾/寒武纪/摩尔线程等 7 大国产芯片;API 约为 Claude Opus 4.8 的 1/5-1/6
  • ✓ 安全评测强:Semgrep IDOR 检测 F1 39%(超 Claude Code 32%)
缺点
  • ✗ 744B 总参(40B 激活),FP8 权重 744GB + 1M 上下文 KV Cache 约 103GB ≈ 847GB,需 8×B200 或 8×H100 集群(腾讯云拆解)
  • ✗ 数学推理明显弱:GSM8K 68.8%(低于 Kimi-K2 92.1、DeepSeek-V3 87.6)、MATH 56.4%(官方技术报告 Table 11)
  • ✗ 纯文本无原生多模态(需另接闭源 GLM-5V-Turbo);LiveCodeBench v6 仅 52.0(远低于 Qwen3.5 83.6)
  • ✗ 已被后代 GLM-5.2 在 FrontierSWE 等部分维度超越,自部署体验可能不及云托管
适合场景:Agent 工程/自主软件开发(长程任务、多步 debug、跨文件重构)、需最强开源编程智能体、且具备 8×H100/H200 或 8×B200 集群的研究机构或企业、国产芯片(昇腾/寒武纪)信创替代场景、中文法律/合规长文本处理(C-Eval 88.8%、中文 SimpleQA 74.6%)

本文基于公开资料综述(智谱 / DeepSeek / Kimi 3 家 AI 采集交叉一致,Kimi 2026-07-21 重采补全,非实机测试)。

① 公开证据综合

GLM-5 是智谱(Z.ai)2026-02-11 发布的新一代旗舰基础模型,定位”从 Vibe Coding 到 Agentic Engineering”——强调长程 Agent 与复杂软件工程。744B 总参 / 40B 激活的 MoE(稀疏度 5.9%),DSA 稀疏注意力,MIT 开源(官方技术报告 arXiv:2602.15763)。

编程与 Agent 是其强项:SWE-bench Verified 77.8%(2026-02 开源第一,逼近 Claude Opus 4.5 80.9%)、Terminal-Bench 2.0 56.2%(开源 SOTA)、τ²-Bench 89.7%、BrowseComp 75.9%。LMArena Elo 1451 开源第一。代码生成 EvalPlus 87.0%、中文 C-Eval 88.8% 突出。安全评测 Semgrep IDOR 检测 F1 39%(超 Claude Code 32%)。

但数学推理明显弱:GSM8K 68.8%(低于 Kimi-K2 92.1、DeepSeek-V3 87.6)、MATH 56.4%(官方 Table 11)。官方称刻意优化长程 Agent 而非单次问答,但数学短板客观存在。

② 与同类模型横评

③ 本地部署建议与 verdict

能不能本地跑?能,门槛极高。 腾讯云显存拆解:FP8 权重 744GB + 1M 上下文 KV Cache 约 103GB ≈ 847GB,官方推荐 8×B200(1536GB 总显存)或 8×H100(短上下文勉强)。BF16 达 1488GB 基本排除单机。社区量化:INT4/GPTQ 可压到约 372GB(MoE INT4 精度损失风险,官方推荐 FP8 生产);消费级 2×RTX 4090(48GB)可 INT8/W8A8 轻量测试(上下文限 32K-64K、batch=1,公开资料未明确消费级能否跑 1M)。已适配昇腾/寒武纪等 7 国产平台。

Verdict:caution(有条件推荐)。 GLM-5 在编程 Agent 赛道能力顶尖、MIT 协议友好、1M 上下文独特、国产芯片适配完善,但本地部署硬件成本极高(8×B200 级集群),且数学推理、单轮代码(LiveCodeBench 52)非其强项、已被 GLM-5.2 部分超越。绝大多数用户 API 更务实(价格约 Claude 的 1/5-1/6);只有具备集群资源且明确需要长上下文代码 Agent 或数据主权的机构才值得本地投入。