本文基于公开资料综述(智谱 / DeepSeek / Kimi 3 家 AI 采集交叉,Kimi 2026-07-21 重采补全,非实机测试)。
① 公开证据综合
GLM-5.2 是智谱(Z.ai)2026-06-16 发布的开源旗舰,753B 总参 / 40B 激活的 MoE,MIT 协议全量开源,HuggingFace 托管完整权重(官方 / Z.ai 发布记录)。
编程与长程任务是其绝对强项:SWE-bench Pro 62.1%(超越 GPT-5.5 58.4)、Terminal-Bench 2.0 81%、FrontierSWE 74.4(仅次 Claude Opus 4.8 约 1%)、ProgramBench 63.7。Artificial Analysis Intelligence Index v4.1 51 分居开源第一、整体第四。工具调用正确率 + JSON 合法性 100% 通过(官方 / BenchLM / aireiter.com)。
1M 上下文效率:IndexShare 使 1M token 下 FLOPs 降至传统方案约 1/2.9,实测处理 74 万条服务器日志根因分析、跨四份合同条款冲突识别(官方 / 百度百科)。
量化部署:英伟达 Model Optimizer 已提供 NVFP4 量化,宣称”成本骤降 50%、精度几乎无损”(网易);Day 0 适配华为昇腾、平头哥等国产算力。
但需注意反直觉点:BenchLM 第三方数据显示 GLM-5.2 在知识(59.6)与代码(62.1)类任务上反而弱于前代 GLM-5(66.4 / 66.3)——推理/Agent 特化、非全面升级(Kimi 角度)。
② 与同类模型横评
- vs Claude Opus 4.8:FrontierSWE 仅差 1%(74.4 vs 75.1),但 Opus 闭源不可本地、GLM 开源可本地
- vs DeepSeek-V4-Pro:GLM 代码 SWE-bench Pro 领先(62.1 vs 55.4),DS 算法竞赛(LiveCodeBench 93.5/Codeforces 3206)与定价占优
- vs Kimi K3:K3 Artificial Analysis Index 约 57 分更高,但截至 2026-07-21 未完全开源权重;GLM-5.2 已可下载
③ 本地部署建议与 verdict
能不能本地跑?能,但门槛顶级。 753B MoE 权重:BF16 约 1.5TB、FP8 约 750GB,生产级需 8×H200 或 4×B100/B200;NVFP4 量化可降约 50% 但具体配置公开资料未明确。量化版仅推荐 256GB 统一内存以上的 Mac Studio(M3 Ultra)跑 2-bit(约 240GB),推理 3-9 token/s(DS / 社区部署指南)。内存低于 256GB 的机器无法运行可用版本。
Verdict:caution(有条件推荐)。 GLM-5.2 是开源社区代码/长程能力最强、协议最友好的模型之一,但”顶级性能以顶级硬件为门票”。已有高配服务器或 Mac Studio 且对数据隔离有强需求的团队值得尝试;大多数个人开发者建议用官方 API 或 OpenRouter 低价渠道,远比自建硬件划算。实机验证建议:NVFP4/FP8/INT4 各量化下的显存/token·s/TTFT、1M 上下文 needle-in-haystack。