模型

GLM-5.2 评测:开源代码 SOTA,但本地门槛顶级

查看模型详情 →
结论:谨慎
优点
  • ✓ MIT 协议全量开源,可商用可改可本地部署,HuggingFace 已托管完整权重(zai-org/GLM-5.2)
  • ✓ 代码能力开源 SOTA:SWE-bench Pro 62.1%、Terminal-Bench 2.0 81%、FrontierSWE 74.4%(仅次 Claude Opus 4.8 约 1%),Artificial Analysis Index v4.1 51 分开源第一(官方/BenchLM/aireiter.com)
  • ✓ 原生 1M 上下文,IndexShare 稀疏注意力使 1M FLOPs 降 2.9x,实测处理 74 万条服务器日志根因分析(官方/百度百科)
  • ✓ 工具调用正确率 + JSON 格式合法性测试 100% 通过(百度百科)
  • ✓ NVFP4 量化方案已落地(英伟达 Model Optimizer),显存降约 50%、精度几乎无损(网易);Day 0 适配昇腾/平头哥等国产算力
缺点
  • ✗ 本地门槛极高:753B 总参/40B 激活,BF16 约 1.5TB、FP8 约 750GB,最低需 8×H200 或 256GB 统一内存 Mac Studio(社区部署指南)
  • ✗ 消费级硬件几乎无法运行可用版本,NVFP4 量化后具体显存公开资料未明确
  • ✗ API 定价显著高于开源竞品(输出约为 DeepSeek-V4-Pro 的 5 倍;OpenRouter $0.42-1.40 输入/$1.32-4.40 输出)
  • ✗ 纯文本无原生多模态;知识与代码任务反而弱于前代 GLM-5(BenchLM:知识 59.6 vs 66.4、代码 62.1 vs 66.3)
适合场景:数据安全严苛、必须私有化部署代码 Agent 的企业/实验室(需 8×H200 或 Mac Studio 256GB)、1M 超长上下文的大型代码库重构 / 长周期 Agent 任务(工具调用可靠)、国产算力平台适配的政企客户、终端/CLI 自动化任务(Terminal-Bench 高分)

本文基于公开资料综述(智谱 / DeepSeek / Kimi 3 家 AI 采集交叉,Kimi 2026-07-21 重采补全,非实机测试)。

① 公开证据综合

GLM-5.2 是智谱(Z.ai)2026-06-16 发布的开源旗舰,753B 总参 / 40B 激活的 MoE,MIT 协议全量开源,HuggingFace 托管完整权重(官方 / Z.ai 发布记录)。

编程与长程任务是其绝对强项:SWE-bench Pro 62.1%(超越 GPT-5.5 58.4)、Terminal-Bench 2.0 81%、FrontierSWE 74.4(仅次 Claude Opus 4.8 约 1%)、ProgramBench 63.7。Artificial Analysis Intelligence Index v4.1 51 分居开源第一、整体第四。工具调用正确率 + JSON 合法性 100% 通过(官方 / BenchLM / aireiter.com)。

1M 上下文效率:IndexShare 使 1M token 下 FLOPs 降至传统方案约 1/2.9,实测处理 74 万条服务器日志根因分析、跨四份合同条款冲突识别(官方 / 百度百科)。

量化部署:英伟达 Model Optimizer 已提供 NVFP4 量化,宣称”成本骤降 50%、精度几乎无损”(网易);Day 0 适配华为昇腾、平头哥等国产算力。

但需注意反直觉点:BenchLM 第三方数据显示 GLM-5.2 在知识(59.6)与代码(62.1)类任务上反而弱于前代 GLM-5(66.4 / 66.3)——推理/Agent 特化、非全面升级(Kimi 角度)。

② 与同类模型横评

③ 本地部署建议与 verdict

能不能本地跑?能,但门槛顶级。 753B MoE 权重:BF16 约 1.5TB、FP8 约 750GB,生产级需 8×H200 或 4×B100/B200;NVFP4 量化可降约 50% 但具体配置公开资料未明确。量化版仅推荐 256GB 统一内存以上的 Mac Studio(M3 Ultra)跑 2-bit(约 240GB),推理 3-9 token/s(DS / 社区部署指南)。内存低于 256GB 的机器无法运行可用版本。

Verdict:caution(有条件推荐)。 GLM-5.2 是开源社区代码/长程能力最强、协议最友好的模型之一,但”顶级性能以顶级硬件为门票”。已有高配服务器或 Mac Studio 且对数据隔离有强需求的团队值得尝试;大多数个人开发者建议用官方 API 或 OpenRouter 低价渠道,远比自建硬件划算。实机验证建议:NVFP4/FP8/INT4 各量化下的显存/token·s/TTFT、1M 上下文 needle-in-haystack。