模型

Z.ai: GLM 5.2

仅 API 开源 可商用
智谱AI · MIT · 753B / 激活 40B · 上下文 1024K
能做什么
编程开发Agent工作流逻辑推理长文档分析
部署门槛
多卡
≥ 560GB
上下文
1024K
token 窗口
参数
753B
MoE · 激活 40B

01基础参数

参数规模
753B
上下文窗口
1024K
输入模态
text
可生成
text
模型系列
开源许可
MIT
主要语言
zh

02MoE 架构说明

MoE 混合专家 总参 753B · 激活 40B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03部署门槛详情

硬件等级 多卡 · 最低显存 560GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
长周期软件工程自动化、全仓库级代码理解与生成、复杂 Agentic 工作流编排
✗ 不适用
纯 CPU 推理、低显存(< 48GB)单卡部署、实时性要求极高的轻量级对话

06部署与限制

⚙ 本地部署建议
模型总参数量达 753B,推荐使用多卡并行(如 8×A100/A800)配合 vLLM 或 SGLang 部署。官方提供 BF16、FP8、INT4 等量化版本以降低硬件门槛,FP8 版本可显著减少显存占用。社区已有在 6 张 RTX Pro 6000 上通过流水线并行跑通的案例。 (显存说明:多卡,INT4量化;BF16原版约1.5TB)
⚠ 已知限制
仅支持文本输入与输出,不支持多模态。完整权重(BF16)体积达 1.51 TB,本地部署硬件门槛极高。官方发布时未公布完整基准测试,部分性能数据后续更新。

07详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

GLM-5.2 是 Z.ai 推出的旗舰级开源大语言模型,专注于代码生成与长程 Agentic 任务。模型采用 MoE(混合专家)架构,总参数量约 753B,每 token 激活约 40B 参数。其核心创新之一是 IndexShare 架构,通过在稀疏注意力层中复用索引器,在 1M 上下文长度下将每 token 计算量(FLOPs)降低 2.9 倍。模型支持最高 1M token 的上下文窗口和 131K 的输出长度。

GLM-5.2 以 MIT 协议开源,权重可自由下载、部署与商用。在 Artificial Analysis 综合榜单上位列前三,为开源模型 SOTA;在 Code Arena 前端开发评估中取得全球可用模型第一。模型原生兼容 Claude Code、Cline、Roo Code 等主流 Coding Agent 框架,并提供多档思考深度调节,适用于从轻量快速响应到深度复杂推理的各类场景。

OpenRouter Provider 比价

共 27 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
DekaLLM0.943.0unknown1048576
DeepInfra0.953.0fp41048576
DigitalOcean1.054.4unknown65536
Io Net1.09443.42fp8262144
Morph1.14.1unknown1048576
Inceptron1.153.62fp41048576
Novita1.15223.6212fp81048576
StreamLake1.15363.6256fp81024K
Wafer1.24.1fp41048576
Decart1.24.2fp41048576
Ambient1.24.2fp8202752
AkashML1.34.4fp8224250
SiliconFlow1.3024.092fp81048576
AtlasCloud1.334.18fp81048576
WandB1.394.4fp8262144
Z.AI1.44.4fp81048576
Fireworks1.44.4unknown1048576
Cloudflare1.44.4unknown262144
Friendli1.44.4unknown1048576
Parasail1.44.4fp8262144
GMICloud1.44.4fp81048576
Venice1.44.4fp81M
Together1.44.4unknown262144
Alibaba1.44.4unknown1048576
Phala1.44.4unknown1048576
Fireworks2.16.6unknown1048576
Wafer3.010.25fp41048576

代表价(满血最低):DekaLLM 输入 0.94 / 输出 3.0 USD/1M。按 provider 选择可进一步降本。

08官方资源

09真实评测

GLM-5.2 评测:开源代码 SOTA,但本地门槛顶级

10同类模型