模型

Z.ai: GLM 5.1

仅 API 开源 可商用
智谱AI · GLM-5 · MIT · 744B / 激活 40B · 上下文 198K
能做什么
编程开发Agent工作流逻辑推理长文档分析自主编程
部署门槛
高端 24G+
≥ 多卡集群(FP8 约 400GB)
API 价格
$0.975 /百万
输入/标准档 · 全站比价 →
上下文
198K
token 窗口
参数
744B
MoE · 激活 40B

01基础参数

参数规模
744B
上下文窗口
198K
输入模态
text
可生成
text
模型系列
GLM-5
开源许可
MIT
主要语言
multi

02MoE 架构说明

MoE 混合专家 总参 744B · 激活 40B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03部署门槛详情

硬件等级 高端 24G+ · 最低显存 多卡集群(FP8 约 400GB)

04Benchmark 评测

待补充

05适用场景

✓ 适用
自主编程与软件开发、构建长程Agent工作流、复杂系统工程任务、需要多轮工具调用的智能应用
✗ 不适用
本地资源有限的个人开发者、对响应延迟要求极致的实时场景(可选用GLM-5.1高速版)

06部署与限制

⚙ 本地部署建议
该模型为开源模型,支持本地部署。官方推荐使用vLLM或SGLang框架进行部署。FP8量化版本可显著降低显存占用至约400GB。硬件建议使用多卡高性能GPU,如8×H100/H800。因模型体积巨大,不适用于单卡或低显存环境。
⚠ 已知限制
输入模态仅支持文本,不支持原生图像、音频或视频输入。模型参数量大,部署需要高端多卡GPU集群,硬件成本较高。

07详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

GLM-5.1 delivers a major leap in coding capability, with particularly significant gains in handling long-horizon tasks. Unlike previous models built around minute-level interactions, GLM-5.1 can work independently and continuously on…

OpenRouter Provider 比价

共 19 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
DigitalOcean0.9754.3unknown65536
GMICloud0.983.08fp8202752
Chutes0.983.08fp8202752
Baidu0.983.08fp8202752
StreamLake0.983.08fp8200K
Wafer1.03.2fp4202752
DeepInfra1.053.5fp4202752
SiliconFlow1.193.74fp8204800
Phala1.214.2unknown202752
AtlasCloud1.263.96fp8202752
BaseTen1.34.3fp4202800
Novita1.384.4fp8204800
Parasail1.44.4fp8202752
Fireworks1.44.4unknown202752
Friendli1.44.4unknown202752
Inceptron1.44.4fp8202752
Together1.44.4unknown202752
Z.AI1.44.4fp8202752
Venice1.755.5fp8200K

代表价(满血最低):DigitalOcean 输入 0.975 / 输出 4.3 USD/1M。按 provider 选择可进一步降本。

08官方资源

09API 定价 全站比价 →

标准 输入 0.975 / 输出 4.3 USD/百万token
预算估算器
USD ≈ 可输入 百万 token

10真实评测

GLM-5 评测:开源编程 Agent 前代王者,744B 门槛高 + 数学弱

11同类模型