模型

GLM-4-Flash

仅 API 开源 可商用
智谱AI · GLM-4 · MIT · 9B · 上下文 128K
能做什么
聊天问答编程开发知识问答智能客服内容创作
部署门槛
消费级 8-12G
≥ 8GB
API 价格
¥0 /百万
输入/标准档 · 全站比价 →
上下文
128K
token 窗口
参数
9B
GLM-4

01基础参数

参数规模
9B
上下文窗口
128K
输入模态
text
可生成
text
模型系列
GLM-4
开源许可
MIT
主要语言
multi

02部署门槛详情

硬件等级 消费级 8-12G · 最低显存 8GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
需要快速响应的轻量级对话与问答、长文档摘要与信息抽取、多语言翻译与内容生成、原型验证与成本敏感的开发场景
✗ 不适用
复杂的数学推理与高难度逻辑题、多模态理解任务

05部署与限制

⚙ 本地部署建议
GLM-4-Flash 参数量为9B,属于低硬件门槛模型。在4-bit量化下,约需6-8GB显存即可在消费级显卡(如RTX 3060/4060)上流畅运行。推荐使用llama.cpp或Ollama进行量化部署。
⚠ 已知限制
作为9B参数的轻量级模型,在复杂推理、高难度数学和代码生成任务上的能力上限低于百亿级以上大模型。主要优势在于速度和成本,而非绝对性能。

06详细介绍

GLM-4-Flash 是智谱AI(Zhipu AI)于2024年6月推出的一款轻量级、高性价比大语言模型,参数量为9B,采用MIT协议完全开源。该模型基于GLM-4系列技术研发,使用了10T高质量多语言数据进行预训练,并通过FP8技术优化训练效率。其最大亮点是API调用完全免费,是智谱AI首个免费对外开放的大模型,旨在降低开发者和企业的AI应用门槛。

该模型在速度与性能间取得了良好平衡,实测生成速度稳定在72.14 token/s(约每秒115个字符),单次可处理128K上下文(相当于300页书籍内容)。它支持包括中文、英语、日语、德语在内的26种语言,具备多轮对话、网页浏览、函数调用(Function Call)和长文本推理等高级功能。适用于智能客服、知识问答、摘要生成、信息抽取和多语言翻译等对成本敏感且需要快速响应的场景。得益于9B的参数量,该模型可在消费级GPU(如RTX 3060)上通过4-bit量化轻松部署,最低仅需约6-8GB显存,本地部署门槛极低。

07官方资源

08API 定价 全站比价 →

标准 输入 0 / 输出 0 CNY/百万token · 完全免费
预算估算器
CNY ≈ 可输入 百万 token

09同类模型