GLM-4-Flash 是智谱AI(Zhipu AI)于2024年6月推出的一款轻量级、高性价比大语言模型,参数量为9B,采用MIT协议完全开源。该模型基于GLM-4系列技术研发,使用了10T高质量多语言数据进行预训练,并通过FP8技术优化训练效率。其最大亮点是API调用完全免费,是智谱AI首个免费对外开放的大模型,旨在降低开发者和企业的AI应用门槛。
该模型在速度与性能间取得了良好平衡,实测生成速度稳定在72.14 token/s(约每秒115个字符),单次可处理128K上下文(相当于300页书籍内容)。它支持包括中文、英语、日语、德语在内的26种语言,具备多轮对话、网页浏览、函数调用(Function Call)和长文本推理等高级功能。适用于智能客服、知识问答、摘要生成、信息抽取和多语言翻译等对成本敏感且需要快速响应的场景。得益于9B的参数量,该模型可在消费级GPU(如RTX 3060)上通过4-bit量化轻松部署,最低仅需约6-8GB显存,本地部署门槛极低。