模型

IBM: Granite 4.1 8B

仅 API 开源 可商用
— · Apache-2.0 · 8B · 上下文 128K
能做什么
聊天问答编程开发知识问答逻辑推理智能客服
部署门槛
消费级 8-12G
≥ 5GB
上下文
128K
token 窗口
参数
8B

01基础参数

参数规模
8B
上下文窗口
128K
输入模态
text
可生成
text
模型系列
开源许可
Apache-2.0
主要语言
multi

02部署门槛详情

硬件等级 消费级 8-12G · 最低显存 5GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
企业级AI助手开发、工具调用与Agent工作流、代码生成与解释、检索增强生成(RAG)应用
✗ 不适用
图文/视频等多模态理解任务、超长文档(超过128K上下文)的精细分析、纯CPU环境下的高性能推理

05部署与限制

⚙ 本地部署建议
模型为密集架构8B参数,支持FP8量化,社区已提供GGUF等量化版本可在消费级GPU或Mac上运行(如Q4_K_M量化约需7GB显存)。原生支持llama.cpp等本地推理框架,适合私有化部署。如需高性能,建议使用16GB以上显存GPU。
⚠ 已知限制
尽管模型在多语言对话用例中表现良好,但非英语任务的性能可能不如英语任务,可以通过少样本示例提升准确率。模型在特定情况下可能产生不准确或带有偏见的内容,建议在实际部署前进行针对性的安全测试和调整。上下文窗口为128K(预训练时扩展至512K),但长上下文精细分析能力仍有待验证。

06详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

IBM Granite 4.1 8B 是 IBM 于 2026 年 4 月 29 日发布的密集架构(dense)大语言模型,参数量为 80 亿,属于 Granite 4.1 系列中的均衡型版本。该模型采用解码器-only 的 Transformer 架构,集成了分组查询注意力(GQA)、旋转位置编码(RoPE)、SwiGLU 激活函数等组件。通过多阶段预训练(约 15 万亿 token)和经过显著改进的后训练流程(包括监督微调和强化学习对齐),Granite 4.1 8B 在指令遵循、工具调用、代码生成和数学推理方面表现优异,在多项基准测试中与参数量更大的模型竞争。例如,它在 MMLU 上达到 73.84%,在 GSM8K 上达到 92.49%,在 HumanEval 上达到 87.2%。该模型完全开源,采用 Apache 2.0 许可,支持包括中文在内的 11 种语言,适用于企业级 AI 助手、Agent 工作流、RAG 应用及代码开发等场景。

OpenRouter Provider 比价

共 1 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
WandB0.050.1bf16131072

代表价(满血最低):WandB 输入 0.05 / 输出 0.1 USD/1M。按 provider 选择可进一步降本。

07官方资源

08同类模型