模型

Google: Gemma 4 26B A4B

仅 API 开源 可商用
Google · Apache-2.0 · 25.2B / 激活 3.8B · 上下文 256K
能做什么
聊天问答编程开发多模态理解逻辑推理长文档分析
部署门槛
高端 24G+
≥ 16GB
上下文
256K
token 窗口
参数
25.2B
MoE · 激活 3.8B

01基础参数

参数规模
25.2B
上下文窗口
256K
输入模态
image / text / video
可生成
text
模型系列
开源许可
Apache-2.0
主要语言
multi

02MoE 架构说明

MoE 混合专家 总参 25.2B · 激活 3.8B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03部署门槛详情

硬件等级 高端 24G+ · 最低显存 16GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
需要高效推理速度的多模态对话与问答、长文档分析与多模态内容理解、代码生成与Agent工具调用构建、对部署灵活性有需求的开源商业应用
✗ 不适用
图像、视频等视觉内容生成任务、对音频输入有原生需求的场景(该型号不支持音频)

06部署与限制

⚙ 本地部署建议
该模型为开源可本地部署。作为MoE架构,其推理速度较快,但总参数量仍较高,推荐使用Q4_K_M或NVFP4等量化方案进行部署以降低显存占用。
⚠ 已知限制
仅支持文本和图像输入输出,不支持音频输入与视频/图像生成。处理超长上下文时仍对硬件有一定要求。

07详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Google DeepMind于2026年4月发布的Gemma 4 26B A4B IT是一款旗舰级开源多模态模型。它采用混合专家(MoE)架构,总参数量为25.2B,但推理时仅激活约3.8B参数,这一设计使其在提供接近大型模型性能的同时,推理速度接近4B级模型。

该模型专为消费级GPU和工作站设计,支持高达256K的上下文窗口,并原生支持函数调用,非常适合构建复杂的智能体工作流。其多模态能力覆盖文本、图像和视频理解(通过处理帧序列),并支持超过140种语言。凭借Apache 2.0许可证,该模型对商业应用和本地部署非常友好,开发者可通过GGUF等量化格式在自有硬件上运行。

OpenRouter Provider 比价

共 10 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
DekaLLM0.060.33bf16262144
DeepInfra0.070.34fp8262144
Cloudflare0.10.3unknown256K
SiliconFlow0.120.4fp8262144
Novita0.130.4bf16262144
Parasail0.130.4bf16262144
NextBit0.130.4bf16262144
Wafer0.130.4fp8262144
Google0.150.6unknown262144
Venice0.16250.5bf16256K

代表价(满血最低):DekaLLM 输入 0.06 / 输出 0.33 USD/1M。按 provider 选择可进一步降本。

08官方资源

09同类模型