模型

Google: Gemma 4 31B

仅 API 开源 可商用
Google · Apache-2.0 · 31B · 上下文 256K
能做什么
聊天问答编程开发多模态理解逻辑推理长文档分析
部署门槛
高端 24G+
≥ 24GB
上下文
256K
token 窗口
参数
31B

01基础参数

参数规模
31B
上下文窗口
256K
输入模态
image / text / video
可生成
text
模型系列
开源许可
Apache-2.0
主要语言
multi

02部署门槛详情

硬件等级 高端 24G+ · 最低显存 24GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
需要长上下文理解的多轮对话与文档分析、多模态问答与图像内容提取、代码生成、补全与Agent工具调用
✗ 不适用
与图像或视频生成相关的创造性视觉内容产出、对延迟极度敏感的实时语音对话场景、低功耗或低显存的边缘设备部署(该版本需较高硬件配置)

05部署与限制

⚙ 本地部署建议
建议使用Q4_K_M或更高精度的量化版本以平衡性能与显存,在单张24GB显存显卡上可运行较短上下文,若需充分利用256K长上下文,推荐使用40GB以上显存设备或多卡配置。
⚠ 已知限制
不支持音频输入与视频生成,视频理解通过序列帧分析实现。在4K长上下文下,对显存要求较高,可能需40GB以上。

06详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Google DeepMind于2026年4月发布的Gemma 4 31B IT是一款旗舰级开源多模态语言模型。作为Gemma 4系列中参数规模最大的密集架构模型,它专为在消费级GPU和工作站上实现前沿性能而设计,在推理、编程和多模态理解等任务上表现出色。

该模型的核心优势在于其强大的长上下文处理能力(256K上下文窗口)和原生工具调用支持,非常适合处理长文档分析、构建复杂的智能体工作流以及进行多模态问答。借助Q4_K_M等量化方案,该模型可以在24GB显存的消费级显卡上本地运行,为开发者提供了在自有硬件上部署先进AI能力的选择。其应用场景广泛,涵盖复杂对话、代码助手、多模态问答及企业级部署等。

OpenRouter Provider 比价

共 13 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
WandB0.120.35bf16262144
Venice0.120.36bf16256K
DeepInfra0.120.37fp4262144
Chutes0.120.37fp4131072
DeepInfra0.130.38fp8262144
SiliconFlow0.130.4fp8262144
Novita0.140.4bf16262144
Parasail0.150.4fp8262144
Phala0.150.46unknown262144
ModelRun0.220.55fp4262144
SambaNova0.220.59unknown131072
Together0.280.86unknown262144
Together0.390.97unknown262144

代表价(满血最低):WandB 输入 0.12 / 输出 0.35 USD/1M。按 provider 选择可进一步降本。

07官方资源

08同类模型