模型

Google: Gemma 3 4B

仅 API 开源 可商用
Google · Gemma Terms of Use(开源权重,商业使用需遵守 Google 协议) · 4B · 上下文 128K
能做什么
多模态理解长文档分析聊天问答编程开发图像生成
部署门槛
消费级 8-12G
≥ INT4 量化下约 2.8–14 GB(视上下文长度而定);FP16 下约 11–54.4 GB
上下文
128K
token 窗口
参数
4B

01基础参数

参数规模
4B
上下文窗口
128K
输入模态
image / text
可生成
text
模型系列
开源许可
Gemma Terms of Use(开源权重,商业使用需遵守 Google 协议)
主要语言
multi

02部署门槛详情

硬件等级 消费级 8-12G · 最低显存 INT4 量化下约 2.8–14 GB(视上下文长度而定);FP16 下约 11–54.4 GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
资源受限环境下的图文多模态任务、长文档理解与摘要、多语言对话系统、轻量级本地 AI 应用开发
✗ 不适用
纯音频或视频流处理、超高精度专业图像分割/检测、超大规模 batch 生产级推理(单卡性能有限)

05部署与限制

⚙ 本地部署建议
推荐使用 INT4 量化部署以降低显存占用,4GB 显存笔记本可流畅运行基础推理;128K 全上下文时 INT4 约需 14GB 显存。可使用 Ollama、llama.cpp 或 vLLM 等工具快速部署。
⚠ 已知限制
输出长度上限为 8192 tokens;图像输入需归一化为 896x896 分辨率;1B 版本上下文仅为 32K,4B/12B/27B 为 128K;非 MoE 架构,全量参数激活。

06详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Google Gemma 3 4B 是 Google DeepMind 于 2025 年 3 月推出的开源多模态轻量级模型家族成员。它基于与 Gemini 同源的技术构建,采用 Transformer 架构并集成 SigLIP 视觉编码器,支持文本与图像输入、文本输出。该模型拥有 128K 令牌的超长上下文窗口,覆盖 140 多种语言,在问答、摘要、推理及图文理解等任务上表现均衡。其紧凑的设计使其能够部署在笔记本电脑、台式机等资源有限的环境中,是开发者和研究者探索多模态 AI 应用的理想入门选择。

OpenRouter Provider 比价

共 1 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
DeepInfra0.050.1bf16131072

代表价(满血最低):DeepInfra 输入 0.05 / 输出 0.1 USD/1M。按 provider 选择可进一步降本。

07官方资源

08同类模型