模型

Google: Gemma 3 12B

仅 API 开源 可商用
Google · Gemma Terms of Use(Google 自定义开源许可证) · 12B · 上下文 128K
能做什么
多模态理解逻辑推理长文档分析内容创作编程开发
部署门槛
中端 16-24G
≥ 8GB
上下文
128K
token 窗口
参数
12B

01基础参数

参数规模
12B
上下文窗口
128K
输入模态
image / text
可生成
text
模型系列
开源许可
Gemma Terms of Use(Google 自定义开源许可证)
主要语言
multi

02部署门槛详情

硬件等级 中端 16-24G · 最低显存 8GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
多模态理解与视觉问答、长上下文文本生成与摘要、资源受限环境下的本地部署、多语言 NLP 任务
✗ 不适用
超高精度图像生成与编辑、超大规模实时流式推理(需多卡)、需要超低延迟的极简边缘设备

05部署与限制

⚙ 本地部署建议
推荐使用 INT4 量化部署,最低显存约 8GB(Q4_0);FP16 全精度需约 24-38GB 显存。建议使用 llama.cpp、vLLM 或 Ollama 等推理框架,配合 Q4_K_M 等量化方案在平衡质量与性能。单卡 RTX 3090/4090 或 12GB+ 显存显卡可流畅运行量化版本。
⚠ 已知限制
Gemma 许可证禁止用于非法或有害内容生成,大规模商业部署可能需要向 Google 申请额外商业许可 。INT4 量化后模型质量有一定损失;视觉编码器仅支持固定 896x896 分辨率输入。

06详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Google Gemma 3 12B IT 是谷歌基于 Gemini 同源技术打造的轻量级开源多模态大模型。作为 Gemma 3 系列中的 12B 参数指令微调版本,它支持文本与图像双模态输入、文本输出,拥有 128K 超长上下文窗口和 140+ 语言的多语言能力。模型采用仅解码器(decoder-only)Transformer 架构,并集成了自定义 SigLIP 视觉编码器以处理 896x896 分辨率的图像输入。

该模型适用于多模态问答、长文档摘要、视觉内容分析、跨语言推理等任务。得益于其开源属性和较小的参数规模,配合 INT4 量化后可在消费级显卡(如 RTX 3090/4060)上本地部署运行,兼顾了强大能力与部署灵活性,是资源受限环境下进行多模态 AI 应用开发的理想选择。

OpenRouter Provider 比价

共 1 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
DeepInfra0.050.15bf16131072

代表价(满血最低):DeepInfra 输入 0.05 / 输出 0.15 USD/1M。按 provider 选择可进一步降本。

07官方资源

08同类模型