模型

Google: Gemma 3 27B

仅 API 开源 可商用
Google · Gemma Terms of Use · 27B · 上下文 128K
能做什么
多模态理解逻辑推理长文档分析内容创作编程开发
部署门槛
高端 24G+
≥ 14.1GB (INT4)
上下文
128K
token 窗口
参数
27B

01基础参数

参数规模
27B
上下文窗口
128K
输入模态
image / text
可生成
text
模型系列
开源许可
Gemma Terms of Use
主要语言
multi

02部署门槛详情

硬件等级 高端 24G+ · 最低显存 14.1GB (INT4)

03Benchmark 评测

待补充

04适用场景

✓ 适用
需要长上下文的多模态任务、多语言对话与内容生成、消费级显卡本地部署的大规模模型
✗ 不适用
极低显存(如 <8GB)设备、纯 CPU 环境的高效推理、对响应速度有极致要求的实时场景

05部署与限制

⚙ 本地部署建议
推荐使用 INT4 量化(如 QAT 或 GPTQ 版本)进行本地部署,可将显存需求降至约 14.1GB。该模型可运行在 NVIDIA RTX 3090 (24GB) 等消费级显卡上。社区提供了多种 GGUF 格式量化版本,便于使用 llama.cpp 等工具部署。
⚠ 已知限制
模型规模较大,全精度(BF16)推理需要约 54GB 显存。视觉编码器对量化敏感,量化时建议保持视觉塔部分精度以维持多模态能力。需要遵守 Google 的 Gemma 使用条款。

06详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Google Gemma 3 27B 是 Google DeepMind 于 2025 年 3 月 12 日发布的开源多模态大语言模型。它基于与 Gemini 模型相同的研究和技术构建,是一个稠密(Dense)架构的模型。该模型拥有 270 亿参数,能够处理文本和图像输入并生成文本输出。其核心优势包括 128K 的超长上下文窗口 以及对 140 多种语言的支持,使其在长文档处理和多语言场景中表现出色。

该模型尤其适合需要长上下文理解、多语言对话、图像内容分析等任务,例如复杂的文档问答、多语言摘要生成以及视觉推理等。得益于 Google 发布的量化感知训练(QAT)版本及社区提供的多种量化方案(如 GPTQ、GGUF),Gemma 3 27B 能够在 NVIDIA RTX 3090 等消费级显卡上高效本地运行,极大地降低了高性能开源模型的部署门槛。

OpenRouter Provider 比价

共 5 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
DeepInfra0.080.16fp8131072
Parasail0.080.45fp8131072
Nebius0.10.3fp8110K
Novita0.1190.2bf1698304
Phala0.150.46unknown262144

代表价(满血最低):Novita 输入 0.119 / 输出 0.2 USD/1M。按 provider 选择可进一步降本。

07官方资源

08同类模型