模型

Meta: Llama 4 Maverick

仅 API 开源 可商用
Meta · Llama 4 Community License · 400B / 激活 17B · 上下文 1024K
能做什么
逻辑推理多模态理解聊天问答编程开发长文档分析
部署门槛
多卡
≥ 多卡 2×48GB(1.78-bit 量化)或 512GB+(FP16 未量化)
上下文
1024K
token 窗口
参数
400B
MoE · 激活 17B

01基础参数

参数规模
400B
上下文窗口
1024K
输入模态
image / text
可生成
text
模型系列
开源许可
Llama 4 Community License
主要语言
multi

02MoE 架构说明

MoE 混合专家 总参 400B · 激活 17B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03部署门槛详情

硬件等级 多卡 · 最低显存 多卡 2×48GB(1.78-bit 量化)或 512GB+(FP16 未量化)

04Benchmark 评测

待补充

05适用场景

✓ 适用
需要图像理解与文本推理结合的多模态任务、长上下文场景(如多文档分析、代码库推理)、高吞吐量生产级推理部署、Agentic 系统与复杂工具调用
✗ 不适用
显存资源有限的单卡消费级环境、对延迟要求极高的实时纯文本轻量场景、欧盟地区使用(受可接受使用政策限制)

06部署与限制

⚙ 本地部署建议
本地部署建议使用量化版本以降低显存需求:1.78-bit 量化需 2×48GB GPU;INT4 量化可减少约75%显存。FP16 未量化版本约 801GB,需 512GB+ 显存或高端多卡集群。推荐使用 llama.cpp、Ollama 或 vLLM 等推理框架。
⚠ 已知限制
模型体积极大,未量化版本部署门槛极高。图像理解目前仅支持英语。在欧盟地区使用受限。需签署 Meta Llama 4 社区许可协议方可获取权重。

07详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Meta Llama 4 Maverick 是 Meta 于 2025 年 4 月发布的 Llama 4 系列旗舰级模型。它采用混合专家(MoE)架构,总参数量约 4000 亿,但每个 token 仅激活 170 亿参数,由 128 位专家协同工作,在保持高性能的同时提升了推理效率。模型原生支持多模态,通过早期融合机制实现图像与文本的联合理解,上下文窗口高达 100 万 token,预训练数据涵盖约 22 万亿多模态 token。

该模型适用于多模态视觉推理、多语言对话、代码生成、长文档处理及 Agentic 系统构建等场景。它支持阿拉伯语、英语、法语、德语等 12 种语言的微调,预训练数据覆盖 200 种语言。模型采用 Llama 4 社区许可协议,允许商业与研究用途,但需签署许可协议方可获取权重。由于其庞大的体量,本地部署建议使用量化版本(如 INT4 或 1.78-bit),以降低显存需求。

OpenRouter Provider 比价

共 5 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
DeepInfra0.150.6fp81048576
DigitalOcean0.250.87unknown128K
Novita0.270.85fp81048576
Parasail0.351.0fp8524288
Google0.351.15unknown524288

代表价(满血最低):DigitalOcean 输入 0.25 / 输出 0.87 USD/1M。按 provider 选择可进一步降本。

08官方资源

09同类模型