模型

Meta: Llama 4 Scout

仅 API 开源 可商用
Meta · Llama 4 · Llama 4 Community License · 17B激活/109B总参数 / 激活 17B · 上下文 10M
能做什么
多模态理解长文档分析聊天问答逻辑推理编程开发
部署门槛
多卡
≥ Int4量化后约67GB(单卡H100可运行)
API 价格
$0.11 /百万
输入/标准档 · 全站比价 →
上下文
10M
token 窗口
参数
17B激活/109B总参数
MoE · 激活 17B

01基础参数

参数规模
17B激活/109B总参数
上下文窗口
10M
输入模态
image / text
可生成
text
模型系列
Llama 4
开源许可
Llama 4 Community License
主要语言
multi

02MoE 架构说明

MoE 混合专家 总参 17B激活/109B总参数 · 激活 17B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03推荐部署方案

推荐 FP8/Q4(多卡) vllm/ollama

04部署门槛详情

硬件等级 多卡 · 最低显存 Int4量化后约67GB(单卡H100可运行)

05Benchmark 评测

待补充

06适用场景

✓ 适用
长文档分析与摘要、多模态视觉问答、大规模代码库推理、Agent工作流与工具调用
✗ 不适用
图像生成任务、高精度数学计算、视频内容生成

07部署与限制

⚙ 本地部署建议
推荐使用Int4量化部署以降低显存需求(约67GB),需NVIDIA Hopper或Blackwell架构GPU并搭配CUDA Driver 575以上版本,可使用TensorRT-LLM或vLLM推理框架加速。
⚠ 已知限制
上下文窗口支持10M tokens,但训练长度仅256K,依赖iRoPE架构实现长度外推;图像理解测试上限为5张输入图片;在欧盟地区使用受Llama 4可接受使用政策限制。

08详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Llama 4 Scout 是 Meta 于 2025 年 4 月发布的全新 Llama 4 系列中的高效多模态模型。它采用混合专家(MoE)架构,拥有 170 亿激活参数和总共约 1090 亿参数(16 位专家),是同类模型中最强的多模态模型之一。

其最突出的特点是业界领先的 1000 万(10M)tokens 超长上下文窗口,这得益于创新的 iRoPE(交错层无限旋转位置编码)架构,能够在单次推理中处理相当于约 1.5 万页文本或多部视频的内容。模型原生支持多模态输入(文本与图像),在视觉识别、图像推理、长文档分析、代码生成和 Agent 工作流等场景中表现出色。通过 Int4 量化,Scout 能够高效部署在单张 NVIDIA H100 GPU 上,为开源社区提供了强大的长上下文、多模态能力的基础模型。

OpenRouter Provider 比价

共 4 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
DeepInfra0.10.3fp8327680
Groq0.110.34unknown131072
Novita0.180.59bf16131072
Google0.250.7unknown1310720

代表价(满血最低):Groq 输入 0.11 / 输出 0.34 USD/1M。按 provider 选择可进一步降本。

09官方资源

10API 定价 全站比价 →

标准 输入 0.11 / 输出 0.34 USD/百万token
预算估算器
USD ≈ 可输入 百万 token

11同类模型