模型

Meta: Llama 3.2 3B Instruct

仅 API 开源 可商用
Meta · Llama 3.2 Community License(自定义商业许可协议) · 3.21B · 上下文 128K
能做什么
聊天问答智能客服长文档分析Agent工作流内容创作
部署门槛
消费级 8-12G
≥ 4.66GB(Q2_K量化)
上下文
128K
token 窗口
参数
3.21B

01基础参数

参数规模
3.21B
上下文窗口
128K
输入模态
text
可生成
text
模型系列
开源许可
Llama 3.2 Community License(自定义商业许可协议)
主要语言
multi

02部署门槛详情

硬件等级 消费级 8-12G · 最低显存 4.66GB(Q2_K量化)

03Benchmark 评测

待补充

04适用场景

✓ 适用
多语言对话与助理类应用、移动端/边缘端本地推理、文档摘要与代理式检索任务、快速原型验证与低成本部署
✗ 不适用
复杂数学推理与高级编程任务、需要超大模型泛化能力的专业领域(如医疗、法律深度分析)、对模型知识截止日期(2023年12月)之后信息有强依赖的场景

05部署与限制

⚙ 本地部署建议
推荐使用GGUF等量化格式(如Q4_K_M约2.0GB)配合llama.cpp在CPU或低显存GPU上部署。FP16精度下模型文件约6GB,建议至少8GB显存。4-bit量化后仅需约5GB显存,可在移动端芯片(如骁龙8 Gen3)上运行INT8量化推理。
⚠ 已知限制
基座模型参数量仅3B,基础能力与通用性能相对有限,数学与复杂问题解决能力较弱。微调虽能改善表现,但无法突破基座模型本身的上限。知识截止于2023年12月,无法获取后续信息。官方仅保证8种语言的支持质量。

06详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Llama 3.2 3B Instruct 是 Meta 于 2024 年 9 月 25 日发布的轻量级纯文本指令微调模型。作为 Llama 3.2 系列中 3B 规模的指令版本,它采用优化的自回归 Transformer 架构,结合监督微调(SFT)与基于人类反馈的强化学习(RLHF)进行对齐。模型参数量为 3.21B,支持 128K 令牌的长上下文窗口,并运用分组查询注意力(GQA)机制提升推理可扩展性。模型采用 Llama 3.2 Community License,允许商业使用。

该模型专为多语言对话用例优化,官方支持英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语和泰语八种语言。在指令遵循、摘要生成、提示词重写和工具使用等任务上表现优于 Gemma 2 2.6B 和 Phi 3.5-mini 等同类模型。其轻量化设计使其非常适合移动端 AI 助手、边缘端本地推理、代理式检索与知识摘要等资源受限场景。配合 GGUF 等量化格式可在 CPU 或低显存 GPU 上高效运行,是快速原型验证与低成本部署的理想选择。

OpenRouter Provider 比价

共 1 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
Cloudflare0.05090.335unknown80K

代表价(满血最低):Cloudflare 输入 0.0509 / 输出 0.335 USD/1M。按 provider 选择可进一步降本。

07官方资源

08真实评测

Llama-3.2-3B 评测:3B 本地入门,128K+吞吐强,但安全/复杂推理弱

09同类模型