本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-21),非实机测试。
① 公开证据综合
Meta 2024-09-25 发布,3B 指令微调,Llama 3.2 社区许可。3B 量级能力在线:MMLU 64.4%(第三方 62.98)、MMLU-Pro 34.7%、GSM8K 78%(第三方 77.94)。128K 长上下文是 3B 量级突出优势。吞吐 42.7 tok/s(同尺寸高,能效优于 Phi-3 Mini)。整体智力”有限但够用”(Intelligence Index 4.2/10)。
短板:复杂推理/数学受限于 3B;越狱/注入抵抗弱(37%);无多模态。
② 与同类模型横评
- vs Qwen2.5-3B:Qwen 综合效能 + 准确性领先(MMLU 65.6、GSM8K 79.1);Llama 吞吐 + 部署生态占优
- vs Phi-3-mini:Phi 能耗极高(6.2x Llama)不推荐长时运行;Llama 能效优
③ 本地部署建议与 verdict
能不能本地跑?完全可以,门槛极低。 GGUF/GPTQ/ONNX/FP8 多格式,支持 llama.cpp/Ollama/LM Studio/vLLM。BF16 约 6.5GB(8GB+ 显卡);4-bit(Q4_K_M/GPTQ)模型约 2.2GB、推理约 2.8GB(4GB 显卡甚至纯 CPU 可跑)。推荐 4GB 显存 GPU 或 16GB 内存 CPU,8GB 显存 GPU 流畅。
Verdict:caution(有条件推荐)。 Llama-3.2-3B 极低部署门槛 + 128K + 吞吐 + 开源可商用,本地入门务实。但 3B 能力有限(复杂推理弱)+ 安全防护弱(37% 抵抗)是客观短板。希望有限硬件快速低成本跑 LLM 的用户值得;追求精度/安全选 Qwen2.5-3B 或更大模型。