本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-21),非实机测试。
① 公开证据综合
Meta 2024-09-25 发布 Llama-3.2-1B-Instruct,1B 纯文本,128K 上下文,Llama Community License(Azure Databricks / NVIDIA NIM 官方卡)。知识类中上:MMLU 49.3%(Gemma-3-1B 38.8%)、ARC-C 59.4%、IFEval 59.5%。但数学/工具明显弱:GSM8K 44.4%、MATH 30.6%、BFCL V2 25.7%、MGSM 24.5%。
独特价值:被广泛验证为优秀的投机解码草稿模型——作为 Llama-3.3-70B 草稿时,代码任务接受率 78%、整体加速 1.6-2.1x。
② 与同类模型横评
- vs Qwen2.5-1.5B:Qwen MMLU(60.6)+ GSM8K(73.2)大幅领先,且 Apache-2.0;但参数多 50%、硬件略高
- vs Gemma-3-1B:Gemma 数学(GSM8K 62.8)显著优,但 MMLU 落后 10 分
- vs Llama-3.2-3B:3B 在 GSM8K(77.7)/ MMLU(63.4)质的飞跃,硬件允许(8GB RAM)选 3B 更均衡
③ 本地部署建议与 verdict
能不能本地跑?能,门槛极低。 4GB RAM + CPU 即可(Q4),8GB RAM 流畅;推荐 8GB RAM + 现代 CPU 或 Apple M1+。支持 Ollama / llama.cpp / vLLM。
Verdict:caution(有条件推荐)。 Llama-3.2-1B 优势是极致轻量 + 128K + 开源,但数学(GSM8K 44.4)+ 工具调用(BFCL 25.7)明显落后同代。需数学/代码/复杂工具选 Qwen2.5-1.5B 或 Gemma-3-1B;仅需轻量对话/长文本摘要/草稿模型则仍有价值。