模型

Llama-3.2-1B 评测:1B 极致轻量,但数学/工具弱

查看模型详情 →
结论:谨慎
优点
  • ✓ 开源 Llama 3.2 Community License,支持商用(月活 < 7 亿)
  • ✓ 128K 超长上下文,适合长文本摘要与检索(Artificial Analysis 确认)
  • ✓ 1B 极致轻量,4GB RAM 即可运行,Q4 量化磁盘约 0.7GB
  • ✓ 支持函数调用与结构化输出
  • ✓ MMLU 49.3% 在 1B 级别中上(高于 Gemma-3-1B 38.8%)
缺点
  • ✗ 数学推理弱:GSM8K 44.4%(明显低于 Gemma-3-1B 62.8%)
  • ✗ 工具调用弱:BFCL V2 仅 25.7%
  • ✗ 2024-09 发布,知识截止较早,已有更优替代(Qwen2.5-1.5B、Gemma-3-1B)
  • ✗ 中文/多语言非原生优化(MGSM 24.5%)
适合场景:边缘设备/移动端本地部署(手机、IoT、树莓派)、长文本摘要与轻量对话助手、大模型的投机解码草稿模型(Speculative Decoding Draft,加速 1.6-2.1x)、低资源快速原型验证与教学演示

本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-21),非实机测试。

① 公开证据综合

Meta 2024-09-25 发布 Llama-3.2-1B-Instruct,1B 纯文本,128K 上下文,Llama Community License(Azure Databricks / NVIDIA NIM 官方卡)。知识类中上:MMLU 49.3%(Gemma-3-1B 38.8%)、ARC-C 59.4%、IFEval 59.5%。但数学/工具明显弱:GSM8K 44.4%、MATH 30.6%、BFCL V2 25.7%、MGSM 24.5%。

独特价值:被广泛验证为优秀的投机解码草稿模型——作为 Llama-3.3-70B 草稿时,代码任务接受率 78%、整体加速 1.6-2.1x。

② 与同类模型横评

③ 本地部署建议与 verdict

能不能本地跑?能,门槛极低。 4GB RAM + CPU 即可(Q4),8GB RAM 流畅;推荐 8GB RAM + 现代 CPU 或 Apple M1+。支持 Ollama / llama.cpp / vLLM。

Verdict:caution(有条件推荐)。 Llama-3.2-1B 优势是极致轻量 + 128K + 开源,但数学(GSM8K 44.4)+ 工具调用(BFCL 25.7)明显落后同代。需数学/代码/复杂工具选 Qwen2.5-1.5B 或 Gemma-3-1B;仅需轻量对话/长文本摘要/草稿模型则仍有价值。