本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-21),非实机测试。
① 公开证据综合
Meta 2024-07-23 发布 Llama-3.1-8B-Instruct,Llama 3.1 系列最小指令模型。知识与推理:MMLU 69.4%、MMLU-Pro 48.3%、ARC-C 83.4%(8B 级中上,但 MMLU 略低于 Gemma-2-9B 71.3%)。数学代码:GSM8K 84.5%、HumanEval 72.6%(8B 级突出)。工具调用:IFEval 80.4%、BFCL 76.1%、API-Bank 82.6%——核心优势,IFEval 优于 Qwen2.5-7B(70.1%)和 Mistral-7B(46.8%)。长上下文:128K,多针检索 98.8%。
短板:Arena Hard 仅 25.7%(Gemma-2-9B 42.0%、GPT-4o-mini 75.0%),对话”人类感知质量”明显弱。
② 与同类模型横评
- vs Qwen2.5-7B:Llama 工具调用 + 长上下文略优,Qwen 中文优化 + Apache-2.0 许可更宽松 + 数学代码(GSM8K 91.6)更强
- vs Gemma-2-9B:Llama 上下文 128K(Gemma 基础 8K)+ 工具调用强,但 MMLU + Arena Hard 略逊
③ 本地部署建议与 verdict
能不能本地跑?能,门槛很低。 Q4_K_M 约 4.83GB 磁盘 / 5GB VRAM(推荐 6GB+ 显卡);Q8_0 约 8.5GB(8GB 显卡如 RTX 3060 8GB);FP16 需 16GB;CPU i7 级约 7 tok/s。推荐 Q4_K_M / Q5_K_M 性价比最佳。
Verdict:caution(有条件推荐)。 Llama-3.1-8B 本地可行性、长上下文、工具调用仍有竞争力,但三个限制使其非”无脑推荐”:①许可非 Apache(7 亿月活商用限制);②知识 2023.12 老化;③对话质量弱(Arena Hard 25.7)。追求”开箱即用最高本地性能”建议同时评估 Qwen2.5-7B(中文/许可/数学更优);核心是”长文档 RAG + 工具调用 + 低显存”则 Llama-3.1-8B 仍合理。