模型

Llama-3.1-8B 评测:本地入门经典,但许可/知识/对话有短板

查看模型详情 →
结论:谨慎
优点
  • ✓ 开源可本地部署,128K 长上下文支持长文档处理(官方)
  • ✓ 工具调用强:BFCL 76.1%、API-Bank 82.6%,适合 Agent 场景(ModelScope / Granite4-1 评测)
  • ✓ 本地门槛低:Q4 量化仅约 5GB VRAM,8GB 显卡可流畅跑;CPU i7 级约 7 tok/s(LLMConfigurator / RunAIatHome)
  • ✓ 数学代码 8B 级中上:GSM8K 84.5%、HumanEval 72.6%(ModelScope)
  • ✓ 生态成熟:Ollama / LM Studio / llama.cpp 原生支持
缺点
  • ✗ 许可是 llama-3.1-community license(非 Apache-2.0),月活超 7 亿有商用限制
  • ✗ 知识截止 2023 年 12 月,已滞后一年半
  • ✗ MMLU 69.4% 略低于 Gemma-2-9B(71.3%);Arena Hard 25.7% 对话质量弱于更新同尺寸模型
适合场景:本地 RAG / 长文档问答(128K 上下文)、轻量级 Agent / 工具调用原型、8GB 以下显存的本地推理、隐私敏感、需可控部署的场景

本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-21),非实机测试。

① 公开证据综合

Meta 2024-07-23 发布 Llama-3.1-8B-Instruct,Llama 3.1 系列最小指令模型。知识与推理:MMLU 69.4%、MMLU-Pro 48.3%、ARC-C 83.4%(8B 级中上,但 MMLU 略低于 Gemma-2-9B 71.3%)。数学代码:GSM8K 84.5%、HumanEval 72.6%(8B 级突出)。工具调用:IFEval 80.4%、BFCL 76.1%、API-Bank 82.6%——核心优势,IFEval 优于 Qwen2.5-7B(70.1%)和 Mistral-7B(46.8%)。长上下文:128K,多针检索 98.8%。

短板:Arena Hard 仅 25.7%(Gemma-2-9B 42.0%、GPT-4o-mini 75.0%),对话”人类感知质量”明显弱。

② 与同类模型横评

③ 本地部署建议与 verdict

能不能本地跑?能,门槛很低。 Q4_K_M 约 4.83GB 磁盘 / 5GB VRAM(推荐 6GB+ 显卡);Q8_0 约 8.5GB(8GB 显卡如 RTX 3060 8GB);FP16 需 16GB;CPU i7 级约 7 tok/s。推荐 Q4_K_M / Q5_K_M 性价比最佳。

Verdict:caution(有条件推荐)。 Llama-3.1-8B 本地可行性、长上下文、工具调用仍有竞争力,但三个限制使其非”无脑推荐”:①许可非 Apache(7 亿月活商用限制);②知识 2023.12 老化;③对话质量弱(Arena Hard 25.7)。追求”开箱即用最高本地性能”建议同时评估 Qwen2.5-7B(中文/许可/数学更优);核心是”长文档 RAG + 工具调用 + 低显存”则 Llama-3.1-8B 仍合理。