模型

Llama 3.1 70B

仅本地 开源 可商用
Meta · Llama 3.1 · Llama 3.1 Community License · 70B · 上下文 128K
能做什么
聊天问答编程开发知识问答逻辑推理长文档分析
部署门槛
多卡
≥ 35GB
上下文
128K
token 窗口
参数
70B
Llama 3.1

01基础参数

参数规模
70B
上下文窗口
128K
输入模态
text
可生成
text
模型系列
Llama 3.1
开源许可
Llama 3.1 Community License
主要语言
multi

02推荐部署方案

推荐 Q4_K_M ollama

03部署门槛详情

硬件等级 多卡 · 最低显存 35GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
复杂多轮对话与智能客服、长文档摘要与 RAG 应用、代码生成与编程辅助、需要强推理能力的知识问答
✗ 不适用
仅 24GB 显存的消费级单卡(量化后仍需约 35GB 显存)、多模态理解任务(仅支持纯文本输入输出)

06部署与限制

⚙ 本地部署建议
推荐使用 4-bit 量化(如 GPTQ/AWQ/GGUF)部署,显存需求约 35GB。单卡 A100 80GB 可运行,多卡(如 2×A100)效果更佳。FP8 量化版本可将显存需求减半至约 70GB。也可通过 llama.cpp 等框架在 CPU+GPU 异构环境运行,或借助 NVMe 直通技术缓解显存压力。需在 Hugging Face 申请访问权限。
⚠ 已知限制
纯文本模型,不支持视觉等多模态输入。本地部署硬件门槛较高,不推荐消费级单卡。API 调用时最大输出长度受限(如 2K tokens)。对某些语言的推理能力可能弱于英语。

07详细介绍

Llama 3.1 70B 是 Meta 开源旗舰,128K 上下文,可商用。

08官方资源

09同类模型