Groq 用 LPU 托管 Llama 3.1 70B,推理速度极快。
Llama 3.1 70B (Groq极速)
仅 API 开源 可商用
Groq · Llama 3.1 Community License · 70B · 上下文 128K
能做什么
聊天问答编程开发知识问答逻辑推理长文档分析
01基础参数
- 参数规模
- 70B
- 上下文窗口
- 128K
- 输入模态
- text
- 可生成
- text
- 模型系列
- —
- 开源许可
- Llama 3.1 Community License
- 主要语言
- multi
02部署门槛详情
硬件等级 待补充 · 最低显存 35GB(4-bit 量化)
03Benchmark 评测
待补充
04适用场景
✓ 适用
需要低延迟响应的实时对话应用、长文档分析与 RAG 问答、逻辑推理和多步 Agent 工作流、代码生成与编程辅助
✗ 不适用
本地部署(需通过 API 使用 Groq 硬件)、多模态任务(仅支持文本输入输出)
05部署与限制
⚙ 本地部署建议
此模型通过 Groq API 提供,无法本地部署。开发者需在 GroqCloud 注册获取 API 密钥,通过 OpenAI 兼容接口调用。免费层有速率限制,生产环境建议评估付费方案。
⚠ 已知限制
仅支持文本输入输出,不支持图像等多模态。API 服务有调用频率限制和最大 token 限制(预览期 max_tokens 为 8k)。推理质量依赖提示工程,复杂逻辑问题仍需优化交互策略。