模型

Llama 3.1 70B (Groq极速)

仅 API 开源 可商用
Groq · Llama 3.1 Community License · 70B · 上下文 128K
能做什么
聊天问答编程开发知识问答逻辑推理长文档分析
部署门槛
待补充
≥ 35GB(4-bit 量化)
API 价格
$0.59 /百万
输入/标准档 · 全站比价 →
上下文
128K
token 窗口
参数
70B

01基础参数

参数规模
70B
上下文窗口
128K
输入模态
text
可生成
text
模型系列
开源许可
Llama 3.1 Community License
主要语言
multi

02部署门槛详情

硬件等级 待补充 · 最低显存 35GB(4-bit 量化)

03Benchmark 评测

待补充

04适用场景

✓ 适用
需要低延迟响应的实时对话应用、长文档分析与 RAG 问答、逻辑推理和多步 Agent 工作流、代码生成与编程辅助
✗ 不适用
本地部署(需通过 API 使用 Groq 硬件)、多模态任务(仅支持文本输入输出)

05部署与限制

⚙ 本地部署建议
此模型通过 Groq API 提供,无法本地部署。开发者需在 GroqCloud 注册获取 API 密钥,通过 OpenAI 兼容接口调用。免费层有速率限制,生产环境建议评估付费方案。
⚠ 已知限制
仅支持文本输入输出,不支持图像等多模态。API 服务有调用频率限制和最大 token 限制(预览期 max_tokens 为 8k)。推理质量依赖提示工程,复杂逻辑问题仍需优化交互策略。

06详细介绍

Groq 用 LPU 托管 Llama 3.1 70B,推理速度极快。

07官方资源

08API 定价 全站比价 →

标准 输入 0.59 / 输出 0.79 USD/百万token · 有免费额度
预算估算器
USD ≈ 可输入 百万 token

09同类模型