模型

Meta: Llama 3.3 70B Instruct

仅 API 开源 可商用
Meta · Llama 3.3 Community License Agreement · 70B · 上下文 128K
能做什么
聊天问答长文档分析内容创作编程开发
部署门槛
多卡
≥ 35GB(INT4量化)
上下文
128K
token 窗口
参数
70B

01基础参数

参数规模
70B
上下文窗口
128K
输入模态
text
可生成
text
模型系列
开源许可
Llama 3.3 Community License Agreement
主要语言
multi

02部署门槛详情

硬件等级 多卡 · 最低显存 35GB(INT4量化)

03Benchmark 评测

待补充

04适用场景

✓ 适用
需要平衡性能与部署成本的多语言应用、长文档处理与复杂推理任务、希望本地部署70B级开源模型的开发者
✗ 不适用
对实时性要求极高且资源受限的移动端场景、需要原生多模态能力的应用(模型为纯文本)

05部署与限制

⚙ 本地部署建议
推荐使用INT4/AWQ等量化方式部署,约需35GB显存。FP16全精度需约140GB显存,建议多卡或使用高显存GPU(如A100 80GB)。GGUF量化版本(如Q5_K_M)可在64GB内存的M2 MacBook Pro上运行。
⚠ 已知限制
仅支持文本输入输出,不支持图像、音频等多模态。官方明确支持8种语言(英/德/法/意/葡/印地/西/泰),其他语言需自行微调且责任自负。知识截止日期为2023年12月。

06详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Llama 3.3 70B Instruct 是 Meta 于 2024 年 12 月 6 日发布的开源大语言模型。作为 Llama 3 系列的新成员,它凭借 700 亿参数实现了媲美 4050 亿参数模型 Llama 3.1 的性能,在推理效率和部署成本上优势显著。模型采用优化的 Transformer 架构与分组查询注意力(GQA),支持 128K 上下文窗口。它通过监督微调(SFT)和基于人类反馈的强化学习(RLHF)进行了指令微调,在多语言对话、文本生成与推理等任务中表现出色。

该模型特别适合需要高质量文本 AI 但资源有限的企业与开发者,可在标准工作站上通过量化方式本地部署。其多语言能力覆盖英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语和泰语 8 种语言,适用于智能客服、内容创作、代码辅助等多种场景。Llama 3.3 社区许可证允许商业与研究使用,是当前开源社区中极具竞争力的 70B 级模型选择。

OpenRouter Provider 比价

共 12 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
DeepInfra0.10.32fp8131072
Nebius0.130.4fp8131072
AkashML0.130.4fp8131072
Novita0.1350.4bf16131072
Parasail0.220.5fp8131072
Cloudflare0.2932.253fp824K
SambaNova0.450.9bf1616K
Groq0.590.79unknown131072
SambaNova0.61.2bf16131072
WandB0.710.71fp16128K
Google0.720.72unknown128K
Together1.041.04fp8131072

代表价(满血最低):Novita 输入 0.135 / 输出 0.4 USD/1M。按 provider 选择可进一步降本。

07官方资源

08同类模型