模型

Mistral: Mistral Nemo

仅 API 开源 可商用
— · Apache-2.0 · 12B · 上下文 128K
能做什么
聊天问答逻辑推理长文档分析编程开发Agent工作流
部署门槛
消费级 8-12G
≥ 8GB
上下文
128K
token 窗口
参数
12B

01基础参数

参数规模
12B
上下文窗口
128K
输入模态
text
可生成
text
模型系列
开源许可
Apache-2.0
主要语言
multi

02部署门槛详情

硬件等级 消费级 8-12G · 最低显存 8GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
长文本处理与文档分析、多语言对话应用、本地私有化部署
✗ 不适用
需要多模态(图像/音频)理解的任务、对推理深度要求极高的复杂数学或科学研究

05部署与限制

⚙ 本地部署建议
推荐 Q4_K_M 量化,权重约 6.8–7 GB,8 GB 显存即可运行(需留 KV Cache 余量);Q6_K 约 10 GB,适合 12 GB 显卡如 RTX 4070。FP16 原精度约 24 GB,需 24 GB 以上显存或双卡。支持 Ollama、vLLM、TensorRT-LLM 等框架,NVIDIA 亦提供官方 NIM 微服务容器。
⚠ 已知限制
仅支持文本模态,无图像或音频能力;在超长上下文(接近 128K)时,KV Cache 显存占用显著增加,实际可用长度受硬件限制;作为 12B 级别模型,在极端复杂推理任务上性能不及 70B+ frontier 模型;部分评测显示在特定语言上的文化偏见仍需注意。

06详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Mistral Nemo 是由 Mistral AI 与 NVIDIA 于 2024 年 7 月联合发布的 12B 级开源语言模型,定位为「小尺寸、大上下文」的通用指令模型。它采用标准的 Dense Transformer 架构(40 层、5120 维隐藏层、32 头注意力并配备 GQA),以 Apache-2.0 协议完全开源,可自由商用与本地部署。其核心差异化能力在于将 128K 超长上下文窗口下放到 12B 参数量级,使消费级硬件也能处理长文档、大规模代码库与多轮对话。此外,模型搭载了专为 100 种以上语言训练的 Tekken 分词器,对欧洲语言与源代码的压缩效率相比前代 SentencePiece 有显著提升,从而在多语言任务与代码场景中表现突出。 在实际应用中,Mistral Nemo 最适合需要长文本理解、多语言交互或私有化部署的场景,例如企业知识库问答、长文档摘要、多语言客服与编程辅助。得益于 FP8 量化与高效的推理优化,该模型可在 8 GB 显存的消费级 GPU 上流畅运行,是希望在本地获得「大上下文」能力的开发者的性价比之选。不过,它并非多模态模型,也不具备前沿大模型在极端复杂推理上的绝对性能,选择时需根据任务复杂度与硬件预算权衡。

OpenRouter Provider 比价

共 4 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
DekaLLM0.020.03fp8131072
DeepInfra0.020.04fp8131072
Novita0.040.17fp860288
Mistral0.150.15unknown131072

代表价(满血最低):Mistral 输入 0.15 / 输出 0.15 USD/1M。按 provider 选择可进一步降本。

07官方资源

08同类模型