模型

NVIDIA: Nemotron Nano 9B V2 (free)

仅本地 开源 可商用
— · NVIDIA Open Model License Agreement · 9B · 上下文 128K
能做什么
聊天问答编程开发逻辑推理Agent工作流知识问答
部署门槛
消费级 8-12G
≥ 8GB
上下文
128K
token 窗口
参数
9B

01基础参数

参数规模
9B
上下文窗口
128K
输入模态
text
可生成
text
模型系列
开源许可
NVIDIA Open Model License Agreement
主要语言
multi

02部署门槛详情

硬件等级 消费级 8-12G · 最低显存 8GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
高精度数学推理与编程任务、单卡边缘AI Agent系统部署、需运行时控制推理深度的RAG与智能客服、128K长上下文文档分析
✗ 不适用
多模态图像/视频理解任务、纯CPU推理场景、低于24GB显存的消费级显卡

05部署与限制

⚙ 本地部署建议
推荐使用FP8量化或BF16精度部署。官方推荐在单张A10G(24GB)上运行,BF16精度需约24GB显存;RTX 3090实测可运行FP16量化。支持vLLM框架,可通过Docker快速部署NIM容器;量化FP8版本适合边缘设备如DGX Spark。不推荐CPU推理。
⚠ 已知限制
纯文本模型,不支持图像输入;推理模式开启时消耗额外Token,需权衡响应延迟;Mamba架构与纯Transformer在工具生态上存在细微差异;低于24GB显存的GPU需调整max-model-len或使用CPU offload。

06详细介绍

NVIDIA Nemotron-Nano-9B-v2是英伟达于2025年8月推出的紧凑型纯文本语言模型,属于Nemotron Nano 2系列。它由120亿参数的基座模型经剪枝与蒸馏压缩至90亿参数,专为在单张NVIDIA A10G GPU上高效部署而设计。其核心亮点在于采用混合Mamba-Transformer架构,以Mamba-2和MLP层为主体,仅保留4层注意力层,在长上下文处理中实现了比同规模纯Transformer模型快6倍的吞吐量。模型支持128K上下文窗口与十种以上语言(含中文),并采用NVIDIA开放模型许可,允许商业使用。

该模型最独特的功能在于支持可切换的推理模式与思考预算管理。用户可通过系统提示或 /think、/no_think 控制Token来开启或关闭模型的推理过程(即思维链),并能设置推理Token数量上限以在准确性与响应延迟间取得平衡。在开启推理模式下,该模型在AIME25(72.1%)、MATH500(97.8%)和GPQA(64.0%)等复杂推理基准上均超越了同量级的Qwen3-8B。它适合用于AI Agent系统、RAG应用、智能客服和编程辅助等需要高精度纯文本推理的场景,但不支持图像等多模态输入,且本地部署需要至少24GB显存的NVIDIA GPU。

07官方资源

08真实评测

Nemotron-Nano-9B-v2 评测:数学/吞吐强,但中文弱+NVIDIA 依赖

09同类模型