NVIDIA Nemotron-Nano-9B-v2是英伟达于2025年8月推出的紧凑型纯文本语言模型,属于Nemotron Nano 2系列。它由120亿参数的基座模型经剪枝与蒸馏压缩至90亿参数,专为在单张NVIDIA A10G GPU上高效部署而设计。其核心亮点在于采用混合Mamba-Transformer架构,以Mamba-2和MLP层为主体,仅保留4层注意力层,在长上下文处理中实现了比同规模纯Transformer模型快6倍的吞吐量。模型支持128K上下文窗口与十种以上语言(含中文),并采用NVIDIA开放模型许可,允许商业使用。
该模型最独特的功能在于支持可切换的推理模式与思考预算管理。用户可通过系统提示或 /think、/no_think 控制Token来开启或关闭模型的推理过程(即思维链),并能设置推理Token数量上限以在准确性与响应延迟间取得平衡。在开启推理模式下,该模型在AIME25(72.1%)、MATH500(97.8%)和GPQA(64.0%)等复杂推理基准上均超越了同量级的Qwen3-8B。它适合用于AI Agent系统、RAG应用、智能客服和编程辅助等需要高精度纯文本推理的场景,但不支持图像等多模态输入,且本地部署需要至少24GB显存的NVIDIA GPU。