模型

Nemotron-Nano-9B-v2 评测:数学/吞吐强,但中文弱+NVIDIA 依赖

查看模型详情 →
结论:谨慎
优点
  • ✓ NVIDIA Open Model License,允许商用与分发衍生模型(官方许可)
  • ✓ Mamba2-Transformer 混合架构,推理吞吐最高提升 6.3 倍,长文本场景优势明显(官方技术报告)
  • ✓ 128K-131K 超长上下文,RULER 128K 得分 78.9%
  • ✓ 数学推理突出:MATH-500 97.8%、AIME 2025 72.1%,优于同规模 Qwen3-8B
  • ✓ 运行时推理预算控制(/think /no_think),灵活切换推理深度
缺点
  • ✗ 纯文本,不支持多模态(图像/音频/视频)
  • ✗ 中文明显弱:CMMLU 61.59%、C-Eval 63.62%,远落后 Qwen3-8B(81.68%/84.84%)
  • ✗ Intelligence 综合 7.4(22nd 百分位)、MMLU-Pro 73.9(46th),知识广度中等
  • ✗ Mamba2 层非 NVIDIA 平台(AMD ROCm/Apple Silicon)优化有限,跨平台打折
适合场景:企业级长上下文 RAG、文档分析、数学推理/代码生成需可控推理深度的任务、预算敏感、单卡/边缘部署的中小团队(NVIDIA GPU)、已有 NVIDIA 基础设施 + TensorRT-LLM 优化的企业

本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-21),非实机测试。

① 公开证据综合

NVIDIA 2025-08-18 发布,8.9B,Mamba2-Transformer 混合架构(4 层 Attention + 52 层 Mamba2),从 12B 经 Minitron 蒸馏,训练 21.1T tokens,知识截止 2024-09。架构创新:Mamba-2 状态空间层替代大部分自注意力,序列复杂度二次→近线性,吞吐提升 3-6.3x(长上下文尤显)。

数学代码亮眼:MATH-500 97.8%(超部分 70B)、AIME 2025 72.1%、GPQA Diamond 64.0%、LiveCodeBench 71.1%、IFEval 90.3%。但知识广度中等:MMLU-Pro 73.9(46th 百分位)、Intelligence 综合 7.4(22nd)。中文是短板:CMMLU 61.59%、C-Eval 63.62%(Qwen3-8B 81.68%/84.84%,差距显著)。

独特卖点:/think /no_think 推理预算控制,高精度慢推理 ↔ 快速响应切换,适合 latency 敏感场景。

② 与同类模型横评

③ 本地部署建议与 verdict

能否本地跑?可以,但偏 NVIDIA 生态。 Q4_K_M 约 9.7GB VRAM(RTX 3060 12GB / Intel Arc B580 12GB,兼容性 81/100);Q6_K 约 8-10GB;FP16 约 18GB(RTX 4070 Ti Super 16GB+)。支持 TensorRT-LLM / vLLM / Ollama / LM Studio + NVFP4/FP8。注意:Mamba2 层在非 NVIDIA(AMD ROCm / Apple Silicon)优化成熟度未明确,跨平台效率优势可能打折。

Verdict:caution(有条件推荐)。 数学推理/长上下文/推理效率有亮点 + 许可商业友好,适合已有 NVIDIA 硬件 + 需求明确团队。但中文弱 + 知识中等 + 非 NVIDIA 平台不确定,难成”无脑推荐”。中文为主或跨平台部署选 Qwen3-8B 更稳;追求极致推理效率 + 长文本 + NVIDIA 硬件则值得尝试。