本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-21),非实机测试。
① 公开证据综合
NVIDIA 2025-10-28 发布,约 12.6B,CRADIOv2-H 视觉编码器 + Nemotron-Nano-12B-v2 语言骨干(Transformer-Mamba 混合),文本/多图/视频输入,128K 上下文,NVIDIA Open Model License 可商用。文档 OCR 是其专精赛道:DocVQA 94.7%、ChartQA 89.8%、OCRBench 85.6%、TextVQA 85.4%,OCRBench v2 私有榜领先(较前代 Llama-3.1-Nemotron-VL-8B 全面提升)。纯文本推理在线:AIME-2025 71.3%、MATH-500 96.9%、GPQA-Diamond 64.1%、LiveCodeBench 69.4%、MMLU-Pro 77.1%(官方 Table 6)。视频:Video-MME 66.0%、LongVideoBench 63.6%,EVS 提升吞吐 2 倍+。
短板:STEM 视觉推理 + GUI 弱(MMMU 55.3 低于 Qwen3-VL 69.6、ScreenSpot 39.4 vs 94.4);视觉 SFT 损耗文本(LiveCodeBench 曾 70→50.9 回升至 69.4,RULER 77.9→72.1);仅英语。
② 与同类模型横评
- vs Qwen3-VL-8B:Qwen3-VL 通用 VQA/GUI/STEM 更强(MMMU 69.6、ScreenSpot 94.4);Nemotron 文档 OCR 专精 + 纯文本推理保留更好
- vs InternVL3.5-14B:InternVL STEM 视觉更强(MMMU 67.8);Nemotron 文档 + 视频效率(EVS)优
③ 本地部署建议与 verdict
能否本地跑?可以。 BF16 推荐 ≥24GB VRAM(RTX 4090,可 —max-model-len 限制上下文);FP8/NVFP4 官方提供量化权重(OCRBench/DocVQA 几乎无损),NVFP4 可在 DGX Spark(128GB)或 24GB 消费卡跑。128K 全长 KV Cache 大,建议文档问答裁剪到 32K。vLLM 原生支持。
Verdict:recommend(推荐)。 开源可商用 + 文档 OCR 顶尖 + 多精度量化降门槛 + 128K 视频多页支持,Nemotron-Nano-12B-VL 在”本地文档智能”场景明确竞争力。STEM 视觉/GUI 短板非所有用户刚需。目标场景匹配(看懂文档)价值显著;通用 VQA 或 GUI 自动化选 Qwen3-VL-8B / InternVL3.5-14B。