模型

Nemotron-Nano-12B-VL 评测:文档 OCR 专精,多模态本地

查看模型详情 →
结论:推荐
优点
  • ✓ NVIDIA Open Model License 可商用,权重/训练数据/代码全开源(HuggingFace BF16/FP8/FP4 多精度)
  • ✓ 文档理解顶尖:DocVQA 94.7%、ChartQA 89.8%、OCRBench 85.6%,OCRBench v2 私有榜领先(官方技术报告)
  • ✓ 128K 上下文 + 多图/视频输入,EVS 技术提升视频推理吞吐 2 倍+
  • ✓ BF16/FP8/NVFP4-QAD 三精度,FP8/NVFP4 降低本地门槛,vLLM 原生支持
  • ✓ 纯文本推理在线:AIME-2025 71.3%、MATH-500 96.9%、LiveCodeBench 69.4%、MMLU-Pro 77.1%(官方 Table 6)
缺点
  • ✗ STEM 视觉/GUI 弱:MMMU 55.3%(低于 Qwen3-VL 69.6%)、ScreenSpot 39.4%(Qwen3-VL 94.4%)
  • ✗ 视觉 SFT 损耗文本:RULER 长上下文从 77.9 降至 72.1
  • ✗ 仅英语:MMMB 中文 84.1% 低于 InternVL3.5/GLM-4.5V
适合场景:本地文档智能(发票/收据/手册 OCR、图表解析、多页问答)、长视频内容理解与摘要(配 EVS)、企业级 RAG 与知识库问答(开源可商用)、24GB 级消费卡(RTX 4090)或 DGX Spark 多模态推理

本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-21),非实机测试。

① 公开证据综合

NVIDIA 2025-10-28 发布,约 12.6B,CRADIOv2-H 视觉编码器 + Nemotron-Nano-12B-v2 语言骨干(Transformer-Mamba 混合),文本/多图/视频输入,128K 上下文,NVIDIA Open Model License 可商用。文档 OCR 是其专精赛道:DocVQA 94.7%、ChartQA 89.8%、OCRBench 85.6%、TextVQA 85.4%,OCRBench v2 私有榜领先(较前代 Llama-3.1-Nemotron-VL-8B 全面提升)。纯文本推理在线:AIME-2025 71.3%、MATH-500 96.9%、GPQA-Diamond 64.1%、LiveCodeBench 69.4%、MMLU-Pro 77.1%(官方 Table 6)。视频:Video-MME 66.0%、LongVideoBench 63.6%,EVS 提升吞吐 2 倍+。

短板:STEM 视觉推理 + GUI 弱(MMMU 55.3 低于 Qwen3-VL 69.6、ScreenSpot 39.4 vs 94.4);视觉 SFT 损耗文本(LiveCodeBench 曾 70→50.9 回升至 69.4,RULER 77.9→72.1);仅英语。

② 与同类模型横评

③ 本地部署建议与 verdict

能否本地跑?可以。 BF16 推荐 ≥24GB VRAM(RTX 4090,可 —max-model-len 限制上下文);FP8/NVFP4 官方提供量化权重(OCRBench/DocVQA 几乎无损),NVFP4 可在 DGX Spark(128GB)或 24GB 消费卡跑。128K 全长 KV Cache 大,建议文档问答裁剪到 32K。vLLM 原生支持。

Verdict:recommend(推荐)。 开源可商用 + 文档 OCR 顶尖 + 多精度量化降门槛 + 128K 视频多页支持,Nemotron-Nano-12B-VL 在”本地文档智能”场景明确竞争力。STEM 视觉/GUI 短板非所有用户刚需。目标场景匹配(看懂文档)价值显著;通用 VQA 或 GUI 自动化选 Qwen3-VL-8B / InternVL3.5-14B。