NVIDIA Nemotron Nano 12B v2 VL 是英伟达于 2025 年 10 月发布的开源多模态视觉语言模型(VLM)。其架构由约 12.6B 参数的 Nemotron-Nano-12B-v2 语言模型与 CRadioV2-H 视觉编码器组成,专为文档智能与视频理解场景设计。模型支持 128K 上下文窗口,可同时处理最多 5 张图片或最长 128 帧视频输入(支持 MP4、FLV、3GP 等格式),并可通过系统提示或 /no_think 参数控制推理过程的开启与关闭。该模型遵循 NVIDIA Open Model License,允许商业使用。
该模型核心能力聚焦于多模态文档智能(如发票、收据、手册的理解与摘要)、多图推理、视觉问答及视频内容分析。它非常适合企业级 RAG 应用、媒体资产管理和自动化报表生成等场景。本地部署需较高硬件门槛,建议在 L40S、A100 或 H100 等数据中心级 GPU 上运行,BF16 精度需至少 48GB 显存,推荐使用 NVIDIA NIM 容器通过 vLLM 或 TRT-LLM 后端进行加速部署。需要注意的是,该模型原生仅支持英文,中文场景能力有限;且 KV 缓存复用暂不支持,实际部署时需合理规划推理资源。