模型

NVIDIA: Nemotron Nano 12B 2 VL (free)

仅本地 开源 可商用
— · NVIDIA Open Model License · 12B · 上下文 128K
能做什么
OCR识别聊天问答知识问答多模态理解长文档分析
部署门槛
消费级 8-12G
≥ 12GB
上下文
128K
token 窗口
参数
12B

01基础参数

参数规模
12B
上下文窗口
128K
输入模态
text / image
可生成
text
模型系列
开源许可
NVIDIA Open Model License
主要语言
en

02部署门槛详情

硬件等级 消费级 8-12G · 最低显存 12GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
文档智能解析与结构化信息提取(OCR增强)、基于多图/视频的视觉问答与内容摘要、企业级RAG应用中的多模态信息处理
✗ 不适用
纯中文友好场景(模型原生仅支持英文)、低于48GB显存的消费级显卡本地运行(需数据中心级GPU)、高精度数学推理(推理模式与数学能力非主要优化方向)

05部署与限制

⚙ 本地部署建议
需48GB以上显存NVIDIA GPU(L40S/A100/H100等)。推荐使用NVIDIA NIM容器部署,支持BF16/FP8精度。FP8量化版本磁盘约20GB。官方建议--shm-size=32GB,可通过vLLM或TRT-LLM后端加速。不支持纯CPU或消费级低显存显卡。
⚠ 已知限制
仅支持英文输入,中文能力未经优化。本地部署硬件门槛高(最低48GB显存)。KV缓存复用不支持。推理模式开启时消耗额外token,需权衡延迟与准确性。视频输入建议利用高效视频采样(EVS)参数优化性能。

06详细介绍

NVIDIA Nemotron Nano 12B v2 VL 是英伟达于 2025 年 10 月发布的开源多模态视觉语言模型(VLM)。其架构由约 12.6B 参数的 Nemotron-Nano-12B-v2 语言模型与 CRadioV2-H 视觉编码器组成,专为文档智能与视频理解场景设计。模型支持 128K 上下文窗口,可同时处理最多 5 张图片或最长 128 帧视频输入(支持 MP4、FLV、3GP 等格式),并可通过系统提示或 /no_think 参数控制推理过程的开启与关闭。该模型遵循 NVIDIA Open Model License,允许商业使用。

该模型核心能力聚焦于多模态文档智能(如发票、收据、手册的理解与摘要)、多图推理、视觉问答及视频内容分析。它非常适合企业级 RAG 应用、媒体资产管理和自动化报表生成等场景。本地部署需较高硬件门槛,建议在 L40S、A100 或 H100 等数据中心级 GPU 上运行,BF16 精度需至少 48GB 显存,推荐使用 NVIDIA NIM 容器通过 vLLM 或 TRT-LLM 后端进行加速部署。需要注意的是,该模型原生仅支持英文,中文场景能力有限;且 KV 缓存复用暂不支持,实际部署时需合理规划推理资源。

07官方资源

08真实评测

Nemotron-Nano-12B-VL 评测:文档 OCR 专精,多模态本地

09同类模型