模型

NVIDIA: Nemotron 3 Nano Omni (free)

仅本地 开源 可商用
— · NVIDIA Open Model Agreement · 31B / 激活 3B · 上下文 256K
能做什么
多模态理解Agent工作流智能客服长文档分析OCR识别
部署门槛
中端 16-24G
≥ 20GB
上下文
256K
token 窗口
参数
31B
MoE · 激活 3B

01基础参数

参数规模
31B
上下文窗口
256K
输入模态
text / image / audio
可生成
text
模型系列
开源许可
NVIDIA Open Model Agreement
主要语言
en

02MoE 架构说明

MoE 混合专家 总参 31B · 激活 3B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03部署门槛详情

硬件等级 中端 16-24G · 最低显存 20GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
计算机操作代理(GUI自动化)、文档智能分析、音视频内容理解、多模态 Agent 子任务
✗ 不适用
纯文本对话、中文多模态交互、轻量级移动端部署

06部署与限制

⚙ 本地部署建议
模型提供 BF16、FP8、NVFP4 等多种精度,建议根据硬件选择合适的量化版本。NVFP4 量化版需约 21GB 显存,可在 RTX 5090(32GB)或 DGX Spark 上运行。FP8 版需约 33GB 显存,推荐使用 L40S(48GB)。BF16 全精度版需约 62GB 显存,建议使用 H100(80GB)。支持 vLLM、llama.cpp、TensorRT-LLM 等多种推理引擎。
⚠ 已知限制
目前仅支持英文语言,暂不适用于中文场景。在处理长音频(如1小时)和长视频时需注意输入格式限制,且 llama.cpp 对多模态支持仍在完善中,纯文本 GGUF 已提取,但完整多模态 GGUF 暂不可用。

07详细介绍

NVIDIA Nemotron 3 Nano Omni 是英伟达于 2026 年 4 月推出的业界顶尖全模态开源模型。它基于 31B 总参数、~3B 激活参数的 Mamba2-Transformer 混合 MoE 架构,原生支持将视频、音频、图像和文本输入融合到单一推理流程中。其设计目标是为代理式 AI 系统提供统一的感知与推理子单元,有效替代传统的多模型拼接方案,从而大幅降低延迟与成本。

该模型在文档智能(如 OCRBenchV2)、音视频理解(如 MediaPerf)等多项基准测试中准确率领先,并在维持相同交互响应速度下,系统吞吐量可达到同类全模态模型的 7 至 9 倍。它特别适合用于驱动计算机操作代理(GUI 自动化)、处理复杂的多模态文档,以及对会议记录、培训视频等富媒体内容进行深度分析。模型基于 NVIDIA Open Model Agreement 开源,允许商业使用。

08官方资源

09同类模型