模型

NVIDIA: Nemotron 3 Ultra

仅 API 开源 可商用
— · OpenMDW-1.1 · 550B / 激活 55B · 上下文 1M
能做什么
编程开发Agent工作流逻辑推理长文档分析知识问答
部署门槛
多卡
≥ 305GB
上下文
1M
token 窗口
参数
550B
MoE · 激活 55B

01基础参数

参数规模
550B
上下文窗口
1M
输入模态
text
可生成
text
模型系列
开源许可
OpenMDW-1.1
主要语言
multi

02MoE 架构说明

MoE 混合专家 总参 550B · 激活 55B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03部署门槛详情

硬件等级 多卡 · 最低显存 305GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
复杂Agent工作流与多步推理、长文档分析与高价值RAG、多语言编程与数学推理
✗ 不适用
纯CPU环境部署、低显存单卡环境、图像或视频多模态任务

06部署与限制

⚙ 本地部署建议
模型为开源MoE架构,推荐使用NVIDIA NIM容器或TensorRT-LLM进行部署。NVFP4量化版本为最小显存占用的推荐方案,需至少4张B200/GB200/B300/GB300或8张H100显卡;BF16版本要求更高(如8张H200或16张H100)。需使用多卡并行(TP/PP)部署。
⚠ 已知限制
模型为纯文本模型,不支持图像、视频等多模态输入。本地部署硬件门槛极高,需多张高端数据中心GPU,不适合个人或小型团队本地运行。

07详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Nemotron 3 Ultra 是 NVIDIA 于 2026年6月4日发布的Nemotron 3系列旗舰模型,定位为面向复杂Agent工作流的前沿级开源大语言模型。其总参数量为550B,采用混合专家(MoE)架构,每token激活约55B参数。该模型采用创新的混合架构,融合了Mamba-2、MoE与Attention层(LatentMoE架构),并引入了多Token预测(MTP)技术以提升推理速度与生成质量。

该模型专为需要强推理能力的Agent场景设计,支持通过「enable_thinking」参数灵活开关推理过程。其核心优势在于原生支持工具调用与Agentic工作流,具备长达1M token的超大上下文窗口,非常适合处理长文档分析、复杂多步推理、高价值RAG系统及多语言编程任务。模型基于OpenMDW-1.1开源协议发布,允许商业使用,并提供BF16与NVFP4等多种精度版本,旨在通过NVIDIA NIM和TensorRT-LLM实现高效部署。

OpenRouter Provider 比价

共 3 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
DeepInfra0.52.2bf16262144
Together0.63.6unknown512288
Nebius1.03.0fp4262144

代表价(满血最低):DeepInfra 输入 0.5 / 输出 2.2 USD/1M。按 provider 选择可进一步降本。

08官方资源

09同类模型