模型

NVIDIA: Nemotron 3 Nano 30B A3B

仅本地 开源 可商用
— · NVIDIA Open Model License · 30B / 激活 3.5B · 上下文 262K
能做什么
聊天问答编程开发逻辑推理Agent工作流长文档分析
部署门槛
中端 16-24G
≥ 16GB
上下文
262K
token 窗口
参数
30B
MoE · 激活 3.5B

01基础参数

参数规模
30B
上下文窗口
262K
输入模态
text
可生成
text
模型系列
开源许可
NVIDIA Open Model License
主要语言
multi

02MoE 架构说明

MoE 混合专家 总参 30B · 激活 3.5B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03部署门槛详情

硬件等级 中端 16-24G · 最低显存 16GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
需要高吞吐量的 Agent 系统、数学推理与编程任务、长文档分析与 RAG 应用、工具调用
✗ 不适用
中文为主的对话场景、创意写作、多模态理解任务

06部署与限制

⚙ 本地部署建议
支持 BF16 和 FP8 量化版本,推荐使用 vLLM 0.12.0 或更高版本部署。社区 IQ4_XS 量化版可在 11GB 显存(如 RTX 2080 Ti)上运行,速度约 14-22 token/s。22GB 及以上显存可全量加载获得最佳性能。
⚠ 已知限制
原生不支持中文,主要支持英语、德语、西班牙语、法语、意大利语和日语。创意写作能力在 Arena-Hard 测试中得分相对较低。

07详细介绍

NVIDIA Nemotron-3-Nano-30B-A3B 是英伟达于 2025 年 12 月开源的混合专家(MoE)大语言模型。它采用创新的 Mamba-2 与 Transformer 混合架构,总参数量为 30B,但每次前向传播仅激活约 3.5B 参数,在保证高性能的同时大幅提升了推理效率。模型经过 25 万亿 token 的预训练,并支持高达 100 万 token 的超长上下文窗口。

该模型设计为统一的推理与非推理任务模型,能够通过思维链(CoT)提升复杂问题的解答质量。它在数学推理(AIME25 得分 89.1%)和编程任务(LiveCodeBench 得分 68.3%)上表现优异,同时具备强大的 Agent 能力和工具调用能力。模型基于 NVIDIA Open Model License 开源,允许商业使用。需要注意的是,其原生语言支持不包括中文,主要面向英语及部分欧洲语言和日语用户。

08官方资源

09同类模型