模型

Qwen: Qwen3 30B A3B

仅 API 开源 可商用
阿里通义千问 · Apache-2.0 · 30.5B / 激活 3.3B · 上下文 128K
能做什么
逻辑推理数学推理编程开发内容创作Agent工作流
部署门槛
中端 16-24G
≥ 16.9GB(NVFP4 量化)
上下文
128K
token 窗口
参数
30.5B
MoE · 激活 3.3B

01基础参数

参数规模
30.5B
上下文窗口
128K
输入模态
text
可生成
text
模型系列
开源许可
Apache-2.0
主要语言
zh

02MoE 架构说明

MoE 混合专家 总参 30.5B · 激活 3.3B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03部署门槛详情

硬件等级 中端 16-24G · 最低显存 16.9GB(NVFP4 量化)

04Benchmark 评测

待补充

05适用场景

✓ 适用
需要平衡性能与部署成本的生产环境、多语言国际化和跨语言应用、Agent 工具调用与复杂任务编排、代码生成与编程辅助场景
✗ 不适用
对超长上下文(>128K)有刚性需求的场景、需要多模态输入输出的任务、对单次推理延迟有极致要求的实时场景

06部署与限制

⚙ 本地部署建议
推荐使用 NVFP4/INT8 等量化方案降低显存占用,如 NVFP4 量化可将 BF16 的 61GB 压缩至约 16.9GB,实现单卡部署。也可使用 GGUF 格式配合 llama.cpp 等框架在消费级 GPU 上运行。建议使用 transformers>=4.51.0 或 vLLM/SGLang 等推理框架。
⚠ 已知限制
上下文原生为 32K,需通过 YaRN 扩展至 128K;部分 2507 版本仅支持非思考模式;MoE 架构对批处理大小和并行策略有一定调优要求。

07详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Qwen3-30B-A3B 是阿里巴巴通义千问团队于 2025 年 4 月开源发布的第三代大语言模型,采用混合专家(MoE)架构,总参数量约 300 亿,每次推理仅激活约 30 亿参数。模型包含 128 个专家、每次路由激活 8 个专家,并采用 GQA 分组查询注意力机制。它原生支持思考模式(复杂推理)与非思考模式(高效响应)的无缝切换,在数学、代码生成、常识推理及 Agent 工具调用等任务上表现优异。模型基于 Apache-2.0 协议开源,可自由用于商业场景。

该模型支持 100+ 种语言和方言,原生上下文长度为 32K,可通过 YaRN 扩展至 128K。借助 NVFP4、INT8、GGUF 等量化方案,可将显存占用从 BF16 的约 61GB 压缩至 16.9GB 左右,实现消费级单卡部署。它适用于企业级智能客服、代码开发辅助、多语言翻译、长文档分析及 Agent 智能体等场景,是兼顾性能与部署成本的开源 MoE 模型优选。

OpenRouter Provider 比价

共 3 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
DeepInfra0.120.5fp840960
Alibaba0.130.52unknown131072
NextBit0.140.55fp832768

代表价(满血最低):Alibaba 输入 0.13 / 输出 0.52 USD/1M。按 provider 选择可进一步降本。

08官方资源

09真实评测

Qwen3-30B-A3B 评测:MoE 本地性价比王,30B/激活 3B

10同类模型