模型

Qwen3-30B-A3B 评测:MoE 本地性价比王,30B/激活 3B

查看模型详情 →
结论:推荐
优点
  • ✓ Apache-2.0 开源可商用,社区活跃
  • ✓ MoE 架构参数效率高:30B 总参仅激活 3.3B,推理成本接近 3B 稠密模型(官方技术报告)
  • ✓ 思考/非思考双模式切换,灵活适配任务
  • ✓ 中文强:MMLU-Pro 78.4(Instruct-2507)、AIME25 61.3(Instruct)/ 85.0(Thinking-2507)(官方/IT之家)
  • ✓ 本地友好:4-bit 量化约 16-20GB,单卡 RTX 4090(24GB)可跑
缺点
  • ✗ 非思考模式推理弱:AIME25 仅 21.6,需开思考模式才发挥实力
  • ✗ 纯文本无原生多模态
  • ✗ 2025-04 首发,2507 版面临 Qwen3.5/3.6/3.7 更强替代
适合场景:消费级硬件本地中文 NLP 任务、数学推理与代码辅助(开启思考模式)、低成本 API 或本地推理的企业应用、长文本处理(128K-256K,Thinking 版 1M)

本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉一致 recommend,2026-07-21),非实机测试。

① 公开证据综合

阿里通义千问 2025-04-28 发布,开源 MoE,总参 30.5B / 激活 3.3B,Apache-2.0(官方技术报告)。双模式特征明显:非思考模式推理弱(AIME25 21.6),但 Instruct-2507(AIME25 61.3)+ Thinking-2507(AIME25 85.0,超 Gemini2.5-Flash-Thinking)大幅提升。MMLU-Pro 78.4(接近 GPT-4o-0327 79.8)、LiveCodeBench v6 43.2、GPQA 70.4(官方 / IT之家)。

长上下文:基础 128K,Instruct-2507 扩 256K,Thinking-2507 达 1M(RULER 100万 token 约 72.2)。

② 与同类模型横评

③ 本地部署建议与 verdict

能不能本地跑?能,条件宽松。 FP16 约 61GB(双 A100/单 H100);FP8 约 31GB(单 A100/H100);INT4 约 16-20GB(单卡 RTX 4090 24GB);4-bit MLX 约 16-20GB(Mac Studio/MBP)。社区 W4A16/W8A8/FP8 齐全,支持 vLLM/SGLang/Ollama/llama.cpp。SGLang 单卡 BF16 达 490 tok/s(官方)。

Verdict:recommend(推荐)。 Qwen3-30B-A3B 在”开源可本地 + 激活少成本低 + 中文强 + 思考模式上限高”四维独特优势。虽 2026 有 Qwen3.5/3.6/3.7 更强替代,但极低部署门槛 + Apache-2.0 使其在消费级本地(单卡 24GB 跑出有竞争力中文推理)仍不可替代。