本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉一致 recommend,2026-07-21),非实机测试。
① 公开证据综合
阿里通义千问 2025-04-28 发布,开源 MoE,总参 30.5B / 激活 3.3B,Apache-2.0(官方技术报告)。双模式特征明显:非思考模式推理弱(AIME25 21.6),但 Instruct-2507(AIME25 61.3)+ Thinking-2507(AIME25 85.0,超 Gemini2.5-Flash-Thinking)大幅提升。MMLU-Pro 78.4(接近 GPT-4o-0327 79.8)、LiveCodeBench v6 43.2、GPQA 70.4(官方 / IT之家)。
长上下文:基础 128K,Instruct-2507 扩 256K,Thinking-2507 达 1M(RULER 100万 token 约 72.2)。
② 与同类模型横评
- vs Qwen3-32B(Dense):32B 知识略优(MMLU 83.61 vs 81.38),但 30B-A3B 推理成本低 + 4-bit 更省显存(16-18GB vs 19-20GB)
- vs Qwen3.5-27B:3.5 多模态 + benchmark 更强,但 API 贵 4 倍;纯文本性价比选 30B-A3B
- vs DeepSeek-V3-0324:DS MMLU-Pro 81.2 / AIME25 46.6 领先非思考版,但 30B-A3B 激活更少、成本更低
③ 本地部署建议与 verdict
能不能本地跑?能,条件宽松。 FP16 约 61GB(双 A100/单 H100);FP8 约 31GB(单 A100/H100);INT4 约 16-20GB(单卡 RTX 4090 24GB);4-bit MLX 约 16-20GB(Mac Studio/MBP)。社区 W4A16/W8A8/FP8 齐全,支持 vLLM/SGLang/Ollama/llama.cpp。SGLang 单卡 BF16 达 490 tok/s(官方)。
Verdict:recommend(推荐)。 Qwen3-30B-A3B 在”开源可本地 + 激活少成本低 + 中文强 + 思考模式上限高”四维独特优势。虽 2026 有 Qwen3.5/3.6/3.7 更强替代,但极低部署门槛 + Apache-2.0 使其在消费级本地(单卡 24GB 跑出有竞争力中文推理)仍不可替代。