本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-21),非实机测试。
① 公开证据综合
阿里云 Qwen 团队 2024-09-19 发布,3.09B(非嵌入 2.77B),36 层 Transformer + GQA,32K 上下文(官方技术博客 / DataLearnerAI)。中文+数学 3B 级领先:GSM8K 79.1%、MATH 65.0%、BBH 56.3%。指令跟随/长文本生成/结构化输出(JSON)/系统提示鲁棒性较前代提升。多语言 29 种。
关键限制:MMLU 65.6% / MMLU-Pro 34.6%(低于 7B 74.2/45.8);HumanEval 42.1%(7B 84.1);上下文仅 32K(7B 128K)。协议陷阱:Qwen2.5 系列 0.5B/1.5B/7B/14B/32B 均 Apache-2.0,但 3B 与 72B 是 Qwen Research License(商用需审)——本地部署前必须法务评估。
② 与同类模型横评
- vs Llama-3.2-3B:Qwen MMLU(+10.85)/ GSM8K(+45.1)/ HumanEval(+14.1)全面领先 + 中文优;Llama 上下文 128K 更长
- vs Qwen2.5-7B:7B 在 MMLU/代码/长上下文碾压 + Apache-2.0;硬件允许选 7B 更优
- vs Gemma-2-9B:Gemma MMLU(71.3)高但 GSM8K(70.7)低、9B 端侧压力大
③ 本地部署建议与 verdict
能不能本地跑?能。 FP16 约 6-7GB(推算);INT4 约 2GB(4GB 显存或纯 CPU);INT8 约 3-4GB。流畅需 6GB 显存(GTX 1060 6GB / RTX 3050)或 Apple Silicon 8GB 统一内存。Ollama/LMStudio/llama.cpp + 社区 GGUF 齐全。
Verdict:caution(有条件推荐)。 3B 在中文+数学领先同级 Llama-3.2-3B,但通用知识/代码短板明显 + 32K 上下文限制 RAG。关键是 Qwen Research License(非 Apache,商用需审)+ “比上不足比下尴尬”(硬件能容纳选 7B Apache 更优;极度受限选 0.5B/1.5B Apache 更自由)。适合中文轻量场景 + 数学需求,但非无脑首选。