模型

Qwen2.5-3B 评测:中文数学优,但协议限制+知识/代码弱

查看模型详情 →
结论:谨慎
优点
  • ✓ 中文+数学 3B 级领先:GSM8K 79.1%、MATH 65.0%(DataLearnerAI)
  • ✓ 端侧友好:3.09B、32K 上下文,支持 Ollama/vLLM/Transformers + 工具调用
  • ✓ 生态成熟:HuggingFace/ModelScope/Ollama 官方 + GGUF/GPTQ/AWQ 量化齐全
  • ✓ 多语言:覆盖中英法西德日韩等 29 种
缺点
  • ✗ 协议非 Apache-2.0:采用 Qwen Research License,商用需额外审阅(系列内 0.5B/1.5B/7B 才是 Apache)
  • ✗ 通用知识弱:MMLU 65.6%、MMLU-Pro 34.6%,明显低于 7B(74.2%/45.8%)
  • ✗ 长上下文仅 32K(7B 是 128K),RAG/长文档受限
  • ✗ 代码中等:HumanEval 42.1%(7B 是 84.1%),复杂编程吃力
适合场景:中文端侧 AI 助手(手机/平板/嵌入式本地)、轻量数学计算与结构化数据提取(JSON/表格)、多语言轻量翻译与基础文本生成、低资源 Ollama/LMStudio 体验与教学演示

本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-21),非实机测试。

① 公开证据综合

阿里云 Qwen 团队 2024-09-19 发布,3.09B(非嵌入 2.77B),36 层 Transformer + GQA,32K 上下文(官方技术博客 / DataLearnerAI)。中文+数学 3B 级领先:GSM8K 79.1%、MATH 65.0%、BBH 56.3%。指令跟随/长文本生成/结构化输出(JSON)/系统提示鲁棒性较前代提升。多语言 29 种。

关键限制:MMLU 65.6% / MMLU-Pro 34.6%(低于 7B 74.2/45.8);HumanEval 42.1%(7B 84.1);上下文仅 32K(7B 128K)。协议陷阱:Qwen2.5 系列 0.5B/1.5B/7B/14B/32B 均 Apache-2.0,但 3B 与 72B 是 Qwen Research License(商用需审)——本地部署前必须法务评估。

② 与同类模型横评

③ 本地部署建议与 verdict

能不能本地跑?能。 FP16 约 6-7GB(推算);INT4 约 2GB(4GB 显存或纯 CPU);INT8 约 3-4GB。流畅需 6GB 显存(GTX 1060 6GB / RTX 3050)或 Apple Silicon 8GB 统一内存。Ollama/LMStudio/llama.cpp + 社区 GGUF 齐全。

Verdict:caution(有条件推荐)。 3B 在中文+数学领先同级 Llama-3.2-3B,但通用知识/代码短板明显 + 32K 上下文限制 RAG。关键是 Qwen Research License(非 Apache,商用需审)+ “比上不足比下尴尬”(硬件能容纳选 7B Apache 更优;极度受限选 0.5B/1.5B Apache 更自由)。适合中文轻量场景 + 数学需求,但非无脑首选。