本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉一致 recommend,2026-07-21),非实机测试。
① 公开证据综合
Microsoft 2025-02-01 发布,3.8B dense Transformer(非 MoE),200K 词汇表,128K 上下文,MIT 开源(官方技术报告 arxiv:2503.01743)。数学代码降维打击:GSM8K 88.6%(Phi-3.5-mini 76.9%、Llama-3.2-3B 75.6%、Qwen2.5-3B 80.6%)、MATH 64.0%(领先同尺寸 15-20 分)、HumanEval 74.4%(超多数 3B + 部分 8B,仅次 Qwen2.5-7B)。MMLU 67.3% 超 Llama-3.2-3B(61.8%)和 Qwen2.5-3B(65.0%)。训练数据 5T tokens,高质量教育 + 代码 + 合成数据 + 200K CoT 后训练。
短板:Multilingual MMLU 49.3%(中文/多语言弱于 Qwen2.5-3B 55.9%);GPQA 25.2% / Arena Hard 32.8%,研究生级推理落后 7B+。
② 与同类模型横评
- vs Qwen2.5-3B:Phi-4-mini 数学(88.6 vs 80.6)、代码(74.4 vs 72.0)、MMLU(67.3 vs 65.0)全面领先;Qwen2.5-3B 中文/多语言优
- vs Llama-3.2-3B:Phi-4-mini 各项碾压(GSM8K 88.6 vs 75.6、HumanEval 74.4 vs 62.8)
③ 本地部署建议与 verdict
能不能本地跑?能,门槛极低。 FP16 约 8.4GB(RTX 3060 12GB / 4060 Ti 16GB);INT8 约 4.2GB(6GB 显卡);INT4 约 2.1GB(4GB 显存甚至部分核显/笔记本 GPU 可跑)。HuggingFace 权重 + GGUF 量化 + Unsloth 优化齐全,支持 transformers / llama.cpp / Ollama / vLLM。
Verdict:recommend(推荐)。 Phi-4-mini 在 3.8B 实现”小钢炮”级数学代码能力,MIT 协议友好,INT4 低至 2GB VRAM,是低资源本地部署的最优选之一。唯一注意:中文原生任务建议同时评估 Qwen2.5-3B。