模型

Phi-4-mini 评测:3.8B 小钢炮,数学代码降维打击

查看模型详情 →
结论:推荐
优点
  • ✓ MIT 开源可商用,权重完全开放(HuggingFace)
  • ✓ 3.8B 数学代码突出:GSM8K 88.6%、MATH 64.0%、HumanEval 74.4%,显著领先同尺寸(官方技术报告 Table 7/8)
  • ✓ 128K 超长上下文,支持长文档与多轮对话
  • ✓ 本地门槛极低:INT4 仅约 2.1GB VRAM,FP16 约 8.4GB
  • ✓ 函数调用 + 指令遵循较 Phi-3.5-mini 显著提升
缺点
  • ✗ 中文弱:Multilingual MMLU 49.3%,低于 Qwen2.5-3B 55.9%
  • ✗ 知识截止 2024-06,无实时联网(需配 RAG)
  • ✗ GPQA 25.2%、MMLU-Pro 52.8%,研究生级科学推理落后 7B+ 模型
  • ✗ 非 MoE 架构,3.8B 全激活,无稀疏加速红利
适合场景:8GB 以下显存的数学推理与代码辅助、128K 长文档摘要与 RAG、边缘设备 / 笔记本离线 AI 助手与工具调用、教育场景数学辅导与编程入门

本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉一致 recommend,2026-07-21),非实机测试。

① 公开证据综合

Microsoft 2025-02-01 发布,3.8B dense Transformer(非 MoE),200K 词汇表,128K 上下文,MIT 开源(官方技术报告 arxiv:2503.01743)。数学代码降维打击:GSM8K 88.6%(Phi-3.5-mini 76.9%、Llama-3.2-3B 75.6%、Qwen2.5-3B 80.6%)、MATH 64.0%(领先同尺寸 15-20 分)、HumanEval 74.4%(超多数 3B + 部分 8B,仅次 Qwen2.5-7B)。MMLU 67.3% 超 Llama-3.2-3B(61.8%)和 Qwen2.5-3B(65.0%)。训练数据 5T tokens,高质量教育 + 代码 + 合成数据 + 200K CoT 后训练。

短板:Multilingual MMLU 49.3%(中文/多语言弱于 Qwen2.5-3B 55.9%);GPQA 25.2% / Arena Hard 32.8%,研究生级推理落后 7B+。

② 与同类模型横评

③ 本地部署建议与 verdict

能不能本地跑?能,门槛极低。 FP16 约 8.4GB(RTX 3060 12GB / 4060 Ti 16GB);INT8 约 4.2GB(6GB 显卡);INT4 约 2.1GB(4GB 显存甚至部分核显/笔记本 GPU 可跑)。HuggingFace 权重 + GGUF 量化 + Unsloth 优化齐全,支持 transformers / llama.cpp / Ollama / vLLM。

Verdict:recommend(推荐)。 Phi-4-mini 在 3.8B 实现”小钢炮”级数学代码能力,MIT 协议友好,INT4 低至 2GB VRAM,是低资源本地部署的最优选之一。唯一注意:中文原生任务建议同时评估 Qwen2.5-3B。