本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-21),非实机测试。
① 公开证据综合
Mistral AI 2025-12 发布 Ministral-3-3B-Instruct-2512(Ministral 3 系列最小成员),Dense 架构,约 3.4B 语言 + 0.4B 视觉编码器(多模态),Apache-2.0。3B 级有竞争力:Instruct Arena Hard 0.305、WildBench 56.8、MATH 0.830、MM-MTBench 7.83;Reasoning AIME25 0.721、GPQA 0.534(官方,独立验证少)。256K 上下文 + 多模态(文本+视觉)。
短板:3B 复杂推理/多模态精细弱(空间/表格错误率高);Arena Hard 0.305 远低于 8B/14B;中文无独立 benchmark;3B 独立评测少(社区多 8B)。
② 与同类模型横评
- vs 同系列 8B/14B:3B benchmark 差距明显(Arena Hard 0.305 vs 8B 0.509 / 14B 0.551)
- vs Qwen3-VL-4B-Thinking:互有胜负;落后 Qwen3-VL-8B 和 Gemma3-12B
- 社区实测 Ministral 8B 多模态(OCR/表格/空间)不如 Qwen3-VL-8B,3B 推断更弱
③ 本地部署建议与 verdict
能否本地跑?能。 BF16 约 16GB;量化(FP8/INT4)可低于 8GB。消费级 GPU(RTX 3060/4060 12GB+)或 Apple Silicon(M1/M2/M3,MLX 格式)。token/s、TTFT 待实机验证。
Verdict:caution(有条件推荐)。 Apache-2.0 + 明确本地规格 + 3B 可接受性能,填补”极小规模多模态可商用”空白。但 3B 能力边界明确(复杂推理/多模态精细弱 + 中文无证据 + 独立评测少)——边缘计算优秀选择,非精度优先场景最佳解。部署前据硬件选量化 + 目标任务(尤其中文/多模态复杂)小规模实测。