模型

Ministral-3B-2512 评测:3B 多模态边缘,256K+视觉,但能力有限

查看模型详情 →
结论:谨慎
优点
  • ✓ Apache-2.0 开源可商用,权重开放
  • ✓ 3B 极小:BF16 约 16GB,量化可低于 8GB,消费级硬件友好
  • ✓ 256K 超大上下文 + 原生多模态(3.4B 语言 + 0.4B 视觉编码器)
  • ✓ 3B 级 benchmark 有竞争力:Instruct Arena Hard 0.305、WildBench 56.8、MATH 0.830(官方)
缺点
  • ✗ 3B 复杂推理/多模态精细任务弱(空间变换/表格识别错误率高)
  • ✗ Arena Hard 0.305 与同系列 8B(0.509)/14B(0.551)差距大
  • ✗ 中文无独立专项 benchmark,公开资料未明确
  • ✗ 3B 独立第三方深度评测少(社区多集中 8B)
适合场景:边缘/低资源本地离线部署(笔记本、树莓派类)、轻量实时应用(图像字幕、文本分类、实时翻译、短内容生成)、数据隐私严格的私有化场景(本地推理不联网)、可微调基础模型(Base)用于垂直领域定制

本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉,2026-07-21),非实机测试。

① 公开证据综合

Mistral AI 2025-12 发布 Ministral-3-3B-Instruct-2512(Ministral 3 系列最小成员),Dense 架构,约 3.4B 语言 + 0.4B 视觉编码器(多模态),Apache-2.0。3B 级有竞争力:Instruct Arena Hard 0.305、WildBench 56.8、MATH 0.830、MM-MTBench 7.83;Reasoning AIME25 0.721、GPQA 0.534(官方,独立验证少)。256K 上下文 + 多模态(文本+视觉)。

短板:3B 复杂推理/多模态精细弱(空间/表格错误率高);Arena Hard 0.305 远低于 8B/14B;中文无独立 benchmark;3B 独立评测少(社区多 8B)。

② 与同类模型横评

③ 本地部署建议与 verdict

能否本地跑?能。 BF16 约 16GB;量化(FP8/INT4)可低于 8GB。消费级 GPU(RTX 3060/4060 12GB+)或 Apple Silicon(M1/M2/M3,MLX 格式)。token/s、TTFT 待实机验证。

Verdict:caution(有条件推荐)。 Apache-2.0 + 明确本地规格 + 3B 可接受性能,填补”极小规模多模态可商用”空白。但 3B 能力边界明确(复杂推理/多模态精细弱 + 中文无证据 + 独立评测少)——边缘计算优秀选择,非精度优先场景最佳解。部署前据硬件选量化 + 目标任务(尤其中文/多模态复杂)小规模实测。