本文基于公开资料综述(智谱 / Kimi / DeepSeek 3 家 AI 采集交叉一致,2026-07-21),非实机测试。
① 公开证据综合
DeepSeek-V4-Flash 2026-04-24 随 V4 系列预览发布,MoE 架构,总参 284B / 激活仅 13B,1M 上下文,开源 Apache-2.0(官方技术报告 / HuggingFace)。
性价比是其核心卖点:API 输入 $0.14/M、输出 $0.28/M,全球主流模型最低档(比 GPT-5.5 Pro 便宜 100 倍以上)。能力达 V4-Pro 的 90-95%:MMLU 88.7%(Flash-Max)、SWE-bench Verified 79.0%、GPQA Diamond 88.1%、LiveCodeBench 91.6%(官方,待独立复现)。LMSys Elo 1432,开源仅次于 V4-Pro(官方 / LMSys)。
长上下文效率:1M token 下推理 FLOPs 降至前代 V3.2 的约 10%、KV 缓存约 7%(CSA+HCA 混合注意力 + DSA 稀疏注意力,官方 / 钛媒体解读)。
② 与同类模型横评
- vs DeepSeek-V4-Pro:Flash 能力达 Pro 的 90-95%,但 API 仅 Pro 的 1/3——性价比优先选 Flash
- vs GLM-5.2 / Kimi-K2.6:同为开源旗舰,Flash 激活参数最小(13B)、API 最便宜,但总参 284B 本地门槛仍高
- vs 闭源旗舰:Flash-Max MMLU-Pro 86.2% 接近 GPT-4o(86.4%),但落后 Claude Opus 4.6 Thinking 约 1-2 个百分点
③ 本地部署建议与 verdict
能不能本地跑?技术上可行,但门槛仍高。 284B 总权重须全部加载:INT4 量化约需 142GB 显存/内存,单卡 RTX 4090/5090 无法运行。可行方案:Mac M4 Ultra 192GB 统一内存(推理 5-15 tok/s)、4×RTX 4090(2-8 tok/s)、2×H100 NVLink FP8(40-80 tok/s),或纯 CPU 512GB DDR5(0.3-1 tok/s,社区部署指南)。
经济账:API 输出仅 ¥2/M token,个人/中小团队月均调用量须超约 100B token 才让本地比 API 划算——绝大多数用户 API 更实际。
Verdict:caution(有条件推荐)。 云端 API 强烈推荐(性价比全球顶尖、1M 上下文、Apache-2.0、国产芯片适配);个人本地部署不推荐(284B INT4 仍需 142GB+,投入产出比远低于 API);企业私有化仅在有数据主权强合规或国产算力环境下值得投入。实机验证建议:TTFT、不同 batch 的 tok/s、INT4/FP8 显存、1M 上下文实际任务准确率、国产芯片推理效率。