模型

DeepSeek: DeepSeek V4 Flash

仅 API 开源 可商用
DeepSeek · MIT · 284B / 激活 13B · 上下文 1024K
能做什么
编程开发聊天问答智能客服长文档分析Agent工作流
部署门槛
多卡
≥ 284GB
上下文
1024K
token 窗口
参数
284B
MoE · 激活 13B

01基础参数

参数规模
284B
上下文窗口
1024K
输入模态
text
可生成
text
模型系列
开源许可
MIT
主要语言
multi

02MoE 架构说明

MoE 混合专家 总参 284B · 激活 13B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03部署门槛详情

硬件等级 多卡 · 最低显存 284GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
高性价比日常对话与问答、轻量级编程辅助与代码补全、长文档摘要与RAG检索、简单Agent任务与函数调用
✗ 不适用
最复杂的Agent工作流、对纯知识类任务准确性要求极高的场景

06部署与限制

⚙ 本地部署建议
原生FP4+FP8精度模型需NVIDIA B200等支持FP4的硬件,磁盘占约146GB;社区已发布GGUF量化版本,Q4_K_M量化约需161GB显存,可在配备192GB以上统一内存的Mac上运行或使用多卡集群。生产部署推荐使用官方API以获得最佳性价比。
⚠ 已知限制
受限于13B激活参数规模,在纯知识类任务和最复杂的Agent工作流上表现略逊于V4-Pro版本。原生FP4权重需要特定硬件支持,但社区量化方案降低了部署门槛。

07详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

DeepSeek-V4-Flash 是深度求索于2026年4月24日发布的V4系列高性价比MoE大语言模型,与旗舰版Pro同期开源。模型总参数量为2840亿,每次推理仅激活130亿参数,原生支持100万token的超长上下文,并采用混合注意力机制(CSA+HCA)显著降低长文本推理的计算与显存开销。

该模型在保持高效推理的同时,通过可调节的推理强度模式(Non-Think、Think High、Think Max)灵活应对不同复杂度任务。在最大推理力度模式下,其编程与推理能力可接近V4-Pro版本的水平。模型采用MIT协议开源,原生提供FP4+FP8混合精度的权重文件,社区也已推出GGUF等量化版本以适配更广泛的本地部署硬件。DeepSeek-V4-Flash特别适合对成本敏感、需要快速响应的高频聊天、轻量编程辅助、长文档摘要及简单Agent任务调用等场景。

OpenRouter Provider 比价

共 18 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
Wafer0.090.18fp41M
GMICloud0.0980.196fp81048575
Baidu0.09830.1966fp81048576
DeepInfra0.10.2fp41048576
DigitalOcean0.1120.224unknown65536
SiliconFlow0.130.28fp81048576
StreamLake0.131880.26376fp81024K
Alibaba0.1340.268unknown1M
Venice0.1380.275unknown1M
Morph0.1390.278unknown1048576
Parasail0.140.28fp81048576
AtlasCloud0.140.28fp81048576
AkashML0.140.28fp81048576
Fireworks0.140.28unknown1048576
Novita0.140.28fp81048576
WandB0.140.28fp81048576
Cloudflare0.140.28unknown384K
DeepSeek0.140.28unknown1048576

代表价(满血最低):DigitalOcean 输入 0.112 / 输出 0.224 USD/1M。按 provider 选择可进一步降本。

08官方资源

09真实评测

DeepSeek-V4-Flash 评测:开源性价比王,但本地仍需 142GB

10同类模型