模型

DeepSeek-R1

API+本地 开源 可商用
DeepSeek · DeepSeek-R1 · MIT · 671B / 激活 37B · 上下文 160K
能做什么
聊天问答编程开发逻辑推理数学推理长文档分析
部署门槛
多卡
≥ 满血需8卡+;蒸馏版8B≈8GB
API 价格
$1.485 /百万
输入/标准档 · 全站比价 →
上下文
160K
token 窗口
参数
671B
MoE · 激活 37B

01基础参数

参数规模
671B
上下文窗口
160K
输入模态
text / reasoning
可生成
text
模型系列
DeepSeek-R1
开源许可
MIT
主要语言
zh

02MoE 架构说明

MoE 混合专家 总参 671B · 激活 37B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03推荐部署方案

推荐 Q4_K_M(蒸馏版)/1.58bit(满血) ollama

04部署门槛详情

硬件等级 多卡 · 最低显存 满血需8卡+;蒸馏版8B≈8GB

05Benchmark 评测

待补充

06适用场景

✓ 适用
复杂数学推理、代码生成与调试、长文本逻辑分析、作为教师模型进行蒸馏
✗ 不适用
简单问答(可能过度思考)、实时性要求极高的场景、非推理类文本摘要(可能有幻觉风险)

07部署与限制

⚙ 本地部署建议
DeepSeek-R1完整版为671B MoE模型,需多卡部署(如多张A100/H800)。官方提供FP8/BF16推理支持,社区已适配vLLM、SGLang等框架。个人单卡设备无法运行满血版本,可考虑使用官方蒸馏的小模型(如1.5B/7B/32B/70B版本)进行本地实验。
⚠ 已知限制
完整版硬件门槛极高,普通设备无法本地运行。模型会生成详细推理过程,导致输出token数较多、响应时间较长,不适合对延迟敏感的场景。简单任务上可能过度思考,影响准确率。部分蒸馏小模型表现仍有提升空间。

08详细介绍

DeepSeek-R1 是深度求索公司于2025年1月发布的首代开源推理大模型,专注于增强复杂问题的逻辑推理能力。模型采用MoE架构,总参数量671B,每次激活37B参数,支持128K上下文长度。其核心突破在于后训练阶段大规模应用强化学习技术(基于DeepSeek-V3-Base),并在引入少量冷启动数据后,解决了早期R1-Zero版本可读性差、语言混杂等问题,最终在数学、代码和自然语言推理等任务上达到比肩OpenAI o1正式版的水平。

该模型核心能力集中于需要深度思考的领域,如高难度数学题(AIME 2024评测)和代码竞赛任务(Codeforces评分),适合作为复杂问题的解决引擎。同时,官方利用DeepSeek-R1的输出数据蒸馏了多个小模型(基于Qwen和Llama系列,从1.5B到70B),其中32B和70B版本在多项基准上超越OpenAI o1-mini,为资源有限的环境提供了选择。模型采用MIT许可协议,完全开源且支持商业用途,官方也明确允许利用其输出进行模型蒸馏。需注意,其完整的671B版本对部署硬件要求极高,推荐使用多卡并行方案,或根据实际需求选用其蒸馏小模型。

OpenRouter Provider 比价

共 2 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
Novita0.72.5fp864K
Azure1.4855.94unknown163840

代表价(满血最低):Azure 输入 1.485 / 输出 5.94 USD/1M。按 provider 选择可进一步降本。

09官方资源

10API 定价 全站比价 →

标准 输入 1.485 / 输出 5.94 USD/百万token
标准 输入 4 / 输出 16 CNY/百万token
预算估算器
USD ≈ 可输入 百万 token

11同类模型