模型

Qwen: Qwen3 32B

仅 API 开源 可商用
阿里通义千问 · Qwen3 · Apache-2.0 · 32.8B · 上下文 128K
能做什么
聊天问答编程开发逻辑推理Agent工作流数学推理
部署门槛
高端 24G+
≥ 24GB
API 价格
$0.104 /百万
输入/标准档 · 全站比价 →
上下文
128K
token 窗口
参数
32.8B
Qwen3

01基础参数

参数规模
32.8B
上下文窗口
128K
输入模态
text
可生成
text
模型系列
Qwen3
开源许可
Apache-2.0
主要语言
multi

02推荐部署方案

推荐 Q4_K_M ollama

03部署门槛详情

硬件等级 高端 24G+ · 最低显存 24GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
复杂逻辑推理和编程任务、多语言Agent工作流、企业级稳定部署
✗ 不适用
图像生成、视频生成、语音合成

06部署与限制

⚙ 本地部署建议
INT4量化版需约24GB显存,可运行于RTX 3090/4090等单卡。FP16精度约需64GB显存,推荐使用vLLM或SGLang框架部署,支持EAGLE3推测解码加速推理。
⚠ 已知限制
原生上下文为32K,使用YaRN可扩展至128K但可能影响短文本性能。不支持原生多模态输入(图像/视频)。

07详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Qwen3-32B 是阿里云通义千问团队于2025年4月发布的最新一代稠密大语言模型,参数量为328亿。该模型最大的创新在于支持混合推理模式,可在「思考模式」与「非思考模式」间无缝切换——前者适用于数学、编程和复杂逻辑推理等需深度思考的任务,后者则用于提供快速响应的通用对话。此外,Qwen3-32B采用分组查询注意力(GQA) 架构,原生上下文长度32K,通过YaRN技术可扩展至128K。

该模型在推理、指令遵循、Agent能力和多语言支持方面实现突破性进展,在数学、代码生成和常识逻辑推理上超越前代QwQ和Qwen2.5指令模型。它支持超过100种语言和方言,在Agent任务中能够精确集成外部工具,达到开源模型领先水平。模型采用Apache-2.0许可,支持商业应用。部署方面,INT4量化版约需24GB显存,可运行于RTX 3090/4090等消费级显卡,适合企业级稳定部署与复杂任务场景。

OpenRouter Provider 比价

共 6 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
DeepInfra0.080.28fp840960
Nebius0.10.3fp840960
AtlasCloud0.11.2fp840960
Alibaba0.1040.416unknown131072
SiliconFlow0.140.57fp8131072
Groq0.290.59unknown131072

代表价(满血最低):Alibaba 输入 0.104 / 输出 0.416 USD/1M。按 provider 选择可进一步降本。

08官方资源

09API 定价 全站比价 →

标准 输入 0.104 / 输出 0.416 USD/百万token
预算估算器
USD ≈ 可输入 百万 token

10同类模型