模型

Qwen2.5 Coder 32B Instruct

仅 API 开源 可商用
阿里通义千问 · Apache-2.0 · 32.5B · 上下文 128K
能做什么
编程开发知识问答逻辑推理
部署门槛
高端 24G+
≥ 24GB
上下文
128K
token 窗口
参数
32.5B

01基础参数

参数规模
32.5B
上下文窗口
128K
输入模态
text
可生成
text
模型系列
开源许可
Apache-2.0
主要语言
zh

02部署门槛详情

硬件等级 高端 24G+ · 最低显存 24GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
代码生成与补全任务、代码错误检测与修复、需要长上下文处理的代码项目、数学推理与通用能力并重的场景
✗ 不适用
多模态任务(如图像/视频理解)、超低显存(<16GB)设备上的 FP16 全精度部署、对延迟极度敏感的实时对话场景(本地大模型推理较慢)

05部署与限制

⚙ 本地部署建议
推荐使用 24GB 及以上显存的 GPU(如 RTX 3090/4090、A100)进行 FP16 部署。显存不足时可选用 GPTQ/AWQ/GGUF 量化版本(如 Q4_K_M),大幅降低显存占用。建议配合 vLLM 或 llama.cpp 等推理框架提升效率。
⚠ 已知限制
32B 参数量较大,FP16 全精度部署需约 60GB+ 显存,消费级显卡需依赖量化。官方宣称上下文 128K,但长文本下推理速度会明显下降,且生成质量可能受位置编码影响。模型为纯文本模型,不具备多模态能力。

06详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Qwen2.5-Coder-32B-Instruct 是阿里云通义千问团队于 2024 年 11 月 12 日开源的代码大模型旗舰版。模型基于 Dense Transformer 架构,采用 RoPE 位置编码、SwiGLU 激活函数和 RMSNorm 归一化,参数量 32.5B,支持 128K 上下文窗口。该模型在 EvalPlus、LiveCodeBench、BigCodeBench 等多个代码基准上取得了开源模型中的最佳成绩,代码能力被官方称为对标 GPT-4o。模型以 Apache-2.0 协议开源,允许自由商用。

该模型定位为“全球最强开源代码模型”,核心能力覆盖代码生成、代码推理、代码修复三大方向。训练数据总量达 5.5 万亿 Token,其中代码占比 70%、纯文本 20%、数学 10%,涵盖 92 种编程语言。除了代码能力,模型在数学推理和通用能力上也保持了较好水平。适用场景包括 AI 编程助手、自动化代码生成、代码审查、编程教育等。本地部署推荐使用 24GB 及以上显存的 GPU,并可通过量化(GPTQ/AWQ/GGUF)在较低显存设备上运行。

OpenRouter Provider 比价

共 1 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
Cloudflare0.661.0unknown32768

代表价(满血最低):Cloudflare 输入 0.66 / 输出 1.0 USD/1M。按 provider 选择可进一步降本。

07官方资源

08同类模型