模型

Qwen2.5-3B-Instruct

API+本地 开源 可商用
阿里通义千问 · Qwen2.5 · Apache-2.0 · 3B · 上下文 128K
能做什么
聊天问答编程开发逻辑推理数学推理
部署门槛
CPU 可跑
≥ 4GB
上下文
128K
token 窗口
参数
3B
Qwen2.5

01基础参数

参数规模
3B
上下文窗口
128K
输入模态
text
可生成
text
模型系列
Qwen2.5
开源许可
Apache-2.0
主要语言
multi

02推荐部署方案

推荐 Q4_K_M ollama

03部署门槛详情

硬件等级 CPU 可跑 · 最低显存 4GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
移动端或边缘设备部署、资源受限环境下的对话与问答、基础代码生成与补全
✗ 不适用
需要极高推理精度的专业任务、复杂长文本生成与深度分析

06部署与限制

⚙ 本地部署建议
推荐使用 4-bit 量化(如 GGUF 格式)部署,量化后模型大小约 1.9GB,可在 4GB 显存或纯 CPU 环境运行。可使用 llama.cpp、Ollama 等工具加载。
⚠ 已知限制
上下文窗口虽为 128K,但训练时基础上下文为 32K token,生成长度上限为 8K token。参数量较小,复杂推理和事实性知识准确率有上限。

07详细介绍

Qwen2.5-3B-Instruct 是阿里云通义千问团队于 2024 年 9 月推出的轻量级开源语言模型,参数量为 30 亿,采用 Apache-2.0 许可。它是 Qwen2.5 系列中专为资源受限环境(如移动端、边缘设备)设计的模型,在编码、数学和指令遵循能力上相比前代 Qwen2 均有显著提升。模型支持 29 种以上语言,包括中文、英文等,上下文长度支持 128K 个 token,并可生成长达 8K 的文本内容。

该模型非常适合在显存或算力有限的环境中进行本地部署。通过 4-bit 量化(如 GGUF 格式),模型大小可压缩至约 1.9GB,甚至可在 4GB 共享显存的集成显卡上流畅运行。它适用于基础聊天问答、代码生成与补全、轻量级推理等任务。由于其参数量较小,在需要极高推理精度或处理超长、复杂文档的专业场景下,其表现可能会受到一定限制。

08官方资源

09真实评测

Qwen2.5-3B 评测:中文数学优,但协议限制+知识/代码弱

10同类模型