模型

Qwen2.5-7B-Instruct

API+本地 开源 可商用
阿里通义千问 · Qwen2.5 · Apache-2.0 · 7.61B · 上下文 128K
能做什么
聊天问答编程开发逻辑推理长文档分析数学推理
部署门槛
消费级 8-12G
≥ 4.6GB
API 价格
$0.04 /百万
输入/标准档 · 全站比价 →
上下文
128K
token 窗口
参数
7.61B
Qwen2.5

01基础参数

参数规模
7.61B
上下文窗口
128K
输入模态
text / code / vision
可生成
text
模型系列
Qwen2.5
开源许可
Apache-2.0
主要语言
multi

02推荐部署方案

推荐 Q4_K_M ollama

03部署门槛详情

硬件等级 消费级 8-12G · 最低显存 4.6GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
需要平衡性能与硬件成本的对话系统、轻量级编程辅助、多语言长文本分析
✗ 不适用
图像生成、视频生成、语音合成

06部署与限制

⚙ 本地部署建议
推荐使用Q4_K_M量化部署,约需4.6-4.8GB显存,单卡低显存环境可运行。BF16精度约需14GB显存。适合消费级显卡或边缘设备部署。
⚠ 已知限制
128K长上下文下若使用完整精度部署,显存需求会显著增加。输出生成长度上限为8192 tokens。

07详细介绍

Qwen2.5-7B-Instruct 是阿里云通义千问团队于2024年10月发布的指令微调大语言模型,参数量为76.1亿,拥有128K上下文长度,支持生成最多8192个tokens。模型采用因果语言模型架构,结合RoPE位置编码、SwiGLU前馈网络和RMSNorm,并支持29种以上语言,包括中文、英语、法语、西班牙语等。

该模型在编码、数学推理、指令遵循和长文本生成方面相比前代有显著提升,同时对结构化数据(如表格)和结构化输出(尤其是JSON格式)的理解与生成能力也得到增强。适合用于多语言对话系统、轻量级编程辅助、长文档分析以及需要RAG(检索增强生成) 的场景。模型采用Apache-2.0许可,支持商业应用。得益于其规模适中,通过量化部署(如Q4_K_M)最低只需约4.6GB显存,可在单张消费级显卡甚至部分边缘设备上流畅运行。

OpenRouter Provider 比价

共 2 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
Phala0.040.1unknown32768
Together0.30.3fp832768

代表价(满血最低):Phala 输入 0.04 / 输出 0.1 USD/1M。按 provider 选择可进一步降本。

08官方资源

09API 定价 全站比价 →

缓存命中 输入 0.1 / 输出 2 CNY/百万token
标准 输入 0.04 / 输出 0.1 USD/百万token
标准 输入 0.5 / 输出 2 CNY/百万token · 新用户赠送
预算估算器
USD ≈ 可输入 百万 token

10部署教程

Windows 用 Ollama 一键部署 Qwen2.5-7B

11真实评测

Qwen2.5-7B-Instruct 评测:中文本地主力,7B 数学代码领先

12同类模型