模型

Qwen: Qwen3 8B

仅 API 开源 可商用
阿里通义千问 · Apache-2.0 · 8.2B · 上下文 128K
能做什么
编程开发内容创作
部署门槛
消费级 8-12G
≥ 6GB
上下文
128K
token 窗口
参数
8.2B

01基础参数

参数规模
8.2B
上下文窗口
128K
输入模态
text
可生成
text
模型系列
开源许可
Apache-2.0
主要语言
zh

02部署门槛详情

硬件等级 消费级 8-12G · 最低显存 6GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
资源有限但需要高性能的开源LLM部署、需要私有化部署的对话与推理应用、多语言场景的AI产品原型验证
✗ 不适用
超长文档(>128K)的精细处理、需要千亿级参数模型的极致复杂任务

05部署与限制

⚙ 本地部署建议
FP16精度推理约需16GB显存,推荐使用INT4/INT8量化(如GGUF Q4_K_M)可将显存降至6-8GB,消费级显卡(如RTX 3060/4090)即可流畅运行。建议使用llama.cpp或vLLM框架进行部署优化。
⚠ 已知限制
原生上下文长度为32,768 tokens,通过YaRN可扩展至131,072 tokens;FP16推理显存需求较高(约16GB),需量化以适配中低端硬件;部分早期Transformers版本(<4.51.0)不兼容。

06详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Qwen3-8B是阿里巴巴通义千问团队于2025年4月29日发布的新一代开源大语言模型。作为Qwen3系列中的密集(Dense)模型版本,它拥有82亿参数,采用36层Transformer架构与分组查询注意力(GQA)机制,原生支持32,768上下文长度并可扩展至128K。模型基于Apache 2.0协议开源,支持免费商用。

该模型的核心亮点在于其独特的双模式推理能力——用户可在“思考模式”(适合复杂逻辑推理、数学、代码生成)与“非思考模式”(适合高效通用对话)间无缝切换。此外,Qwen3-8B在Agent能力上表现突出,能精准调用外部工具完成复杂任务,并支持100+种语言的指令遵循与翻译。其性能可与Qwen2.5系列14B模型相媲美,非常适合作为本地AI助手、私有化RAG系统及多语言应用的基座模型,在消费级硬件上即可实现高效部署。

OpenRouter Provider 比价

共 2 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
AtlasCloud0.050.4fp840960
Alibaba0.1170.455unknown131072

代表价(满血最低):Alibaba 输入 0.117 / 输出 0.455 USD/1M。按 provider 选择可进一步降本。

07官方资源

08同类模型