模型

Qwen: Qwen3.6 35B A3B

仅 API 开源 可商用
阿里通义千问 · Apache-2.0 · 35B / 激活 3B · 上下文 256K
能做什么
编程开发Agent工作流聊天问答长文档分析知识问答自主编程
部署门槛
高端 24G+
≥ 24GB
上下文
256K
token 窗口
参数
35B
MoE · 激活 3B

01基础参数

参数规模
35B
上下文窗口
256K
输入模态
image / text / video
可生成
text
模型系列
开源许可
Apache-2.0
主要语言
multi

02MoE 架构说明

MoE 混合专家 总参 35B · 激活 3B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03部署门槛详情

硬件等级 高端 24G+ · 最低显存 24GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
本地 Agent 编码助手与代码审查、长上下文知识问答与文档分析、需要工具调用的自动化工作流
✗ 不适用
对实时性要求极高的低延迟场景、纯 CPU 或无独立显存的轻量设备、需要原生视频生成或语音合成的任务

06部署与限制

⚙ 本地部署建议
Q4_K_M 量化约需 21GB 显存,推荐 RTX 4090(24GB)或 A6000(48GB)起步;BF16 全精度需约 70GB 显存,建议 A100/H100 或多卡部署。也可通过 KTransformers 将专家层 offload 到内存,在 12GB 显存 + 32GB 内存的台式机上运行。支持 vLLM、SGLang、llama.cpp 等主流推理框架。
⚠ 已知限制
MoE 架构的稀疏性在某些需要全参数参与的复杂推理任务上略逊于同族 Dense 27B;视觉能力依赖额外的 multimodal projector,纯文本推理时无需加载;超长上下文(>128K)对显存压力较大,需适当裁剪或分层加载。

07详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Qwen3.6-35B-A3B 是阿里巴巴通义千问团队于 2026 年 4 月 16 日发布的开源稀疏 MoE 多模态大模型,采用 Apache 2.0 协议,可自由商用与本地部署。该模型总参数量 35B,但通过 Mixture-of-Experts 架构每 token 仅激活约 3B 参数,实现了「大模型容量、小模型推理成本」的极致平衡。其原生上下文窗口达 262K tokens,并支持 Thinking Preservation 机制,可在多轮 Agent 工作流中保留历史推理痕迹,显著提升长程任务稳定性。 该模型定位为高效的 Agentic Coding 与长上下文推理引擎,在代码生成、工具调用、长文档分析等场景表现突出。得益于 12:1 的稀疏比,它能在单张 RTX 4090 上以较高吞吐运行,是 2026 年开源社区中性价比极高的本地部署选择。同时支持文本、图像、视频多模态输入,输出为纯文本,适合构建私有化知识助手与自动化开发管线。

OpenRouter Provider 比价

共 5 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
AkashML0.141.0fp8262144
Parasail0.151.0fp8262144
AtlasCloud0.16120.96525fp8262144
SiliconFlow0.21.6fp8262144
WandB0.251.25fp8262144

代表价(满血最低):AkashML 输入 0.14 / 输出 1.0 USD/1M(量化版,另有满血版见上表)。按 provider 选择可进一步降本。

08官方资源

09同类模型