模型

Cohere: Command A

仅 API 开源
— · CC-BY-NC-4.0 · 111B · 上下文 256K
能做什么
逻辑推理长文档分析内容创作Agent工作流编程开发
部署门槛
多卡
≥ 80GB
上下文
256K
token 窗口
参数
111B

01基础参数

参数规模
111B
上下文窗口
256K
输入模态
text
可生成
text
模型系列
开源许可
CC-BY-NC-4.0
主要语言
multi

02部署门槛详情

硬件等级 多卡 · 最低显存 80GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
需要 256K 长上下文的 RAG 系统、多步骤工具调用与智能体编排、对数据主权有要求的本地私有化部署
✗ 不适用
纯 CPU 或单卡消费级 GPU 本地运行、高并发低成本文本生成场景、需要图像/音频多模态输入的应用

05部署与限制

⚙ 本地部署建议
本地部署需多卡专业级 GPU。FP16 全精度约需 222GB 显存,推荐 2×H100 80GB 或 4×RTX 3090 24GB 通过模型并行运行;也可使用 4-bit/8-bit 量化将显存降至约 55–111GB。模型权重需通过 Hugging Face 申请许可后下载,首次加载时间较长。
⚠ 已知限制
采用 CC-BY-NC-4.0 非商业许可,商业用途需单独联系 Cohere 获取授权;不支持图像/音频等多模态输入;在数学推理等特定任务上存在已知缺陷(如质数相关查询可能出错或陷入循环);本地部署时未经优化可能出现性能瓶颈,建议使用官方推荐的 vLLM 等推理框架。

06详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Cohere Command A(c4ai-command-a-03-2025) 是 Cohere 于 2025 年 3 月发布的一款 111B 参数密集架构(dense)大语言模型,定位为面向企业需求的高性能旗舰开源权重模型。其核心优势在于 256K 的超大上下文窗口,使其能够在单轮推理中处理整本图书、大型代码库或完整法律合同,无需分块切分。模型针对工具调用(tool use)、检索增强生成(RAG)和多语言任务进行了深度优化,支持 23 种语言,在企业级知识管理、智能体工作流和多语言内容生成等场景中表现突出。 该模型采用 decoder-only Transformer 架构,结合分组查询注意力(GQA)、滑动窗口与全局注意力交替(3:1 比例)以及 RoPE/NoPE 混合位置编码等设计,以提升长上下文推理效率和 serving 吞吐量。权重以 CC-BY-NC-4.0 许可在 Hugging Face 开放下载,允许非商业研究与内部企业使用,但商业部署需单独向 Cohere 申请授权。本地部署对硬件要求较高,FP16 全精度需约 222GB 显存,推荐通过 4-bit/8-bit 量化或多卡张量并行降低门槛。

OpenRouter Provider 比价

共 1 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
Cohere2.510.0unknown256K

代表价(满血最低):Cohere 输入 2.5 / 输出 10.0 USD/1M。按 provider 选择可进一步降本。

07官方资源

08同类模型