模型

Arcee AI: Trinity Mini

仅本地 开源 可商用
— · Apache-2.0 · 26B / 激活 3B · 上下文 131K
能做什么
Agent工作流聊天问答长文档分析逻辑推理
部署门槛
中端 16-24G
≥ 16GB
上下文
131K
token 窗口
参数
26B
MoE · 激活 3B

01基础参数

参数规模
26B
上下文窗口
131K
输入模态
text
可生成
text
模型系列
开源许可
Apache-2.0
主要语言
en

02MoE 架构说明

MoE 混合专家 总参 26B · 激活 3B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03部署门槛详情

硬件等级 中端 16-24G · 最低显存 16GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
高性价比的推理任务场景、函数调用与结构化输出应用、多步Agent工作流、长文档处理与RAG
✗ 不适用
要求顶级大模型深度的复杂推理、有严格企业级SLA要求的场景、对延迟有极端苛刻要求的业务

06部署与限制

⚙ 本地部署建议
支持通过llama.cpp、vLLM等框架本地部署,推荐使用GGUF量化格式以节省显存。建议配合vLLM 0.11.1+或llama.cpp b7061+版本使用,以获得最佳推理性能。
⚠ 已知限制
作为中尺寸MoE模型,其3B激活参数在极限深度推理任务上可能不及全参数密集型大模型。未提供企业级固定支持合同。

07详细介绍

Trinity Mini 是 Arcee AI 于 2025 年 12 月发布的一款中等规模稀疏混合专家(MoE)模型。模型总参数量为 260 亿,但每次前向传播仅激活 30 亿参数,这种设计使其在保持较低推理成本的同时,具备了处理复杂任务的能力。

该模型拥有 128K 的长上下文窗口,非常擅长处理多轮交互、长文档分析以及可靠的工具/函数调用。其核心优势在于高效的推理性能与对 Agent 工作流的原生支持,使其成为企业级高性价比部署的理想选择。模型基于 Apache-2.0 许可证开源,并已针对 vLLM 和 llama.cpp 等主流推理框架进行了适配。

08官方资源

09同类模型