模型

Xiaomi: MiMo-V2.5-Pro

仅 API 开源 可商用
— · MIT · 1.02T / 激活 42B · 上下文 1024K
能做什么
编程开发Agent工作流长文档分析逻辑推理
部署门槛
多卡
≥ 510GB
上下文
1024K
token 窗口
参数
1.02T
MoE · 激活 42B

01基础参数

参数规模
1.02T
上下文窗口
1024K
输入模态
text
可生成
text
模型系列
开源许可
MIT
主要语言
multi

02MoE 架构说明

MoE 混合专家 总参 1.02T · 激活 42B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03部署门槛详情

硬件等级 多卡 · 最低显存 510GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
长周期Agent自主任务、复杂软件工程与编程开发、需要超长上下文的深度分析
✗ 不适用
纯文本外的多模态输入任务(不支持图像/音频输入)、低显存消费级显卡本地部署

06部署与限制

⚙ 本地部署建议
模型采用MoE架构,总参数量1.02T,激活参数42B。开源社区已提供GGUF量化版本(如IQ2_S、IQ1_M),支持llama.cpp、vLLM、SGLang等推理框架部署。官方推荐使用8卡NVIDIA B200(TP8、EP8)部署,显存需求极高,消费级显卡无法运行。建议通过官方API或云端服务调用,本地部署需配置多卡high-end集群。
⚠ 已知限制
不支持图像、音频等多模态输入,仅限文本模态。UltraSpeed加速模式为限时申请制,非永久开放。官方API定价中,超长上下文(256K-1M)价格翻倍;本地部署硬件门槛极高。

07详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Xiaomi MiMo-V2.5-Pro 是小米于 2026 年 4 月 23 日发布并开源的旗舰级 MoE 大模型,总参数量 1.02T,每 token 激活 42B 参数,采用 MIT 许可证。模型专为长周期 Agent 任务与复杂软件工程场景设计,支持 1024K(约 100 万 token)超长上下文,采用混合注意力架构(滑动窗口与全局注意力 6:1 交错)以降低 KV-cache 开销,并结合 3 层多 token 预测(MTP)设计提升推理效率。在 GDPVal-AA 基准测试中取得 1581 分,超越 Kimi K2.6 与 GLM 5.1 等竞品;在 ClawEval 评测中任务达标率(Pass³)达 64%,且 Token 消耗较同能力级别模型节省 40%-60%。该模型原生适配 MCP 工具调用协议,可稳定完成单次涉及近千轮工具调用的长程任务。

在实际案例中,MiMo-V2.5-Pro 用时 4.3 小时完成北京大学编译原理课程 SysY 编译器开发(本科生通常需数周),在隐藏测试集中取得 233/233 满分;另在 11.5 小时内自主构建了具备多轨道时间线的视频编辑器 Web 应用,生成代码 8192 行。2026 年 6 月,小米上线 UltraSpeed 加速模式,通过全链路工程优化在通用 GPU 上实现 1000 tokens/s 推理速度,成为全球首个达成此速度的万亿参数模型。模型提供思考与非思考两种推理模式,API 支持函数调用与提示词缓存。模型已开源并可在 Hugging Face 获取,但本地部署硬件门槛极高,推荐通过官方 API(platform.xiaomimimo.com)或阿里云百炼等云服务调用。

OpenRouter Provider 比价

共 5 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
Xiaomi0.4350.87fp81048576
AtlasCloud0.4350.87fp81024K
Novita0.5221.044unknown1048576
DigitalOcean0.63.0unknown87040
DeepInfra1.03.0fp81048576

代表价(满血最低):Novita 输入 0.522 / 输出 1.044 USD/1M。按 provider 选择可进一步降本。

08官方资源

09同类模型