模型

Mistral: Mistral Small 3.1 24B

仅 API 开源 可商用
— · Apache-2.0 · 24B · 上下文 128K
能做什么
聊天问答多模态理解编程开发Agent工作流逻辑推理
部署门槛
中端 16-24G
≥ 18GB(Q4_K_M 量化)
上下文
128K
token 窗口
参数
24B

01基础参数

参数规模
24B
上下文窗口
128K
输入模态
image / text
可生成
text
模型系列
开源许可
Apache-2.0
主要语言
multi

02部署门槛详情

硬件等级 中端 16-24G · 最低显存 18GB(Q4_K_M 量化)

03Benchmark 评测

待补充

04适用场景

✓ 适用
需要本地部署的多模态 AI 应用、对延迟敏感的消费级/企业级助手、基于工具调用的自动化工作流
✗ 不适用
超大规模并发 API 服务(需多卡或云端)、对视频理解有原生需求的场景

05部署与限制

⚙ 本地部署建议
推荐使用 Q4_K_M 量化,单卡 18–20GB VRAM 即可运行,适配 RTX 4090 / 3090 等消费级显卡;BF16/FP16 全精度需约 55GB 显存,建议双卡或 H100。CPU 部署需 32GB+ 内存,Mac 用户可用 MLX 框架。生产环境建议 vLLM serving,视觉任务建议 tensor-parallel-size=2。
⚠ 已知限制
视觉能力为首次引入,复杂图像推理仍弱于更大规模模型;官方未提供 transformers 原生支持,需通过 vLLM 或 Ollama 部署;长上下文下显存占用显著增加,实际安全可用长度受硬件限制。

06详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Mistral Small 3.1 24B 是 Mistral AI 于 2025 年 3 月发布的旗舰级「小模型」,在 24B 密集参数规模下实现了多模态能力与长上下文的兼得。它采用宽浅 Transformer 设计,配备 128K 上下文窗口与原生视觉编码器,支持文本、图像联合推理,并在函数调用与多语言支持上达到同类最佳水平。得益于 Apache 2.0 协议,该模型既可免费商用,也支持社区微调与衍生开发,是单卡消费级 GPU 上能跑的最强开源多模态模型之一。 该模型定位「高效全能」,在代码生成、文档分析、视觉问答、智能体编排等场景中表现均衡,推理速度可达约 150 tokens/秒(RTX 4090 量化版)。对于希望在本地或私有云部署多模态 AI、同时避免闭源 API 依赖的企业和开发者而言,它是当前性价比极高的选择。

OpenRouter Provider 比价

共 1 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
Cloudflare0.3510.555unknown128K

代表价(满血最低):Cloudflare 输入 0.351 / 输出 0.555 USD/1M。按 provider 选择可进一步降本。

07官方资源

08同类模型