模型

Mistral: Voxtral Small 24B 2507

仅本地 开源 可商用
— · Apache-2.0 · 24B · 上下文 32K
能做什么
语音合成智能客服知识问答内容创作
部署门槛
中端 16-24G
≥ 24GB
上下文
32K
token 窗口
参数
24B

01基础参数

参数规模
24B
上下文窗口
32K
输入模态
text / audio
可生成
text
模型系列
开源许可
Apache-2.0
主要语言
multi

02部署门槛详情

硬件等级 中端 16-24G · 最低显存 24GB

03Benchmark 评测

待补充

04适用场景

✓ 适用
高精度多语言语音转录与翻译、对音频内容的直接问答与结构化摘要、通过语音驱动的 Agent 工作流与函数调用
✗ 不适用
对中文语音的专精优化(主要支持西方主流语言)、需大量复杂图像或视频理解的多模态任务

05部署与限制

⚙ 本地部署建议
开源可本地部署,官方 vLLM 推荐。BF16/FP16 全精度需约 55GB 显存,适合高显存单卡或双卡环境。社区已提供 FP8 量化版本,可降低约 50% 显存需求。推理框架建议使用 vLLM >= 0.10.0,支持音频输入。
⚠ 已知限制
系统提示词暂不支持。官方基准测试主要针对印欧语系语言,中文友好度有待验证。核心能力强在语音与文本的跨模态理解,原生不具备图像/视频生成能力。

06详细介绍

Voxtral Small is an enhancement of Mistral Small 3, incorporating state-of-the-art audio input capabilities while retaining best-in-class text performance. It excels at speech transcription, translation and audio understanding. Input audio…

07官方资源

暂无

08同类模型