Voxtral Small is an enhancement of Mistral Small 3, incorporating state-of-the-art audio input capabilities while retaining best-in-class text performance. It excels at speech transcription, translation and audio understanding. Input audio…
Mistral: Voxtral Small 24B 2507
仅本地 开源 可商用
— · Apache-2.0 · 24B · 上下文 32K
能做什么
语音合成智能客服知识问答内容创作
01基础参数
- 参数规模
- 24B
- 上下文窗口
- 32K
- 输入模态
- text / audio
- 可生成
- text
- 模型系列
- —
- 开源许可
- Apache-2.0
- 主要语言
- multi
02部署门槛详情
硬件等级 中端 16-24G · 最低显存 24GB
03Benchmark 评测
待补充
04适用场景
✓ 适用
高精度多语言语音转录与翻译、对音频内容的直接问答与结构化摘要、通过语音驱动的 Agent 工作流与函数调用
✗ 不适用
对中文语音的专精优化(主要支持西方主流语言)、需大量复杂图像或视频理解的多模态任务
05部署与限制
⚙ 本地部署建议
开源可本地部署,官方 vLLM 推荐。BF16/FP16 全精度需约 55GB 显存,适合高显存单卡或双卡环境。社区已提供 FP8 量化版本,可降低约 50% 显存需求。推理框架建议使用 vLLM >= 0.10.0,支持音频输入。
⚠ 已知限制
系统提示词暂不支持。官方基准测试主要针对印欧语系语言,中文友好度有待验证。核心能力强在语音与文本的跨模态理解,原生不具备图像/视频生成能力。