模型

Whisper-Large-v3

仅本地 开源 可商用
OpenAI · Whisper · MIT · 1.5B (1550M) · 上下文 30秒/段
能做什么
语音合成多模态理解智能客服内容创作
部署门槛
消费级 8-12G
≥ 8GB
上下文
30秒/段
token 窗口
参数
1.5B (1550M)
Whisper

01基础参数

参数规模
1.5B (1550M)
上下文窗口
30秒/段
输入模态
audio
可生成
text
模型系列
Whisper
开源许可
MIT
主要语言
multi

02推荐部署方案

推荐 whisper.cpp

03部署门槛详情

硬件等级 消费级 8-12G · 最低显存 8GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
多语言语音转录、音频内容转写与字幕生成、语音翻译(转英文)、长音频批处理转录
✗ 不适用
实时流式低延迟场景(可考虑Turbo版本)、非语音音频分析、纯文本生成任务

06部署与限制

⚙ 本地部署建议
推荐使用Hugging Face Transformers或whisper.cpp进行本地部署。FP16精度下约需6-8GB显存;使用8-bit量化可降至约4GB;GGML量化版本约3.1GB可在8GB内存设备运行。通过chunked长音频算法处理30秒以上音频。
⚠ 已知限制
最大处理30秒音频片段,超长音频需分段处理。可能产生文本幻觉,尤其在低资源语言或噪声环境下。低资源语言准确率有限,不同口音和方言表现存在差异。

07详细介绍

Whisper-Large-v3 是 OpenAI 在 Whisper 系列中推出的最新大型语音识别模型,延续了 Transformer 编码器-解码器架构,参数量为 15.5 亿。相比前代 Large-v2,主要改进包括:将频谱输入从 80 个 Mel 频段提升至 128 个、新增粤语语言标记,以及使用 100 万小时弱标记音频和 400 万小时伪标记音频进行训练。该模型在多种语言上相较 v2 版本实现了 10%-20% 的词错误率降低。

模型支持约 100 种语言的语音识别和多语言向英文的语音翻译,可输出词级和句级时间戳。它支持通过 Hugging Face Transformers 或 whisper.cpp 等工具本地部署,FP16 精度下约需 6-8GB 显存,量化版本可在 8GB 内存设备运行。适用场景包括会议记录与字幕生成、音视频内容转写、多语言语音翻译等。需注意模型单次只能处理 30 秒音频片段,长音频需采用滑动窗口或分块算法处理;在低资源语言或强噪声环境下准确率可能下降,且存在一定文本幻觉风险。

08官方资源

09同类模型