Whisper-Large-v3 是 OpenAI 在 Whisper 系列中推出的最新大型语音识别模型,延续了 Transformer 编码器-解码器架构,参数量为 15.5 亿。相比前代 Large-v2,主要改进包括:将频谱输入从 80 个 Mel 频段提升至 128 个、新增粤语语言标记,以及使用 100 万小时弱标记音频和 400 万小时伪标记音频进行训练。该模型在多种语言上相较 v2 版本实现了 10%-20% 的词错误率降低。
模型支持约 100 种语言的语音识别和多语言向英文的语音翻译,可输出词级和句级时间戳。它支持通过 Hugging Face Transformers 或 whisper.cpp 等工具本地部署,FP16 精度下约需 6-8GB 显存,量化版本可在 8GB 内存设备运行。适用场景包括会议记录与字幕生成、音视频内容转写、多语言语音翻译等。需注意模型单次只能处理 30 秒音频片段,长音频需采用滑动窗口或分块算法处理;在低资源语言或强噪声环境下准确率可能下降,且存在一定文本幻觉风险。