CosyVoice是阿里通义实验室(FunAudioLLM)开源的一款轻量级、多语言语音生成模型,采用Apache-2.0协议。其设计理念是在保持高质量语音合成的前提下,显著降低资源消耗。0.5B的参数量使其在消费级GPU(如RTX 3060)上即可流畅运行,并通过非自回归架构实现了极低的首包延迟(约150毫秒),满足实时交互需求。
该模型的核心能力覆盖多语言合成、零样本声音克隆和声音设计。它支持中文、英语、日语、韩语等9种语言及18种中文方言,并可实现单句内的语言混合与跨语种音色克隆。用户仅需提供3-5秒的音频样本即可复刻目标音色,或通过简单的文本描述(Voice Design)来创造全新的定制化音色。这些特性使其在AI智能客服、有声书制作、跨语言配音、游戏角色配音等场景中具备广泛应用价值。