ChatTTS是一款专为对话场景设计的文本转语音(TTS)生成模型,旨在为大型语言模型(LLM)助手等对话式应用提供自然且富有表现力的语音合成能力。其核心优势在于支持对韵律特征的细粒度控制,能够预测并生成包括笑声、停顿和感叹词在内的副语言特征,使合成的语音更接近真人对话。模型支持中英文双语,其主力模型基于超过10万小时的中英文音频数据训练。
该模型代码以AGPL-3.0协议开源,但模型权重采用CC BY-NC 4.0许可,仅限学术研究使用,严禁用于商业目的。在硬件需求上,使用GPU(建议NVIDIA,显存不低于4GB)可显著加速推理(约1秒生成7个字对应的音频),而纯CPU环境则需要较高的内存配置。在部署时,可通过固定音色种子(seed)值实现音色一致性,并通过调节temperature等参数控制语音的随机性与表现力。