模型

ChatTTS

仅本地 开源
2noise (ChatTTS) · ChatTTS · CC BY-NC 4.0(模型)/ AGPL-3.0(代码) · 0.4B · 上下文 —
能做什么
语音合成智能客服
部署门槛
消费级 8-12G
≥ 4GB
上下文
token 窗口
参数
0.4B
ChatTTS

01基础参数

参数规模
0.4B
上下文窗口
输入模态
text
可生成
audio
模型系列
ChatTTS
开源许可
CC BY-NC 4.0(模型)/ AGPL-3.0(代码)
主要语言
multi

02推荐部署方案

推荐 Python

03部署门槛详情

硬件等级 消费级 8-12G · 最低显存 4GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
LLM助手对话任务的语音回应、有声内容制作与虚拟角色配音、需要情感表达和韵律控制的语音合成场景
✗ 不适用
音乐生成或歌唱合成、需要纯商业授权的高保密性项目

06部署与限制

⚙ 本地部署建议
建议使用NVIDIA GPU(显存最低4GB)以加速推理,也可在CPU上运行但需配备16GB以上内存和四核以上处理器。HuggingFace开源版本为未SFT的4万小时预训练模型。推荐使用官方Python库或WebUI快速启动。
⚠ 已知限制
开源模型仅供学术研究使用,不可用于商业目的。为防范滥用,模型在训练时添加了高频噪声并压缩了音质。作为纯TTS模型,无法进行对话理解或文本生成。

07详细介绍

ChatTTS是一款专为对话场景设计的文本转语音(TTS)生成模型,旨在为大型语言模型(LLM)助手等对话式应用提供自然且富有表现力的语音合成能力。其核心优势在于支持对韵律特征的细粒度控制,能够预测并生成包括笑声、停顿和感叹词在内的副语言特征,使合成的语音更接近真人对话。模型支持中英文双语,其主力模型基于超过10万小时的中英文音频数据训练。

该模型代码以AGPL-3.0协议开源,但模型权重采用CC BY-NC 4.0许可,仅限学术研究使用,严禁用于商业目的。在硬件需求上,使用GPU(建议NVIDIA,显存不低于4GB)可显著加速推理(约1秒生成7个字对应的音频),而纯CPU环境则需要较高的内存配置。在部署时,可通过固定音色种子(seed)值实现音色一致性,并通过调节temperature等参数控制语音的随机性与表现力。

08官方资源

09同类模型