ChatTTS 中英文对话语音模型:细粒度韵律控制与多说话人合成

ChatTTS 是一款面向对话场景的文本转语音模型,支持中英文混合输入,具备细粒度韵律控制、多说话人音色克隆和流式音频生成能力,并提供 WebUI、命令行、REST API 等多种部署形态。

ChatTTS 中英文对话语音模型:细粒度韵律控制与多说话人合成
开发语言未说明
资源大小10.49MB
运行环境Windows / macOS / Linux / Web
资源状态可查看

对话场景下的语音合成定位

ChatTTS 是专为对话交互设计的文本转语音模型,它改变了传统 TTS 只能输出单调朗读风格的局面,能够模拟真实对话中的语速变化、情感起伏、停顿和语气词,甚至生成笑声、叹息等非语言声音。

模型基于 Transformer 架构,使用超过 40,000 小时的中英文混合音频数据进行预训练,并通过自监督预训练与监督微调相结合的方式优化,使得生成的语音自然度和表现力都较为突出。

核心能力与定制方式

细粒度韵律控制是 ChatTTS 的一大特点,用户可以在文本中嵌入[笑]、[停顿]、[语气词]等标记,精确控制笑声时长、停顿长短、语调升降等特征,实现个性化表达。

多说话人支持方面,模型既可以通过高斯分布采样随机生成不同风格的说话人音色,也能从参考音频中提取目标音色,实现零样本音色克隆,适合多角色对话场景。

此外,模型支持中英文混合输入,能自动检测并正确处理混合语言,无需手动标注,同时提供语速和音调全局调节功能,适配不同应用场景。

部署形态与运行建议

ChatTTS 提供了多种部署方式,包括本地 WebUI 界面(Gradio)、命令行工具、RESTful API 服务以及兼容 OpenAI 格式的 API,方便不同技术背景的开发者集成。

项目支持流式音频生成,音频数据边生成边输出,首字延迟低至几十毫秒,适合实时对话交互。推理性能方面,支持 torch.compile 动态编译、vLLM 推理引擎和 ONNX 导出,实时因子约 0.3,可流畅运行在消费级显卡上。

代码主体采用 Python 实现,依赖 PyTorch 框架,兼容 HuggingFace Transformers 生态,并提供 Docker 编排文件便于一键部署 API 服务。

图片预览