BAIZE AI RESOURCE

开源多语言语音合成与零样本音色克隆系统

CosyVoice

CosyVoice 是面向多语言场景的开源语音合成系统,支持中文、英文、日文等 9 种语言和 18 种以上中文方言,只需一段参考音频即可克隆音色,把文字自然读出来,适合做配音、有声内容和语音交互。

CosyVoice

资源介绍

CosyVoice 是一套开源的文字转语音(TTS)系统,核心能力是把输入文本合成为自然流畅的语音,并支持用一小段参考音频克隆说话人的音色。它覆盖中文、英文、日文、韩文、德文、西班牙文、法文、意大利文、俄文等 9 种语言,以及广东、闽南、四川、东北、上海、天津、山东等 18 种以上中文方言和口音,还支持跨语言音色克隆。除基础朗读外,它支持用指令控制语言、方言、情绪、语速和音量,支持中文拼音与英文音素的发音修正,并能直接读出数字和特殊符号。系统提供流式输入输出,延迟可低至约 150 毫秒,适合实时语音交互。用户可以通过网页界面、命令行示例或 API 服务调用,也提供 Docker 与高性能推理部署方案,适合内容创作者、开发者以及需要批量生成语音的团队。

核心能力

多语言与方言合成

覆盖中文、英文、日文、韩文、德文、西班牙文、法文、意大利文、俄文 9 种语言,以及广东、闽南、四川、东北、上海、天津、山东等 18 种以上中文方言和口音。

零样本音色克隆

只需提供一段参考音频,即可克隆说话人音色,并支持多语言和跨语言的零样本语音克隆。

指令化语音控制

通过指令控制语言、方言、情绪、语速和音量等表达方式,让同一段文字呈现不同语气和风格。

发音修正与文本规范化

支持中文拼音和英文 CMU 音素的发音修正,并能直接读出数字、特殊符号和多种文本格式,无需传统前端模块。

流式低延迟输出

同时支持文本流式输入和音频流式输出,延迟可低至约 150 毫秒,适合实时语音交互场景。

多种调用与部署方式

提供网页界面、示例脚本和 API 服务调用方式,并支持 Docker 及高性能推理部署方案,便于批量生成语音。

使用方法

  1. 阅读资源包中的中文说明和上游官方文档。

  2. 核对版本、运行环境与依赖条件后完成配置。

  3. 先在隔离环境验证主要功能,再用于实际场景。

使用案例

短视频配音

使用场景内容创作者需要为短视频快速生成多语言旁白。

输入文案并选择目标语言或方言,用参考音频克隆固定音色,批量生成风格统一的配音音频。

有声内容制作

使用场景把文章或书籍文本转成可收听的有声内容。

将长文本分段输入,使用指令控制语速和情绪,生成自然流畅的朗读音频。

实时语音交互

使用场景开发者需要为应用加入低延迟语音播报能力。

通过流式输入输出接口,把文字实时合成为语音,延迟可低至约 150 毫秒。

多语言客服播报

使用场景企业需要为不同地区用户提供本地化语音提示。

利用多语言和方言支持,为同一段提示生成不同语言或口音的语音版本。

包含内容

cosyvoice-source.zip
README-中文安装说明.md
LICENSE-Apache-2.0.txt
SHA256.txt

常见问题

CosyVoice 支持哪些语言和方言?
支持中文、英文、日文、韩文、德文、西班牙文、法文、意大利文、俄文 9 种语言,以及广东、闽南、四川、东北、上海、天津、山东等 18 种以上中文方言和口音,并支持跨语言音色克隆。
克隆音色需要多少参考音频?
CosyVoice 采用零样本音色克隆,只需提供一段参考音频即可克隆说话人音色,无需针对该说话人重新训练模型。
CosyVoice 的语音生成延迟是多少?
系统支持文本流式输入和音频流式输出,在流式模式下延迟可低至约 150 毫秒,适合实时语音交互场景。
CosyVoice 可以用 Docker 部署吗?
可以。项目提供 Docker 镜像构建文件,并针对高性能推理场景提供基于 NVIDIA Triton 和 TensorRT-LLM 的 Docker Compose 部署方案。
CosyVoice 能控制语速、情绪和方言吗?
可以。系统支持通过指令控制语言、方言、情绪、语速和音量,还支持中文拼音和英文音素的发音修正,便于精细调整合成效果。