多语言与方言合成
覆盖中文、英文、日文、韩文、德文、西班牙文、法文、意大利文、俄文 9 种语言,以及广东、闽南、四川、东北、上海、天津、山东等 18 种以上中文方言和口音。
BAIZE AI RESOURCE
CosyVoice
CosyVoice 是面向多语言场景的开源语音合成系统,支持中文、英文、日文等 9 种语言和 18 种以上中文方言,只需一段参考音频即可克隆音色,把文字自然读出来,适合做配音、有声内容和语音交互。

CosyVoice 是一套开源的文字转语音(TTS)系统,核心能力是把输入文本合成为自然流畅的语音,并支持用一小段参考音频克隆说话人的音色。它覆盖中文、英文、日文、韩文、德文、西班牙文、法文、意大利文、俄文等 9 种语言,以及广东、闽南、四川、东北、上海、天津、山东等 18 种以上中文方言和口音,还支持跨语言音色克隆。除基础朗读外,它支持用指令控制语言、方言、情绪、语速和音量,支持中文拼音与英文音素的发音修正,并能直接读出数字和特殊符号。系统提供流式输入输出,延迟可低至约 150 毫秒,适合实时语音交互。用户可以通过网页界面、命令行示例或 API 服务调用,也提供 Docker 与高性能推理部署方案,适合内容创作者、开发者以及需要批量生成语音的团队。
覆盖中文、英文、日文、韩文、德文、西班牙文、法文、意大利文、俄文 9 种语言,以及广东、闽南、四川、东北、上海、天津、山东等 18 种以上中文方言和口音。
只需提供一段参考音频,即可克隆说话人音色,并支持多语言和跨语言的零样本语音克隆。
通过指令控制语言、方言、情绪、语速和音量等表达方式,让同一段文字呈现不同语气和风格。
支持中文拼音和英文 CMU 音素的发音修正,并能直接读出数字、特殊符号和多种文本格式,无需传统前端模块。
同时支持文本流式输入和音频流式输出,延迟可低至约 150 毫秒,适合实时语音交互场景。
提供网页界面、示例脚本和 API 服务调用方式,并支持 Docker 及高性能推理部署方案,便于批量生成语音。
使用场景内容创作者需要为短视频快速生成多语言旁白。
输入文案并选择目标语言或方言,用参考音频克隆固定音色,批量生成风格统一的配音音频。
使用场景把文章或书籍文本转成可收听的有声内容。
将长文本分段输入,使用指令控制语速和情绪,生成自然流畅的朗读音频。
使用场景开发者需要为应用加入低延迟语音播报能力。
通过流式输入输出接口,把文字实时合成为语音,延迟可低至约 150 毫秒。
使用场景企业需要为不同地区用户提供本地化语音提示。
利用多语言和方言支持,为同一段提示生成不同语言或口音的语音版本。