今天和大家分享一个非常热门的TTS文字转语音软件GPT-SoVITS,这个软件不光可以实现语音合成,而且还可以声音克隆,仅使用1分钟音频数据样品即可克隆,功能非常强大
2025-06-22 更新v2ProPlus版

GPT-SoVITS软件介绍及版本特点:
- 零样本 TTS:输入 5 秒的声音样本并体验即时文本到语音的转换。
- 少量样本 TTS:仅使用 1 分钟的训练数据对模型进行微调,以提高语音相似度和真实感。
- 跨语言支持:使用不同于训练数据集的语言进行推理,目前支持英语、日语、韩语、粤语和中文。
- WebUI 工具:集成工具包括语音伴奏分离、自动训练集分割、中文 ASR 和文本标注,帮助初学者创建训练数据集和 GPT/SoVITS 模型。
GPT-SoVITS-V1实现了:
由参考音频的情感、音色、语速控制合成音频的情感、音色、语速
可以少量语音微调训练,也可不训练直接推理
可以跨语种生成,即参考音频(训练集)和推理文本的语种为不同语种
GPT-SoVITS-V2新增特点:
对低音质参考音频合成出来音质更好
底膜训练集增加到5k小时,zero shot性能更好音色更像,所需数据集更少
增加韩粤两种语言,中日英韩粤5个语种均可跨语种合成
更好的文本前端:持续迭代更新。V2中英文加入多音字优化。
V3版
新功能:
- 音色相似度更高,需要更少的训练数据就能逼近目标说话人(直接使用基础模型,不进行微调,音色相似度就有显著提升)。
- GPT模型更加稳定,重复和遗漏更少,更容易生成情感表达更丰富的语音。
V4版
新功能:
- 版本 4 修复了版本 3 中因非整数倍上采样而产生的金属音损问题,并原生输出 48k 音频,避免了声音低沉(而版本 3 仅原生输出 24k 音频)。作者认为版本 4 可以直接替代版本 3,但仍需进一步测试
V2Pro
新功能:
- VRAM 使用率比 v2 略高,性能超越 v4,但硬件成本和速度与 v2 相同。
2. v1/v2 和 v2Pro 系列拥有相同的特性,而 v3/v4 也具有类似的特性。对于音质一般的训练集,v1/v2/v2Pro 可以提供不错的效果,但 v3/v4 则不然。此外,v3/v4 的合成音调和时值更偏向参考音频,而非整体训练集。
GPT-SoVITS整合包使用说明
首先上传3-10秒的参考音频。
然后在参考音频的文本里输入音频样本的文字内容,不输入音频文本的话,效果会差些,尽量输入。
然后输入需要合成的文本,点击合成语音按钮。
其它参数可自行测试效果
视频教程及效果演示:https://nuowa.net/2017
注意事项
使用前先更新英伟达显卡驱动到最新版本。
支持英伟达50系列显卡
建议英伟达显卡显存不低于4G
软件运行路径中不要有非英文字符和空格,待使用音频素材同样注意
TTS文字转语音合成及声音克隆软件GPT-SoVITS整合包下载链接:
https://pan.quark.cn/s/3d4628397997
GPT-SoVITS本地电脑安装部署教程
相关推荐
多人对话声音克隆语音合成工具Chatterbox TTS免安装版,AI实时文字转语音
阿里千问Qwen3-TTS声音克隆语音合成软件【低配电脑版】
阿里Qwen3-TTS高质量声音克隆语音合成系统,AI视频配音多人对话生成工具
多人对话有声书制作软件VoxCPM Windows版整合包,高质量声音克隆语音合成工具
【免安装/解压即用】支持600+语言的神级TTS!OmniVoice 零样本语音克隆一键整合包发布
VibeVoice:富有表现力的长篇多人对话语音合成工具整合包下载
带声音克隆功能的对话型文字转语音软件higgs-audio免安装一键启动整合包下载
抖音出品高质量声音克隆文字转语音合成软件MegaTTS3整合包下载
最近更新

AI漫剧制作即梦seedance2.0教程及提示词2026年5月最新版分享
AI视频依旧持续火爆,各种类型的AI视频层出不穷,视频效果也是越来越好,甚至快接近影视级,目前最主要的AI视频生成工具还是即梦,即梦 Seedance 2.0生成视频一秒钟都到2块多钱了😂,不过也没办法,还是得用,目前还没能有替代即梦see...

AI实时语音聊天对话系统,外语口语陪练/虚拟好友实时语音交流
AI 实时语音对话系统 是一款集语音识别(ASR)、大语言模型(LLM)对话、语音合成(TTS)于一体的实时语音交互软件。用户通过麦克风说话,系统自动识别语音内容并转为文字,交由 AI 角色进行智能回复,最终将回复内容合成为语音实时播放,实...

ComfyUI 三参考图生图工作流,虚拟试衣、换脸、图片内容整合
本工作流核心能力是将三张不同角度、内容的参考图,通过 AI 理解融合,生成一张新的图像,新图像内容根据描述词指令生成。工作流集成了阿里巴巴的 Qwen2.5-VL 多模态大模型(图像编辑版本)与 SeedVR2 超分辨率放大模型,实现了「理...
comfyui CUDA128+torch 2.8.0+python3.12最新纯净版一键启动整合包
comfyui官方发布的最新版便携包是基于torch 2.11+CU130 +Python 3.13版本制作的,Python版本和torch版本都太新了,windows电脑上安装某些节点的时候会有冲突报错,有时候就算能安装上也会比较麻烦,感...
LTX2.3+comfyui音频驱动视频生成工作流
这是一个基于 ComfyUI 的 LTX 2.3 音视频同步生成工作流,核心功能是上传一段音频 + 参考图片(可多张图),自动生成与音频内容对应的视频,适合制作人物说话、唱歌等口型同步视频。工作流使用8位量化版ltx2.3模型,显存需求降低...
LTX2.3+comfyui分段提示词图片转视频工作流,AI视频带货生成器
再和大家分享一个基于 ComfyUI 的 AI 分段提示词图生视频工作流,本工作流主要基于模型LTX2.3和PromptRelay实现。可使用PromptRelay分时段控制生成不同视频画面或合成语音内容。 📌 工作流简介 本工作流是一套基...
windows电脑C盘垃圾查找清理软件
电脑用了好几年了,尽管我安装软件从来不主动装到C盘,偶尔也会清理垃圾,但是用的久了,容量也是在慢慢减少。我C盘303G,现在就剩了24G了,已经会影响到系统性能和虚拟内存调度了,已经不能不管了。C盘不装软件的话大多都是缓存,文件太多了,有时...

LTX2.3+comfyui视频去除字幕水印工作流分享
本次再和大家分享一个视频去字幕水印的comfyui工作流,工作流基于LTX2.3视频生成模型制作。LTX2.3是最新最强的视频生成模型,我前段时间就分享过了,可以看我另一篇文章:https://nuowa.net/2525,comfyui项...

多人对话声音克隆语音合成工具Chatterbox TTS免安装版,AI实时文字转语音
Chatterbox 是由 Resemble AI 开发的开源文本转语音(Text-to-Speech, TTS)模型,支持零样本音色克隆:只需提供一段参考音频(几秒钟的人声),即可模仿该音色朗读任意文本。我基于最新版源码制作了免安装一键启...
Mineru PDF转markdown软件局域网版
对于有的电脑配置比较低或是win7系统等电脑无法使用Mineru情况,可以使用局域网内可运行软件的电脑运行Mineru,然后其它电脑或手机等终端输入IP地址,打开运行软件的IP地址来使用Mineru。 具体用法: 下载局域网版压缩包到本地电...















