MegaTTS3是抖音团队联合国内其他大学研发的一款语音合成及声音克隆应用,可实现零样本语音克隆及富有情感的自然语音合成。我基于当前最新版制作了免安装一键启动整合包。

MegaTTS3介绍
MegaTTS 3 是字节跳动(ByteDance)与浙江大学联合开发的开源零样本语音合成系统,基于轻量级扩散模型实现高质量、多语言语音克隆与合成。
主要特点
- 轻量级扩散模型(TTS Diffusion Transformer)
- 参数量仅 0.45B,通过逐步加噪与去噪生成语音,兼顾高效与高保真输出。
- 支持 10 步快速推理(CPU 约 30 秒生成语音),模型体积比传统 TTS 缩小 60%。
- 语音属性分解建模
将语音拆解为独立属性,针对性优化:- 音色:全局向量建模缓慢变化的音色特征;
- 韵律:潜在码语言模型捕捉语速、语调等动态变化;
- 内容:VQGAN 声学模型生成语谱图;
- 相位:基于 GAN 的声码器构建。
- 稀疏对齐算法
引入稀疏对齐边界引导扩散变换器(DiT),降低语音-文本对齐难度,提升自然度。
核心功能亮点
- 零样本语音克隆
- 仅需 5–24 秒 的目标说话人音频(24kHz WAV 格式),即可生成高度相似的语音,相似度评分超越主流模型。
- 需通过官方流程提取声学潜变量(
.npy
文件),与音频配对使用。
- 中英文混合合成
支持双语无缝切换,解决传统 TTS 跨语言断句生硬问题(如"这是一条带有accent的测试语句。"
)。 - 精细化语音控制
- 口音强度:通过参数
p_w
(可懂度权重)和t_w
(相似度权重)调节 - 韵律与情感:调整语速、语调,支持情感化输出(如惊喜、悲伤)。
- 口音强度:通过参数
- 高质量输出
在 SEED 测试集上,自然度(Naturalness)和相似度(Similarity)双指标领先竞品,MOS 评分达 4.6/5.0
MegaTTS3整合包使用说明
首先将网盘内的软件压缩包下载到本地电脑上并解压。双击【启动软件.exe】,软件成功启动后会自动打开webui界面。
如果想要实现声音克隆,需要先制作npy格式语音样本。
准备一个.wav格式,小于24s,音频素材,文件名中不要包含空格,上传到下方官方google网盘内
https://drive.google.com/drive/folders/1gCWL1y_2xu9nIFhUX_OW5MbcFuB7J5Cl
生成的npy文件可在下方链接下载
https://drive.google.com/drive/folders/1QhcHWcy20JfqWjgqZX1YM3I6i9u4oNlr?usp=sharing
你也可以使用官方的测试声音
https://drive.google.com/drive/folders/16HqXzo9ENrp1q2urmw0MV6QaHEIqZE-W
或是使用别人上传的声音
https://drive.google.com/drive/folders/1AyB3egmr0hAKp0CScI0eXJaUdVccArGB
在MegaTTS3 webUI上传wav音频素材和npy语音样本后,在inp_text里输入需要合成语音的文本内容,然后点击按钮submit即可开始生成语音。
注意事项
使用前先将英伟达显卡驱动更新到最新版本
软件程序运行路径中请不要有非英文字符及空格,待使用的素材文件同样注意
软件只支持Windows 10或11,不支持手机和MAC系统
建议英伟达显卡显存不低于6G
待合成语音文本长度不要超过200字符
声音克隆软件MegaTTS3整合包下载链接
https://pan.quark.cn/s/3321fbc51c2e
相关推荐
带声音克隆功能的对话型文字转语音软件higgs-audio免安装一键启动整合包下载
高质量高性能文本转语音系统index-tts整合包下载,高效声音克隆软件
文本转语音及声音克隆软件Spark-TTS整合包下载
文字转语音神器工具CosyVoice 2.0整合包下载,声音克隆情感语音软件
免费离线TTS文字转语音工具clone-voice整合包下载,声音克隆软件克隆自己的声音
免费TTS文字转语音合成软件GPT-SoVITS v2ProPlus整合包下载,AI声音克隆软件
AI声音克隆软件Openvoice整合包免费下载,声音模拟克隆免费版工具下载
有声读物制作软件audiblez整合包下载,将epub电子书转为m4b有声书
最近更新

Wan2.2-S2V-14B:音频驱动图片转视频生成本地整合包及在线一键启动
Wan2.2-S2V-14B是阿里通义团队开源的一个视频生成模型,可以通过音频驱动将图片合成为一段人物讲话视频,人物讲话内容就是音频素材内容。同时支持cosyvoice声音克隆的文字转语音合成。 Wan2.2-S2V-14B官方介绍 Wan...

pixi包管理器简易教程系列:pypi方法安装pytorch
pytorch可以从conda-forge安装,也可以从Pypi安装,看到目前官方页面上安装命令里已经不提供conda的安装命令了,只有pip命令,所以这里用pypi方式安装。 打开项目文件夹内的pixi.toml文件,添加下面命令要求 执...

pixi包管理器简易教程系列:入门之创建项目及激活虚拟环境
pixi是新一代包管理和环境管理工具,安装python依赖包非常快,用了几次感觉还不错,记录一下个人学习使用pixi的一些经验。 Linux系统安装pixi方法 或是 wget -qO- https://pixi.sh/install.sh...

comfyui视频人物换主体工作流及模型下载
本次分享一个好玩的视频人物换主体工作流,本工作流可以使用一张图片中的主体替换视频中的人物主体。比如抖音上很多热门的猴子炒饭,奥特曼炒饭,猴子vlog等等,都可以使用人物主体替换把原来视频中的人物替换成指定的人物。 comfyui工作流节点使...

github.com镜像加速网站,解决无法访问下载速度慢的问题
github.com是全球最大的开源社区,上面有着大量的优秀的开源应用。特别是当前AI极速发展,各种AI应用层出不穷,极大的方便了我们生活办公。但是由于网络原因,有时候github.com从国内可能无法访问,要么就访问速度极慢,不能方便快捷...

comfyui工作流软件官方原版windows版一键启动整合包下载
comfyui是目前非常热门的一个应用,它使python应用可以图形化以节点的方式直接拖拽使用,使用起来非常方便,而且可以与其他python应用节点配合使用,大大丰富了comfyui的功能,而且网上大量平台可以下载到各种的comfyui工作...

视频人物动作迁移wan2.1 VACE comfyUI工作流及模型下载,一键人物动作复刻
本次分享一个非常好玩的视频人物动作迁移comfyui工作流,可以通过文生视频或图片转视频将视频素材中的人物动作复制到新生成的视频人物中,视频生成模型主要使用了wan2.1 VACE模型。 comfyui工作流节点使用说明 首先打开网盘链接将...

凡人修仙传动画韩立高清图片壁纸素材AI绘画图集
恭迎韩天尊! 祝贺韩天尊顺利结婴! 热门国漫凡人修仙传动画已经更新了5年了,最新一集,主人公韩立顺利结婴,成为一名元婴修士。我属于是比较喜欢看动漫的,看过的动漫估计没过百也得大几十了,热门国漫大多都看过。凡人修仙传算是最喜欢的动漫之一,韩立...

凡人修仙传动画紫灵高清图片壁纸素材AI绘画图集,AI国漫女神系列
凡人修仙传动画乱星海第一美女紫灵是大家非常喜欢的一个角色,动画人物造型精美,是众多女性角色中最受欢迎之一,热度极高。很多人喜欢收集紫灵的图片,但是视频里截图的话可能截不到喜欢的图,下面分享一些紫灵的AI绘画图片素材,图片都是SD生成的,都是...

凡人修仙传动画宋玉高清图片壁纸素材AI绘画图集,AI国漫女神系列
凡人修仙传动画里宋玉是大家比较喜欢的一个角色,动画人物造型精美,当前热度极高。虽然凡人修仙传原著里只是韩老魔的弟子,但是很多短视频创作者非常能整活,已经把宋玉纳入韩老魔后宫了。很多人喜欢收集宋玉的图片,但是视频里截图的话可能截不到喜欢的图,...