MegaTTS3是抖音团队联合国内其他大学研发的一款语音合成及声音克隆应用,可实现零样本语音克隆及富有情感的自然语音合成。我基于当前最新版制作了免安装一键启动整合包。

MegaTTS3介绍
MegaTTS 3 是字节跳动(ByteDance)与浙江大学联合开发的开源零样本语音合成系统,基于轻量级扩散模型实现高质量、多语言语音克隆与合成。
主要特点
- 轻量级扩散模型(TTS Diffusion Transformer)
- 参数量仅 0.45B,通过逐步加噪与去噪生成语音,兼顾高效与高保真输出。
- 支持 10 步快速推理(CPU 约 30 秒生成语音),模型体积比传统 TTS 缩小 60%。
- 语音属性分解建模
将语音拆解为独立属性,针对性优化:- 音色:全局向量建模缓慢变化的音色特征;
- 韵律:潜在码语言模型捕捉语速、语调等动态变化;
- 内容:VQGAN 声学模型生成语谱图;
- 相位:基于 GAN 的声码器构建。
- 稀疏对齐算法
引入稀疏对齐边界引导扩散变换器(DiT),降低语音-文本对齐难度,提升自然度。
核心功能亮点
- 零样本语音克隆
- 仅需 5–24 秒 的目标说话人音频(24kHz WAV 格式),即可生成高度相似的语音,相似度评分超越主流模型。
- 需通过官方流程提取声学潜变量(
.npy文件),与音频配对使用。
- 中英文混合合成
支持双语无缝切换,解决传统 TTS 跨语言断句生硬问题(如"这是一条带有accent的测试语句。")。 - 精细化语音控制
- 口音强度:通过参数
p_w(可懂度权重)和t_w(相似度权重)调节 - 韵律与情感:调整语速、语调,支持情感化输出(如惊喜、悲伤)。
- 口音强度:通过参数
- 高质量输出
在 SEED 测试集上,自然度(Naturalness)和相似度(Similarity)双指标领先竞品,MOS 评分达 4.6/5.0
MegaTTS3整合包使用说明
首先将网盘内的软件压缩包下载到本地电脑上并解压。双击【启动软件.exe】,软件成功启动后会自动打开webui界面。
如果想要实现声音克隆,需要先制作npy格式语音样本。
准备一个.wav格式,小于24s,音频素材,文件名中不要包含空格,上传到下方官方google网盘内
https://drive.google.com/drive/folders/1gCWL1y_2xu9nIFhUX_OW5MbcFuB7J5Cl
生成的npy文件可在下方链接下载
https://drive.google.com/drive/folders/1QhcHWcy20JfqWjgqZX1YM3I6i9u4oNlr?usp=sharing
你也可以使用官方的测试声音
https://drive.google.com/drive/folders/16HqXzo9ENrp1q2urmw0MV6QaHEIqZE-W
或是使用别人上传的声音
https://drive.google.com/drive/folders/1AyB3egmr0hAKp0CScI0eXJaUdVccArGB
在MegaTTS3 webUI上传wav音频素材和npy语音样本后,在inp_text里输入需要合成语音的文本内容,然后点击按钮submit即可开始生成语音。
注意事项
使用前先将英伟达显卡驱动更新到最新版本
软件程序运行路径中请不要有非英文字符及空格,待使用的素材文件同样注意
软件只支持Windows 10或11,不支持手机和MAC系统
建议英伟达显卡显存不低于6G
待合成语音文本长度不要超过200字符
声音克隆软件MegaTTS3整合包下载链接
https://pan.quark.cn/s/3321fbc51c2e
相关推荐
最近更新
PDF转Markdown软件MinerU 3.1.11整合包(高性能版)
MinerU是一款非常热门的PDF、图片、DOCX、PPTX、XLSX转markdown格式软件,转换效果属于同类软件中比较优秀的一个。当前最新版为3.1.11版本,我基于最新版源码制作了免安装一键启动整合包,并做适当优化及修改,详情查看链...
阿里千问Qwen3-TTS声音克隆语音合成软件【低配电脑版】
阿里千问Qwen3-TTS是一款热门的语音合成及声音克隆软件,我基于当前最新版制作了免安装一键启动整合包,并增加多人对话语音合成功能。 此版本为低配显卡电脑版,软件使用0.6B模型,模型尺寸略小,对电脑显卡配置要求也更小,但是质量不会差太多...

腾讯混元三维世界重建系统WorldMirror 2.0通用3D三维资产重建工具下载
WorldMirror 2.0 是由腾讯混元(Hunyuan)团队开发的下一代通用三维世界重建系统,底层基于 HY-World-2.0 模型。它能够从一组普通照片或一段视频中,自动恢复出场景的三维结构,并生成多种形式的三维资产,包括: 我基...

阿里Qwen3-TTS高质量声音克隆语音合成系统,AI视频配音多人对话生成工具
Qwen3-TTS 是由阿里 Qwen 团队开发的新一代语音合成系统,基于自研的 Qwen3-TTS-Tokenizer-12Hz 编解码器和离散多码本 LM 架构,实现了端到端的全信息语音建模。它突破了传统级联架构的信息瓶颈,支持音色克隆...

PasteMD:一键将 Markdown 和网页 AI 对话文本内容粘贴到 Word、WPS 和 Excel
PasteMD:一键将 Markdown 和网页 AI 对话(ChatGPT/DeepSeek等)完美粘贴到 Word、WPS 和 Excel 的效率工具。 在写论文或报告时,从 ChatGPT / DeepSeek 等 AI 网站中复制出...

BiliNote:自动生成B站油管视频笔记,AI视频内容总结工具
在信息爆炸的时代,视频已经成为最重要的知识载体之一。但相比文字,视频的“可检索性”和“复用效率”始终较低。如何快速从长视频中提取重点、形成结构化知识,成为很多学习者和创作者的痛点。 而 BiliNote 正是为解决这一问题而诞生的一款开源 ...

优云智算HappyHorse AI 视频生成API KEY WebUI
大家可能平常刷视频的时候已经发现了,进入2026年AI短剧极其火爆,不管是短视频平台还是拼多多等购物平台,短剧视频里经常能刷到AI漫剧。前几年短剧公司拍真人短剧赚的盆满钵满,进入2026年短剧公司被AI打的毫无还手之力。借助AI的快速发展,...

LTX-2.3 视频生成免安装部署整合包软件下载
LTX-2 是由 Lightricks 开发的首个基于 DiT(扩散变换器)架构的音视频基础模型,能够在一个统一模型中同时生成高质量的视频与同步音频。与以往需要分别处理视频和音频的方案不同,LTX-2 将两者深度融合,实现真正的音画同步生成...
windows电脑剪贴板内容管理工具Ditto下载,快速粘贴预设文字内容回复话术
和大家分享一个windows电脑剪贴板内容管理神器Ditto,软件可以快速将预设文字内容填充到指定位置。 由于每天都要写大量文字,有时候还是重复内容,频繁到其它地方复制粘贴的话比较耗时间,所以找到了这款软件,首先佩服一下软件作者,这个软件维...
PDF转word软件FreeP2W免安装版下载
这软件还是很早的时候一个用户让做的,发现没分享过,现在分享一下。 软件主要功能就是把PDF文档转换为word文档 软件使用很简单,把需要处理的pdf文档复制到input文件夹内,双击启动软件.exe,等待处理完成即可。 注意事项 软件只支持...














