MegaTTS3是抖音团队联合国内其他大学研发的一款语音合成及声音克隆应用,可实现零样本语音克隆及富有情感的自然语音合成。我基于当前最新版制作了免安装一键启动整合包。

MegaTTS3介绍
MegaTTS 3 是字节跳动(ByteDance)与浙江大学联合开发的开源零样本语音合成系统,基于轻量级扩散模型实现高质量、多语言语音克隆与合成。
主要特点
- 轻量级扩散模型(TTS Diffusion Transformer)
- 参数量仅 0.45B,通过逐步加噪与去噪生成语音,兼顾高效与高保真输出。
- 支持 10 步快速推理(CPU 约 30 秒生成语音),模型体积比传统 TTS 缩小 60%。
- 语音属性分解建模
将语音拆解为独立属性,针对性优化:- 音色:全局向量建模缓慢变化的音色特征;
- 韵律:潜在码语言模型捕捉语速、语调等动态变化;
- 内容:VQGAN 声学模型生成语谱图;
- 相位:基于 GAN 的声码器构建。
- 稀疏对齐算法
引入稀疏对齐边界引导扩散变换器(DiT),降低语音-文本对齐难度,提升自然度。
核心功能亮点
- 零样本语音克隆
- 仅需 5–24 秒 的目标说话人音频(24kHz WAV 格式),即可生成高度相似的语音,相似度评分超越主流模型。
- 需通过官方流程提取声学潜变量(
.npy文件),与音频配对使用。
- 中英文混合合成
支持双语无缝切换,解决传统 TTS 跨语言断句生硬问题(如"这是一条带有accent的测试语句。")。 - 精细化语音控制
- 口音强度:通过参数
p_w(可懂度权重)和t_w(相似度权重)调节 - 韵律与情感:调整语速、语调,支持情感化输出(如惊喜、悲伤)。
- 口音强度:通过参数
- 高质量输出
在 SEED 测试集上,自然度(Naturalness)和相似度(Similarity)双指标领先竞品,MOS 评分达 4.6/5.0
MegaTTS3整合包使用说明
首先将网盘内的软件压缩包下载到本地电脑上并解压。双击【启动软件.exe】,软件成功启动后会自动打开webui界面。
如果想要实现声音克隆,需要先制作npy格式语音样本。
准备一个.wav格式,小于24s,音频素材,文件名中不要包含空格,上传到下方官方google网盘内
https://drive.google.com/drive/folders/1gCWL1y_2xu9nIFhUX_OW5MbcFuB7J5Cl
生成的npy文件可在下方链接下载
https://drive.google.com/drive/folders/1QhcHWcy20JfqWjgqZX1YM3I6i9u4oNlr?usp=sharing
你也可以使用官方的测试声音
https://drive.google.com/drive/folders/16HqXzo9ENrp1q2urmw0MV6QaHEIqZE-W
或是使用别人上传的声音
https://drive.google.com/drive/folders/1AyB3egmr0hAKp0CScI0eXJaUdVccArGB
在MegaTTS3 webUI上传wav音频素材和npy语音样本后,在inp_text里输入需要合成语音的文本内容,然后点击按钮submit即可开始生成语音。
注意事项
使用前先将英伟达显卡驱动更新到最新版本
软件程序运行路径中请不要有非英文字符及空格,待使用的素材文件同样注意
软件只支持Windows 10或11,不支持手机和MAC系统
建议英伟达显卡显存不低于6G
待合成语音文本长度不要超过200字符
声音克隆软件MegaTTS3整合包下载链接
https://pan.quark.cn/s/3321fbc51c2e
相关推荐
最近更新

最强分说话人语音识别工具,支持批量音视频识别转字幕,字幕翻译内容总结
本软件是一款基于 Qwen3-ASR-1.7B 大模型的本地音视频语音识别工具,配备说话人分离功能,可在个人电脑上实现: 整个流程通过简洁的 Gradio Web 界面 操作,点击按钮即可完成识别与导出。 主要功能特点 1. 单文件识别与批...

最强PR中文视频自动语音识别生成字幕插件,语音识别准确率高支持多国语言
上次和大家分享了PR非常好用的自动剪辑口播视频静音片段插件,如果想要自动生成视频字幕的话,用PR自带的语音识别转字幕工具,效果非常差,语音识别准确率非常低,识别的文本差太多手动修改起来极其麻烦,反而更加浪费时间了。为了提高工作效率,降低人工...

祝贺凡人修仙传2026年新年番开播同时在线人数超64万
今天6月13日凡人修仙传新年番开播,同时在线人数破64万(非最高在线人数,只是我看到的在线人数),作为凡人5年老粉,必须发个帖祝贺一下。 我比较喜欢看动漫,各种类型看了很多,具体不清楚多少,像斗罗斗破之类看了一大半终究是没能看下去,还是雾山...

Premiere Pro静音片段自动剪辑插件——Silence Remover使用教程及下载
对于做口播、Vlog、播客剪辑的朋友来说,最耗时的工作之一就是手动找出视频中的”哑巴”片段——说话间隙、停顿、思考时的”嗯啊”——并逐一删除。今天给大家介绍一款来自 Phantom Edito...

蛙蛙写作-能替你"打工"的AI写作平台,附邀请码:UZekHC
我不是一个容易被工具说服的人。用过 ChatGPT、试过各种”AI写作神器”,大多数要么写出来全是机翻腔,要么根本不懂网文的爆款逻辑。 直到我开始用蛙蛙写作,才发现原来一个工具真的可以懂你想写什么。 🐸 蛙蛙写作是什...

PDFMathTranslate + MinerU 批量PDF全文双语翻译转Markdown工具
本工具是一款基于 PDFMathTranslate 与 MinerU 整合的桌面端 PDF 翻译工具,通过简洁的 Web 界面实现一键式 PDF 全文双语翻译,并可选择将翻译结果导出为 Markdown 格式,方便导入知识库或进行二次编辑。...

Claude居然自称“本人”
今天在和Claude聊网文写作的时候,Claude回复中居然自称本人,这让我有点震惊。 我经常会和AI聊工具功能对比等话题,ChatGPT、Gemini、Claude这些以前我记得从来没有自称过本人的,好像都是本模型,本工具等等,反正从来没...

图像无损放大神器:Topaz Gigapixel AI软件下载及使用指南
在数字内容创作成风头的今天,我们经常会遇到低分辨率素材模糊、AI 生成图片尺寸太小、或者老照片充满噪点的情况。传统的图像放大方式(如双三次插值)只是单纯地拉伸像素,容易让画面变得模糊、虚化。 如果你正在寻找一种能“凭空”补齐细节、让低画质瞬...

AI视频提示词反推工具,参考视频即梦提示词一键生成
本工具是一款面向 AI 视频生成创作者的本地离线辅助软件。用户导入任意视频文件,工具会自动完成场景检测、关键帧提取、多模态模型分析、提示词拼装等全流程,最终输出一份可直接复制粘贴到即梦 AI 等视频生成平台的完整提示词。 适用场景 功能特点...
免费在线HTML转markdown工具
经常看一些在线文档,想复制给AI参考的话不方便直接复制,转换成markdown再给AI阅读会更简单明了,也方便自己查阅,这里给大家推荐两个在线的免费HTML转markdown网站。 1、https://d1tools.com/tools/c...















