VibeVoice是微软开发的一款富有表现力的长篇多人对话语音合成工具。支持1-4个发音人,支持声音克隆自定义音色合成语音,我制作了最新的本地免安装一键启动整合包及云端在线版。

VibeVoice介绍
VibeVoice:一种前沿的长对话文本转语音模型
VibeVoice 是一个新型框架,旨在从文本生成富有表现力的长篇多说话人对话音频,例如播客。它解决了传统文本转语音 (TTS) 系统中的重大挑战,尤其是在可扩展性、说话人一致性和自然轮流说话方面。
VibeVoice 的核心创新在于其采用连续语音分词器(声学分词器和语义分词器),并以 7.5 Hz 的超低帧率运行。这些分词器能够高效地保持音频保真度,同时显著提升处理长序列的计算效率。VibeVoice 采用下一词元扩散框架,利用大型语言模型 (LLM) 理解文本上下文和对话流程,并使用扩散头生成高保真声学细节。
该模型可以合成长达90 分钟、最多4 个不同说话人的语音,超越了许多先前模型通常 1-2 个说话人的限制。
VibeVoice整合包使用说明
为了方便有高配电脑和没有高配电脑的用户使用,我分别制作了本地免安装整合包版及云端在线一键启动版。
首先到网盘内将软件压缩包下载到本地电脑上,英伟达显存16G以上用户可下载7B版,低配英伟达显卡用户下载1.5B版,然后解压出来。
双击启动软件.bat,启动成功后会自动打开webUI操作界面
可以选择默认的发音人,也可以自定义音色发音人。
如果需要自定义声音的话,可在上传音频中上传需要使用的声音的音频文件即可。如果需要反复使用这个 声音的话,建议将音频文件放入项目文件夹内的voices文件夹内,在使用的时候直接从列表里选择就可以了,更方便。
脚本输入里输入需要合成语音的文本内容即可。
多人对话时,建议在文本开头写上“Speaker 1:”和“Speaker 2:”这样的关键词来区分不同说话人内容。
点击生成播客,等待合成结果即可。
视频教程及效果演示视频:
注意事项
软件只支持中英文语音合成
本地整合包软件只支持windows10和11
软件运行路径中不要出现非英文字符和空格
英伟达显卡需要RTX30系列或更高型号
7B模型版,建议英伟达显存16G以上用户使用
软件会随机合成一些背景乐,这是由场景决定的,如果想要删除,请修改出现背景乐的文本内容
VibeVoice本地电脑免安装一键启动整合包下载链接
VibeVoice在线一键启动版链接
VibeVoice免费在线使用地址
相关推荐
最近更新

多人对话有声书制作软件VoxCPM Windows版整合包,高质量声音克隆语音合成工具
前几天调试了刚出的omnivoice,本次再分享一个语音合成(TTS)领域的开源天花板——VoxCPM。我基于原版功能增加了多人对话语音合成功能,因为之前分享的时候有用户有多人对话语音合成需求,这次顺便增加了这个功能。 一、 什么是 Vox...

图片/PDF转HTML/Markdown/JSON软件Chandra—— Windows 版一键启动包,免安装部署,可离线
日常工作和学习中,我们经常需要把 PDF 文档或复杂的图片(包含表格、公式、排版)转换成可编辑的文本。传统的 OCR 软件往往对复杂排版和表格无能为力,Chandra 2对于多语言文档处理表现更加优秀。 今天向大家推荐一款基于多模态大模型的...

【免安装/解压即用】支持600+语言的神级TTS!OmniVoice 零样本语音克隆一键整合包发布
今天为大家带来一款基于近期爆火的开源语音大模型项目 OmniVoice 制作的免安装、纯离线、一键启动整合包!小白也能在自己的电脑上轻松体验当前地表最强的零样本语音克隆技术! 🎯 一、 什么是 OmniVoice?它有多强? OmniVoi...

FunASR语音识别转文字软件区分说话人版
FunASR是一款优秀的基础语音识别框架,配合阿里通义团队开发的其它语音识别模型,能够实现非常好语音转文字效果,尤其在中文语音识别方面,鉴于有些用户需要对语音识别内容区分说话人,我重新做了一版区分说话人的版本。软件支持多语言识别,但是还是尽...

windows系统电脑通过WSL2安装OpenClwa实现开机自动启动详细教程
windows系统原生环境下运行openclaw多少还是会遇到点问题,虽然windows原生环境支持使用,但是WSL2仍是官方最推荐的方式。下面是windows系统电脑安装WSL2及OpenClaw详细教程。 安装 WSL2 以管理员身份打...

openclaw AI助手windows电脑安装部署及微信聊天配置详细教程
openclaw是目前最火爆的开源应用,没有之一,它功能强大远超同类应用。以前AI只是你问它答,OpenClaw可以说是有了手,可以帮你做事,做很多事,如果利用的好,绝对是个利器。下面分享一下windows系统电脑本地安装部署教程,有时候可...

Apple苹果3D 高斯(3DGS)模型ply文件生成器,图片转3D模型软件下载
ml-sharp是Apple苹果团队开发的一款3D高斯(3DGS)生成器,可将图片生成3D效果的ply文件。我基于当前最新版本制作了免安装一键启动整合包。 ml-sharp官方介绍 我们提出了 SHARP,这是一种从单张图像进行照片级逼真视...

字节跳动Dolphin图片文档解析工具免安装一键启动整合包下载,PDF转JSON/Markdown软件
本次再分享一个由字节跳动团队开发的一款图片文档解析工具Dolphin,支持解析表格、公式、文本、代码块等元素,支持图片和PDF文档转为Markdown和JSON格式文件,当前为最新发布的V2版本,各项功能效果都得到较大提升。 Dolphin...

微软最新图片转3D网格模型软件TRELLIS.2 windows版整合包下载,AI一键建模工具
上个月微软发布了图片转3D网格模型软件TRELLIS的2.0版本。之前1.0版本非常受欢迎,当前2.0版本功能更强大,效果更好。我制作了最新windows版免安装一键启动整合包。 TRELLIS.2官方说明 TRELLIS.2 是一款最先进...

FunASR最新模型FunAudioLLM/Fun-ASR-Nano-2512实时语音识别转文字热词版整合包下载
Fun-ASR-Nano-2512是阿里通义实验室前天刚发布的最新最强的一款语音识别转文字模型,支持31种语言,延迟低,在某些专业领域表现出色。我基于FunAudioLLM/Fun-ASR-Nano-2512模型制作了最新实时语音识别转文字...









