higgs-audio是本月刚发布的一款非常强大的文字转语音工具,上线不到一个月就获得了5.9K个星,可以说是非常热门的项目了。这个软件可以实现文字转语音及声音克隆功能,不过可以实现这个功能的这类软件很多,higgs-audio只是说好一点而已,我感觉它更厉害的地方是可以实现声音克隆的同时用指定音色合成对话语音,包括支持中文对话,这点是我更喜欢的。之前测试过类似软件如Dia等,支持语言有限,不支持中文。higgs-audio还是更强大一些。

higgs-audio官方介绍
我们开源了 Higgs Audio v2,这是一个强大的音频基础模型,已基于超过 1000 万小时的音频数据和丰富的文本数据进行预训练。尽管无需后期训练或微调,Higgs Audio v2 凭借其对语言和声学的深度理解,在富有表现力的音频生成方面表现出色。
在EmergentTTS-Eval 测试中,它在“情绪”和“问题”类别上分别比“gpt-4o-mini-tts”取得了75.7%和55.7%的胜率。此外,它在 Seed-TTS Eval 和情感语音数据集 (ESD) 等传统 TTS 基准测试中也取得了最佳性能。此外,该模型还展示了以往系统罕见的功能,包括生成多种语言的自然多说话人对话、旁白过程中的自动韵律调整、使用克隆声音进行旋律哼唱以及同时生成语音和背景音乐。
higgs-audio整合包使用说明
首先将网盘内的软件压缩包下载到本地电脑上并解压,然后双击启动软件.exe启动。第一次使用的时候软件会自动下载模型文件。如果网络异常无法自动下载模型的话,可以将网盘内的hf.zip压缩包下载到项目文件夹higgs-audio内解压,注意不要有文件夹嵌套情况,文件夹层级结构如:higgs-audio–>hf–>models–bosonai–higgs-audio-v2-generation-3B-base
待合成文本:就是你想要生成语音的文本内容。如果要生成对话语音的话,请把文本内容保存到txt文档中,然后将txt文档导入到软件中即可。
输入框中直接输入txt文档路径地址,或是鼠标左键按住txt文档拖到软件窗口里就可以把txt文档路径导入到软件。多人对话文本格式如下:
[SPEAKER0] I can't believe you did that without even asking me first!
[SPEAKER1] Oh, come on! It wasn't a big deal, and I knew you would overreact like this.
[SPEAKER0] Overreact? You made a decision that affects both of us without even considering my opinion!
[SPEAKER1] Because I didn't have time to sit around waiting for you to make up your mind! Someone had to act.参考音频:合成语音想要使用的声音音色,留空的话随机使用已有音色。添加新音色方法:准备一段3-10的wav格式的音频文件,和同文件名的txt文档,txt文档内容为wav音频文本内容。将wav音频和txt文档复制到voice_prompts文件夹内。重启软件就可以在参考音频后面下拉列表中看到添加的声音。鼠标点击列表名字可直接添加到前面的文本框内,单一说话人就选一个发音人,多人对话的话就选多个发音人,多个发音人之间用英文逗号”,”隔开。
最大tokens:要生成的新令牌的最大数量,整数类型,如2048,
temperature:用于对下一个词元概率进行取模运算的值,小数类型,如1.0,0.3
AISM:是否在系统消息中包含语音提示描述。
块方法:用于对提示文本进行分块的方法。选项有“speaker”(按说话者)、“word”(按单词)。默认情况下,默认为空,如果生成多人对话,请选择speaker。
seed:随机种子,整数类型,如123 , 56987 等,用于重现相同声音。如果语音合成声音异常的话,可尝试修改seed值,或是将值设置为-1
场景描述:用于生成的场景描述提示。
具体参数效果可以自己生成音频体验。
视频教程及效果演示:https://www.bilibili.com/video/BV1T98CzcEbt/
注意事项
使用前先将英伟达显卡驱动更新到最新版本
英伟达显卡显存不低于6G
软件程序运行路径中请不要有非英文字符及空格
软件只支持Windows 10或11,不支持手机和MAC系统
声音克隆及多人对话语音合成软件higgs-audio整合包下载
https://pan.quark.cn/s/98c9872273c3
higgs-audio本地电脑安装部署教程
相关推荐
最近更新
PDF转Markdown软件MinerU 3.1.11整合包(高性能版)
MinerU是一款非常热门的PDF、图片、DOCX、PPTX、XLSX转markdown格式软件,转换效果属于同类软件中比较优秀的一个。当前最新版为3.1.11版本,我基于最新版源码制作了免安装一键启动整合包,并做适当优化及修改,详情查看链...
阿里千问Qwen3-TTS声音克隆语音合成软件【低配电脑版】
阿里千问Qwen3-TTS是一款热门的语音合成及声音克隆软件,我基于当前最新版制作了免安装一键启动整合包,并增加多人对话语音合成功能。 此版本为低配显卡电脑版,软件使用0.6B模型,模型尺寸略小,对电脑显卡配置要求也更小,但是质量不会差太多...

腾讯混元三维世界重建系统WorldMirror 2.0通用3D三维资产重建工具下载
WorldMirror 2.0 是由腾讯混元(Hunyuan)团队开发的下一代通用三维世界重建系统,底层基于 HY-World-2.0 模型。它能够从一组普通照片或一段视频中,自动恢复出场景的三维结构,并生成多种形式的三维资产,包括: 我基...

阿里Qwen3-TTS高质量声音克隆语音合成系统,AI视频配音多人对话生成工具
Qwen3-TTS 是由阿里 Qwen 团队开发的新一代语音合成系统,基于自研的 Qwen3-TTS-Tokenizer-12Hz 编解码器和离散多码本 LM 架构,实现了端到端的全信息语音建模。它突破了传统级联架构的信息瓶颈,支持音色克隆...

PasteMD:一键将 Markdown 和网页 AI 对话文本内容粘贴到 Word、WPS 和 Excel
PasteMD:一键将 Markdown 和网页 AI 对话(ChatGPT/DeepSeek等)完美粘贴到 Word、WPS 和 Excel 的效率工具。 在写论文或报告时,从 ChatGPT / DeepSeek 等 AI 网站中复制出...

BiliNote:自动生成B站油管视频笔记,AI视频内容总结工具
在信息爆炸的时代,视频已经成为最重要的知识载体之一。但相比文字,视频的“可检索性”和“复用效率”始终较低。如何快速从长视频中提取重点、形成结构化知识,成为很多学习者和创作者的痛点。 而 BiliNote 正是为解决这一问题而诞生的一款开源 ...

优云智算HappyHorse AI 视频生成API KEY WebUI
大家可能平常刷视频的时候已经发现了,进入2026年AI短剧极其火爆,不管是短视频平台还是拼多多等购物平台,短剧视频里经常能刷到AI漫剧。前几年短剧公司拍真人短剧赚的盆满钵满,进入2026年短剧公司被AI打的毫无还手之力。借助AI的快速发展,...

LTX-2.3 视频生成免安装部署整合包软件下载
LTX-2 是由 Lightricks 开发的首个基于 DiT(扩散变换器)架构的音视频基础模型,能够在一个统一模型中同时生成高质量的视频与同步音频。与以往需要分别处理视频和音频的方案不同,LTX-2 将两者深度融合,实现真正的音画同步生成...
windows电脑剪贴板内容管理工具Ditto下载,快速粘贴预设文字内容回复话术
和大家分享一个windows电脑剪贴板内容管理神器Ditto,软件可以快速将预设文字内容填充到指定位置。 由于每天都要写大量文字,有时候还是重复内容,频繁到其它地方复制粘贴的话比较耗时间,所以找到了这款软件,首先佩服一下软件作者,这个软件维...
PDF转word软件FreeP2W免安装版下载
这软件还是很早的时候一个用户让做的,发现没分享过,现在分享一下。 软件主要功能就是把PDF文档转换为word文档 软件使用很简单,把需要处理的pdf文档复制到input文件夹内,双击启动软件.exe,等待处理完成即可。 注意事项 软件只支持...














