higgs-audio是本月刚发布的一款非常强大的文字转语音工具,上线不到一个月就获得了5.9K个星,可以说是非常热门的项目了。这个软件可以实现文字转语音及声音克隆功能,不过可以实现这个功能的这类软件很多,higgs-audio只是说好一点而已,我感觉它更厉害的地方是可以实现声音克隆的同时用指定音色合成对话语音,包括支持中文对话,这点是我更喜欢的。之前测试过类似软件如Dia等,支持语言有限,不支持中文。higgs-audio还是更强大一些。

higgs-audio官方介绍
我们开源了 Higgs Audio v2,这是一个强大的音频基础模型,已基于超过 1000 万小时的音频数据和丰富的文本数据进行预训练。尽管无需后期训练或微调,Higgs Audio v2 凭借其对语言和声学的深度理解,在富有表现力的音频生成方面表现出色。
在EmergentTTS-Eval 测试中,它在“情绪”和“问题”类别上分别比“gpt-4o-mini-tts”取得了75.7%和55.7%的胜率。此外,它在 Seed-TTS Eval 和情感语音数据集 (ESD) 等传统 TTS 基准测试中也取得了最佳性能。此外,该模型还展示了以往系统罕见的功能,包括生成多种语言的自然多说话人对话、旁白过程中的自动韵律调整、使用克隆声音进行旋律哼唱以及同时生成语音和背景音乐。
higgs-audio整合包使用说明
首先将网盘内的软件压缩包下载到本地电脑上并解压,然后双击启动软件.exe启动。第一次使用的时候软件会自动下载模型文件。如果网络异常无法自动下载模型的话,可以将网盘内的hf.zip压缩包下载到项目文件夹higgs-audio内解压,注意不要有文件夹嵌套情况,文件夹层级结构如:higgs-audio–>hf–>models–bosonai–higgs-audio-v2-generation-3B-base
待合成文本:就是你想要生成语音的文本内容。如果要生成对话语音的话,请把文本内容保存到txt文档中,然后将txt文档导入到软件中即可。
输入框中直接输入txt文档路径地址,或是鼠标左键按住txt文档拖到软件窗口里就可以把txt文档路径导入到软件。多人对话文本格式如下:
[SPEAKER0] I can't believe you did that without even asking me first!
[SPEAKER1] Oh, come on! It wasn't a big deal, and I knew you would overreact like this.
[SPEAKER0] Overreact? You made a decision that affects both of us without even considering my opinion!
[SPEAKER1] Because I didn't have time to sit around waiting for you to make up your mind! Someone had to act.参考音频:合成语音想要使用的声音音色,留空的话随机使用已有音色。添加新音色方法:准备一段3-10的wav格式的音频文件,和同文件名的txt文档,txt文档内容为wav音频文本内容。将wav音频和txt文档复制到voice_prompts文件夹内。重启软件就可以在参考音频后面下拉列表中看到添加的声音。鼠标点击列表名字可直接添加到前面的文本框内,单一说话人就选一个发音人,多人对话的话就选多个发音人,多个发音人之间用英文逗号”,”隔开。
最大tokens:要生成的新令牌的最大数量,整数类型,如2048,
temperature:用于对下一个词元概率进行取模运算的值,小数类型,如1.0,0.3
AISM:是否在系统消息中包含语音提示描述。
块方法:用于对提示文本进行分块的方法。选项有“speaker”(按说话者)、“word”(按单词)。默认情况下,默认为空,如果生成多人对话,请选择speaker。
seed:随机种子,整数类型,如123 , 56987 等,用于重现相同声音。如果语音合成声音异常的话,可尝试修改seed值,或是将值设置为-1
场景描述:用于生成的场景描述提示。
具体参数效果可以自己生成音频体验。
视频教程及效果演示:https://www.bilibili.com/video/BV1T98CzcEbt/
注意事项
使用前先将英伟达显卡驱动更新到最新版本
英伟达显卡显存不低于6G
软件程序运行路径中请不要有非英文字符及空格
软件只支持Windows 10或11,不支持手机和MAC系统
声音克隆及多人对话语音合成软件higgs-audio整合包下载
https://pan.quark.cn/s/98c9872273c3
higgs-audio本地电脑安装部署教程
相关推荐
最近更新

最强分说话人语音识别工具,支持批量音视频识别转字幕,字幕翻译内容总结
本软件是一款基于 Qwen3-ASR-1.7B 大模型的本地音视频语音识别工具,配备说话人分离功能,可在个人电脑上实现: 整个流程通过简洁的 Gradio Web 界面 操作,点击按钮即可完成识别与导出。 主要功能特点 1. 单文件识别与批...

最强PR中文视频自动语音识别生成字幕插件,语音识别准确率高支持多国语言
上次和大家分享了PR非常好用的自动剪辑口播视频静音片段插件,如果想要自动生成视频字幕的话,用PR自带的语音识别转字幕工具,效果非常差,语音识别准确率非常低,识别的文本差太多手动修改起来极其麻烦,反而更加浪费时间了。为了提高工作效率,降低人工...

祝贺凡人修仙传2026年新年番开播同时在线人数超64万
今天6月13日凡人修仙传新年番开播,同时在线人数破64万(非最高在线人数,只是我看到的在线人数),作为凡人5年老粉,必须发个帖祝贺一下。 我比较喜欢看动漫,各种类型看了很多,具体不清楚多少,像斗罗斗破之类看了一大半终究是没能看下去,还是雾山...

Premiere Pro静音片段自动剪辑插件——Silence Remover使用教程及下载
对于做口播、Vlog、播客剪辑的朋友来说,最耗时的工作之一就是手动找出视频中的”哑巴”片段——说话间隙、停顿、思考时的”嗯啊”——并逐一删除。今天给大家介绍一款来自 Phantom Edito...

蛙蛙写作-能替你"打工"的AI写作平台,附邀请码:UZekHC
我不是一个容易被工具说服的人。用过 ChatGPT、试过各种”AI写作神器”,大多数要么写出来全是机翻腔,要么根本不懂网文的爆款逻辑。 直到我开始用蛙蛙写作,才发现原来一个工具真的可以懂你想写什么。 🐸 蛙蛙写作是什...

PDFMathTranslate + MinerU 批量PDF全文双语翻译转Markdown工具
本工具是一款基于 PDFMathTranslate 与 MinerU 整合的桌面端 PDF 翻译工具,通过简洁的 Web 界面实现一键式 PDF 全文双语翻译,并可选择将翻译结果导出为 Markdown 格式,方便导入知识库或进行二次编辑。...

Claude居然自称“本人”
今天在和Claude聊网文写作的时候,Claude回复中居然自称本人,这让我有点震惊。 我经常会和AI聊工具功能对比等话题,ChatGPT、Gemini、Claude这些以前我记得从来没有自称过本人的,好像都是本模型,本工具等等,反正从来没...

图像无损放大神器:Topaz Gigapixel AI软件下载及使用指南
在数字内容创作成风头的今天,我们经常会遇到低分辨率素材模糊、AI 生成图片尺寸太小、或者老照片充满噪点的情况。传统的图像放大方式(如双三次插值)只是单纯地拉伸像素,容易让画面变得模糊、虚化。 如果你正在寻找一种能“凭空”补齐细节、让低画质瞬...

AI视频提示词反推工具,参考视频即梦提示词一键生成
本工具是一款面向 AI 视频生成创作者的本地离线辅助软件。用户导入任意视频文件,工具会自动完成场景检测、关键帧提取、多模态模型分析、提示词拼装等全流程,最终输出一份可直接复制粘贴到即梦 AI 等视频生成平台的完整提示词。 适用场景 功能特点...
免费在线HTML转markdown工具
经常看一些在线文档,想复制给AI参考的话不方便直接复制,转换成markdown再给AI阅读会更简单明了,也方便自己查阅,这里给大家推荐两个在线的免费HTML转markdown网站。 1、https://d1tools.com/tools/c...















