本次和大家分享一个字节跳动开发的强大的音频驱动口型数字人视频制作软件LatentSync,我以前也分享过不少类似软件了,比如:EchoMimic、VideoReTalking、hallo。字节的推出的这个效果稍微更好一点,我制作了最新版的一键启动整合包。
————————————————
2025-03-19更新V1.5版本

LatentSync官方说明
LatentSync:嘴唇同步的音频条件潜在扩散模型。我们提出了LatentSync,这是一种基于音频条件潜在扩散模型的端到端唇形同步框架,没有任何中间运动表示,与之前基于像素空间扩散或两阶段生成的基于扩散的唇形同步方法不同。我们的框架可以利用Stable Diffusion的强大功能来直接模拟复杂的视听相关性。此外,我们发现基于扩散的唇形同步方法由于不同帧间扩散过程的不一致性而表现出较差的时间一致性。我们提出了时间再现对齐(TREPA)来提高时间一致性,同时保持唇形同步的准确性。TREPA使用由大规模自监督视频模型提取的时间表示来将生成的帧与地面真实帧对齐。
LatentSync使用Whisper将融合频谱图转换为音频嵌入,然后通过交叉注意力层将其集成到U-Net中。参考帧和掩码帧与噪声延迟按信道连接,作为U-Net的输入。在训练过程中,我们使用一步法从预测的噪声中得到估计的干净延迟,然后对其进行解码以获得估计的干净帧。TREPA、LPIPS和SyncNet损耗被添加到像素空间中。
V1.5版本更新说明:
(1)通过添加时间层提高了时间一致性,(2)提高了中文视频的性能,(3)通过一系列优化将stage2训练的VRAM要求降低到20 GB。
LatentSync整合包使用说明
首先将软件压缩包下载到本地电脑并解压,双击【启动软件.exe】,稍等一会加载模型,完成后会自动打开webUI界面。
操作界面比较简单,左上部分上传视频素材,左下部分上传驱动音频,然后点击按钮Process Video即可开始合成视频。所需时间由电脑配置决定,建议英伟达显卡显存4G以上用户使用。
合成完成后右侧可播放视频或下载视频,在软件项目文件夹内的temp文件夹内也可以找到合成视频。
注意事项
如果视频素材和音频素材时长不一致,最终合成视频时长由最短的那个决定。
音频素材末尾最好增加0.5到1秒的静音片段,以防最终视频结尾不完整。
整合包只支持Windows 10或11系统
软件运行路径中不要有非英文字符和空格
1.5版本建议英伟达显卡显存6G以上用户体验
数字人视频制作软件LatentSync整合包下载链接
1.5版本下载链接:
相关推荐
音频驱动口型超逼真数字人视频制作软件Sonic整合包下载
字节跳动唇形同步数字人视频制作软件LatentSync整合包使用说明视频教程
图片数字人视频制作软件LivePortrait整合包下载,图片转视频动物人物表情转移工具
超强AI数字人EchoMimicV2一张半身照片即可生成一段主播解说视频,整合包下载
音频驱动口型数字人视频制作软件VideoReTalking整合包,音频视频人物对口型
音频驱动数字人视频制作EchoMimic整合包,免费让照片图片开口说话的软件
音频驱动口型生成视频软件video-retalking整合包免费下载,基于音频的唇形同步工具
2D照片转3D视频软件stable-virtual-camera免安装一键启动整合包下载
最近更新

AI描述万物软件describe-anything整合包,精准描述图片视频中指定区域内容
本次和大家分享一个英伟达联合其他大学开发的一款应用describe-anything,该应用可以通过AI识别分析并详细描述图片视频中指定区域物体内容,我基于最新版制作了免安装一键启动整合包。 describe-anything介绍 Desc...

高效可控歌曲生成器ACE-Step一键启动整合包,音乐人的歌曲创作利器
又一款AI歌曲创作利器:ACE-Step,ACE-Step是刚发布不久的AI自动谱曲AI自动演唱软件,软件在歌曲生成速度、音乐连贯性和可控性上相对同类软件有了较大提升。ACE-Step在3小时前刚发布了新版本,我基于当前最新版本制作了免安装...

超逼真对话型文字转语音软件Dia-1.6B免安装一键启动整合包下载
本次分享一个刚出的超逼真对话型文字转语音软件Dia-1.6B,这个TTS软件不像传统的文字转语音那样,Dia可以生成对话音频,还可以生成非语言音效,如笑声,咳嗽,清嗓子等,还支持声音克隆。我基于当前Dia最新版本制作了免安装一键启动整合包。...

高精度2D图片转3D网格模型软件Stable3DGen整合包下载
本次和大家分享另一个非常牛叉的图片转3D模型软件Stable3DGen,从官方演示对比来看,效果要好于我之前分享的腾讯混元3D和TRELLIS,精度更高更细腻。基于当前最新版本我制作了一键启动整合包。 Stable3DGen介绍 随着从二维...

2D照片转3D视频软件stable-virtual-camera免安装一键启动整合包下载
本次和大家分享一个好玩实用的2D图片转3D视频软件stable-virtual-camera,支持多种相机模式,生成的3D视频效果丰富多样,适合多种使用场景,我基于当前最新版本制作了免安装一键启动整合包。 stable-virtual-ca...

AI歌曲创作软件DiffRhythm一键启动包,自定义风格AI谱曲演唱
DiffRhythm是首个基于扩散技术的开源音乐生成模型,能够创作完整的歌曲,包括AI谱曲,AI演唱。基于当前最新V1.2版本我制作了免安装一键启动整合包。 DiffRhythm介绍 Di♪♪Rhythm:速度惊人、简单至极、具有潜在扩散的...

虚拟试衣产品设计多图合成软件UNO一键启动整合包,人物转动漫工具
UNO是字节跳动开发的一款多主体图像生成软件,解决了角色或物体一致性的问题,可用于漫画、虚拟试衣等场景。我基于当前最新版本制作了免安装一键启动整合包。 UNO介绍 UNO是一款基于扩散模型的AI图像生成工具,核心目标是解决AI生成图像时难以...

临时邮箱,一次性匿名gmail.com邮箱
有时候网站需要测试一些功能,比如注册登录等,需要用到邮箱,但是自己的邮箱有限,不能更多的测试效果,这时候就需要一些不同后缀的一次性邮箱,网上有很多这样的一次性匿名邮箱,后缀很多,非常适合测试使用,下面分享几个比较好用的临时邮箱。 Gmail...

免费AI视频生成软件FramePack整合包下载,本地离线AI图片转视频工具
前段时间阿里开源了一个AI视频生成工具WAN2.1,可以实现文本转视频和图片转视频,虽说很强大,但是测试之后感觉软件对电脑配置要求太高了,感觉应该大部分用户都用不了,而且只支持720P视频,清晰度有些低,所以没和大家分享。前些天又出了一个更...

PDF OCR图片文字内容识别软件OCRmyPDF下载,免费PDF扫描内容转可搜索可复制工具
本次和大家分享一个非常热门强大的PDF文件内容OCR识别软件OCRmyPDF,这个软件可以将PDF内不可搜索的图片和文字识别转换为可复制可搜索的文本,并对PDF文件进行优化。 OCRmyPDF介绍 OCRmyPDF 为扫描的 PDF 文件添...