AI软件下载
有趣网站推荐及实用软件下载

LTX2.3+comfyui音频驱动视频生成工作流

这是一个基于 ComfyUI 的 LTX 2.3 音视频同步生成工作流,核心功能是上传一段音频 + 参考图片(可多张图),自动生成与音频内容对应的视频,适合制作人物说话、唱歌等口型同步视频。工作流使用8位量化版ltx2.3模型,显存需求降低生成速度更快。


主要功能

音频驱动视频生成 上传音频文件后,工作流会自动根据音频时长计算视频帧数,生成内容与音频节奏、时长完全匹配的视频,无需手动设定秒数。

人声分离 内置 MelBandRoFormer 模型,可自动将音频中的人声与背景音乐分离,默认使用分离后的人声驱动视频生成,背景音乐也会保留在最终输出中,也可以通过开关切换使用原始音频。

分段提示词控制 通过 PromptRelayEncodeTimeline 节点,可以在时间轴上为不同片段设置不同的提示词,实现镜头切换、场景变化等效果。

性能优化 集成了 SageAttention 加速和 LTXVChunkFeedForward 分块前馈,在保证画质的同时降低显存占用,大幅提升生成速度。


使用步骤

  1. 在音频输入节点上传 .wav 格式音频文件,设置截取区间(start/end time)
  2. 在图片输入节点上传与音频对应的参考人物图片
  3. 根据需要调整视频分辨率(宽 × 高),默认为竖屏 640 × 1120
  4. 在 Prompt Relay 节点填写全局提示词及分段描述
  5. 运行工作流,结果以 MP4 格式保存输出

分辨率参考

方向可选尺寸
横版848×480 / 960×544 / 1120×640
竖版480×848 / 544×960 / 640×1120
方形512×512 / 768×768

注意事项

  • 音频格式:建议使用 WAV 格式,视频时长由音频时长自动决定
  • 参考图片:图片中人物面部尽量清晰,角度正面效果更佳
  • 显存需求:建议英伟达显卡30系列起,显存 8GB 以上

ltx2.3音频驱动视频生成工作流及模型下载

https://pan.quark.cn/s/186b6dd01260

本工作流文件名为“LTX2.3漫剧视频制作音频参考版.json”


AI软件用不了?2元爽玩4090: 立即体验>>

热门大语言模型API免费体验: 立即获取>>

软件催更及1对1人工答疑支持: https://nuowa.net/1806
赞(0) 打赏
软件无法使用?点击查看常见问题说明>>

最近更新

祝贺凡人修仙传2026年新年番开播同时在线人数超64万-诺瓦小站

祝贺凡人修仙传2026年新年番开播同时在线人数超64万

今天6月13日凡人修仙传新年番开播,同时在线人数破64万(非最高在线人数,只是我看到的在线人数),作为凡人5年老粉,必须发个帖祝贺一下。 我比较喜欢看动漫,各种类型看了很多,具体不清楚多少,像斗罗斗破之类看了一大半终究是没能看下去,还是雾山...

Claude居然自称“本人”-诺瓦小站

Claude居然自称“本人”

今天在和Claude聊网文写作的时候,Claude回复中居然自称本人,这让我有点震惊。 我经常会和AI聊工具功能对比等话题,ChatGPT、Gemini、Claude这些以前我记得从来没有自称过本人的,好像都是本模型,本工具等等,反正从来没...

免费在线HTML转markdown工具

经常看一些在线文档,想复制给AI参考的话不方便直接复制,转换成markdown再给AI阅读会更简单明了,也方便自己查阅,这里给大家推荐两个在线的免费HTML转markdown网站。 1、https://d1tools.com/tools/c...

觉得文章对你有帮助就打赏一下作者

非常感谢你的打赏,我将有更多的动力继续提供优质内容,让我们一起创建更加美好的世界!

支付宝扫一扫

微信扫一扫