# 抖音 @Theodore《H3 分段长视频生成工作流 V6》完整语音转写 - 音频:视频原声 10:44.2(单声道 16kHz) - 工具:本机 CPU 版 faster-whisper large-v3(int8,8 线程,**未占用 GPU**) - 参数:language=zh,beam_size=1,vad_filter=True,condition_on_previous_text=False - 段数:236 | 时间戳为起始秒 - ⚠️ 纯语音识别结果,未逐字校对;有少量同音误听(如「井号」→「仅号」、「lightx2v」→「Light S2V」、「latent」→「Layton」),已在主报告中按屏幕文字更正 ```text [ 0.2] OK啊,几天不见,咱们的这个H3的分段参考生视频工作流已经更新到V6版本了 [ 21.1] 给新来的小伙伴们说一下,我最近一直致力于开发H3分段参考生成视频的工作流 [ 27.8] 这个工作流的效果呢,是可以打破H3模型本身一次只能生成15秒的上限 [ 34.8] 通过对长视频分段生成的方式,可以把一个长达十几分钟甚至一个小时的视频 [ 40.4] 拆分成多段来分段生成 [ 43.1] 目前的V6版本 [ 44.8] 也是借鉴了社区的方案分享 [ 47.1] 通过Latent传递上下文的方式 [ 49.0] 来保证段间连续性 [ 51.0] 并且性能开销也保留了 [ 53.2] 从V2版本优化性能后的特点 [ 56.3] 那就是不论生成多少段 [ 58.7] 只要你成功生成了第二段 [ 60.7] 那么就意味着 [ 62.0] 后面的所有段数 [ 63.6] 你的电脑都能完全带得动 [ 65.2] 它并不会因为段数的增加 [ 67.5] 而在你的电脑性能开销上 [ 69.9] 产生堆积 [ 70.6] 这个即使拿到全网对比 [ 72.7] 我这套工作流的性能优化方案 [ 74.9] 应该都是顶尖的 [ 76.2] 然后是对这个工作流 [ 78.6] 怎么使用进行讲解 [ 80.3] 首先我们以V6的单次采样版本为例 [ 83.3] 当用户拿到这个工作流的时候 [ 85.1] 可以看到这里是有一个分段数量 [ 88.1] 随机种子和各段时长表 [ 90.0] 还有一个运行名称的 [ 91.1] 首先看一下这里的分段数量 [ 93.0] 你要生成10段视频 [ 94.1] 在这里就写10 [ 95.5] 然后你需要对它们填入每段的时长 [ 98.7] 每段的时长用户是可以自定义的 [ 101.5] 但是你一定要保证这里的数字的个数 [ 104.1] 跟分段的数量是对上的 [ 105.9] 这里我们有12个 [ 107.2] 那我们就得删掉两个 [ 108.9] 要注意表之间的数字需要用英文逗号分隔 [ 111.7] 最后一个数字后面是不需要加逗号的 [ 113.9] 然后这里是一个运行名称 [ 115.6] 它其实就是你最后输出的那个视频 [ 118.5] 以及中间产物存放的文件夹的名称 [ 121.2] 为了避免输出的内容混放 [ 123.3] 每次在不同的任务生成的时候 [ 125.8] 记得把运行名称改掉 [ 127.7] 然后这里是写提示词的部分 [ 129.8] 它用来告诉H3你具体要生成的视频内容 [ 133.4] 我这里写了10段分段数量 [ 135.3] 那我就必须在这里填满10个H3提示词的输入框 [ 139.5] 需要注意的是这里只预留了12个完整的提示词输入框 [ 143.3] 如果你的分段数量设置大于12 [ 145.8] 那么需要在这里修改 [ 147.7] 比如说你要生成15个视频 [ 151.4] 那么就把这里的12改到15 [ 153.0] 然后点击更新输入之后 [ 155.2] 它会多出来三个接口 [ 156.4] 然后你随便挑一个输入框复制一下 [ 158.7] 再改一下名字 [ 159.6] 再重复一下 [ 160.9] 建完之后 [ 161.7] 把它们有序连接到这里就可以了 [ 164.4] 然后是图像输入的部分 [ 166.2] 这里预制了很多图像桥接的接口 [ 169.2] 它们其实就是连接H3传入参考图的地方 [ 173.2] 用户只需要把这个图像接口拉出来 [ 175.8] 然后在弹出来的下拉菜单中选择加载图像 [ 179.0] 然后再选择对应的文件上传 [ 180.8] 就能把这个参考图上传到工作流中 [ 184.4] 如果你还需要对视频进行参考 [ 188.6] 也就是所谓的视频升视频 [ 191.0] 首先你需要一个加载视频的一个节点 [ 193.4] 然后把这个视频连入一个获取视频元素 [ 197.5] 或者get video complements [ 199.2] 再把这个视频中的图像 [ 201.2] 序列连接到rev video 0中 [ 204.2] 如果你同时需要这个视频中的声音信息 [ 207.9] 那么你就把audio连接到这个对应的 [ 211.9] rev video audio 0中 [ 214.3] 当然你也可以继续添加更多的视频 [ 216.5] 这里还有Ref Video 1 [ 218.2] 以及Ref Video Audio 1和2 [ 220.8] 如果你只是想上传一段音频 [ 224.2] 比如说作为一个人物的音色参考 [ 226.3] 那么同理 [ 227.0] 可以使用这个加载音频 [ 228.8] 选择文件上传之后 [ 230.2] 把音频连接到这个单独的Ref Audio中 [ 233.4] 注意啊 [ 234.6] 这里还有一个Ref Video Audio [ 236.1] 是视频的音轨 [ 237.3] 不要弄混了 [ 238.3] 同样的Ref Audio还有它的1和2 [ 240.6] 上传完所有的参考素材之后呢 [ 242.8] 接下来是视频分辨率的选择 [ 245.6] 有长宽比以及具体的百万像素 [ 248.1] 这个跟官方模板中的内容是一模一样的 [ 251.4] 具体的分辨率可以参考官方的质量表格 [ 254.6] 然后是V3版本中添加的加速节点部分 [ 259.4] 目前我们选用的是一个Tobu LoRa和一个Siga Tension [ 263.8] 以及一个降低显存用的LoFi RAM关组注意力机制 [ 267.0] 你只需要把这里的模型放在到Configure UI的Model LoRa的文件夹中 [ 271.6] 并且安装这个Tobolora节点就可以使用了 [ 275.1] 然后这里是impact的循环总控 [ 278.0] 它就是用来控制你当前具体执行的分段生成到哪一段了 [ 283.0] 如果这里value为0 [ 284.1] 那么意思是执行的是第一段 [ 285.8] 它是会自动更新的 [ 287.9] 并且自动更新的值会直接影响下一次循环从哪开始 [ 292.0] 如果你的视频正常在生成中 [ 294.9] 那么请不要手动修改这个值 [ 297.8] 如果您是在分段生成的中途取消了任务 [ 300.2] 想要重新生成 [ 301.3] 那么你可以通过修改这个值 [ 303.4] 来确定重新开始的起点 [ 305.4] 比如说你在生成第六段的时候终止了 [ 308.8] 此时第一到第五段已经完成生成 [ 311.5] 下一次你在打开这张工作流的时候 [ 313.8] 你需要在运行名称不变的情况下 [ 317.0] 把这里的value改为5 [ 318.7] 让它来生成第六段 [ 320.1] 然后是单段生成的核心 [ 322.4] 这里其实就是跟官方模板的后半部分相近 [ 326.3] 无非就是对视频做了一个裁切的动作 [ 328.9] 我们这里就不多赘述了 [ 331.2] 用户也不需要修改这里的参数 [ 333.7] 然后是impact对列调度的部分 [ 336.5] 在第一段视频生成的时候 [ 338.3] 把它的最后几十帧给抽取出来 [ 340.9] 并且保存到本地 [ 342.4] 然后在第二段视频生成时 [ 344.7] 这个调度器会读取之前保存的音视频latent [ 349.0] 作为第二段视频的开头参考 [ 351.3] 第六版本也正是通过这保存到本地的音视频尾帧 [ 355.7] 来确保分段视频生成时的断间一致性 [ 359.3] 这也是目前社区验证过的最优方案 [ 362.2] 这里有两个数值 [ 363.7] 分别是音频截取的帧数和视频截取的帧数 [ 367.3] 一般来说我们这个数值设置的越大 [ 370.1] 那么保存的帧数就越多 [ 372.4] 那么视频生成的连续性也就会越强 [ 375.0] 但是它的代价就是在下一次生成时占用的时间越多 [ 380.5] 比如说第一段视频是15秒的 [ 383.5] 第二段视频由于使用了22帧来保证视频的连续性 [ 387.5] 那么实际生成的15秒视频里面就有一秒 [ 390.4] 是跟上一段视频的最后重复的 [ 393.4] 一秒差不多是24帧 [ 395.0] 这个数越大 [ 396.5] 那么段间连续性就越好 [ 398.8] 同时占用第二段的重复时长也就会变多 [ 402.3] 这里会给出一张表格 [ 403.7] 里面有几个比较推荐使用的参考Layton的帧数 [ 408.2] 在保存Layton之后 [ 409.8] 我们还有一个伪帧保存的机制 [ 413.4] 这个是在前几个版本的分段生成工作流中延续下来的 [ 417.9] 在V1到V5的版本中 [ 419.7] 都是通过这个保存的尾针来进行下一段视频的手针参考生成 [ 425.0] V6版本已经全面改用音视频layton作为断键移植性保持的工具 [ 430.0] 所以尾针在此处仅做一个预览或者完成的标记 [ 434.2] 如果这一段的尾针落盘了 [ 436.2] 那么意味着这段就已经彻底完成了 [ 438.9] 请不要随意删除落盘的尾针 [ 441.2] 它会对这个工作流的校验产生一定的影响 [ 445.0] OK回到主线 [ 446.9] 我们的V字其实是做了四个版本的 [ 449.5] 其实就是单采双采和 [ 451.1] 是否整合提示词的一个 [ 452.9] 两种情况的一个D卡耳机 [ 454.4] 我们先来看整合提示词版本 [ 456.8] 注意整合提示词版本 [ 458.4] 只是在提示词输入的部分改成了另一种方式 [ 461.9] 后面所有的内容都是没有变化的 [ 465.2] 也就是说跟之前的讲解是完全通用的 [ 467.8] 具体提示词的填写方法 [ 470.1] 改成了视频中这样 [ 471.8] 我们使用三个等号来做段间的分割 [ 475.5] 然后用两个and符号来框取一个每段的时长 [ 480.4] 这种使用方法相对来说比较方便 [ 483.5] 比如说我想要添加第13段 [ 486.4] 那么我只需要输入三个等号 [ 489.5] 然后在仅号后加上第13段 [ 494.1] 以及对应的描述 [ 495.6] 注意这个仅号后的内容是仅做用户提示的 [ 499.5] 用两个and符号 [ 500.5] 框选一个用户自定的时长 [ 502.9] 比如说15秒钟 [ 503.9] 作为这一段的具体时长 [ 506.9] 然后开始填写故事的具体内容的提示词 [ 510.8] 后续脚本会自动解析 [ 513.0] 你的当前段长以及提示词的正文 [ 516.2] 然后当前段提示词的正文 [ 518.2] 也会在这个文本框中输出作为预览 [ 521.3] 注意这里的参数也都不要修改 [ 524.5] OK [ 526.6] 然后我们再来讲一下双彩 [ 528.2] 同样 [ 529.7] 为了最大程度保留用户的使用习惯 [ 533.5] 其他所有的组件都是一样的 [ 537.3] 没有进行任何的修改 [ 538.6] 唯一的变化就是双材质部分 [ 540.9] 二次采样这里我们使用了一个Light S2V的一个模型 [ 545.1] 用户需要自行下载这个模型 [ 547.3] 并且放在Modos Lora下 [ 549.1] Lora之后还是照样两个加速节点 [ 552.2] 这个跟上面的加速节点使用方法一模一样 [ 555.9] 参数部分能改的不多 [ 558.7] 一个是LORA模型的强度和基础调度器的降噪 [ 566.0] 这两者共同决定了双彩的影响 [ 568.4] 模型强度或者降噪强度越高 [ 571.1] 那么二彩的细节修复就会越强 [ 573.4] 但是出现其他影响画面的问题的可能性也会对应的提高 [ 578.7] 而模型强度和降噪强度越低 [ 581.8] 那么二彩的视频就会越接近一彩 [ 584.6] 目前推荐的LORA模型强度是在0.3到0.55之间 [ 589.0] 而降噪强度是0.2到0.35之间 [ 593.0] 小伙伴们可以自行尝试 [ 595.0] 最适合的参数值 [ 597.4] 当然你也可以直接使用我视频中的 [ 600.1] 模型强度0.5加降噪0.3 [ 602.4] 还有一个要注意的节点就是这个超分节点 [ 605.4] 它是用来控制你二彩具体的视频分辨率提升 [ 608.7] 如果我一彩全核是480p [ 611.0] 那么1.5倍之后 [ 612.7] 它就会变成一个720p的视频 [ 614.2] 当然你也可以随便调整它的值 [ 616.2] 具体的使用方式 [ 618.1] 以及RTX Note不可用时的兼容方案 [ 621.2] 可以参考我的往期视频 [ 622.7] 如果您觉得这个工作流有用 [ 624.6] 可以给我点赞收藏加关注支持一下 [ 627.2] 如果有技术上的问题 [ 628.8] 可以在评论区留下你的留言 [ 630.8] 配套的工作流素材等都放在主页的粉丝群中了 [ 635.8] 我们下期再见 [ 637.5] 下期主要内容是 [ 639.8] V6工作流使用过程中的疑难杂症解答 ```