视频完整转写-236段.txt

# 抖音 @Theodore《H3 分段长视频生成工作流 V6》完整语音转写

- 音频:视频原声 10:44.2(单声道 16kHz)
- 工具:本机 CPU 版 faster-whisper large-v3(int8,8 线程,**未占用 GPU**)
- 参数:language=zh,beam_size=1,vad_filter=True,condition_on_previous_text=False
- 段数:236 | 时间戳为起始秒
- ⚠️ 纯语音识别结果,未逐字校对;有少量同音误听(如「井号」→「仅号」、「lightx2v」→「Light S2V」、「latent」→「Layton」),已在主报告中按屏幕文字更正

```text
[    0.2] OK啊,几天不见,咱们的这个H3的分段参考生视频工作流已经更新到V6版本了
[   21.1] 给新来的小伙伴们说一下,我最近一直致力于开发H3分段参考生成视频的工作流
[   27.8] 这个工作流的效果呢,是可以打破H3模型本身一次只能生成15秒的上限
[   34.8] 通过对长视频分段生成的方式,可以把一个长达十几分钟甚至一个小时的视频
[   40.4] 拆分成多段来分段生成
[   43.1] 目前的V6版本
[   44.8] 也是借鉴了社区的方案分享
[   47.1] 通过Latent传递上下文的方式
[   49.0] 来保证段间连续性
[   51.0] 并且性能开销也保留了
[   53.2] 从V2版本优化性能后的特点
[   56.3] 那就是不论生成多少段
[   58.7] 只要你成功生成了第二段
[   60.7] 那么就意味着
[   62.0] 后面的所有段数
[   63.6] 你的电脑都能完全带得动
[   65.2] 它并不会因为段数的增加
[   67.5] 而在你的电脑性能开销上
[   69.9] 产生堆积
[   70.6] 这个即使拿到全网对比
[   72.7] 我这套工作流的性能优化方案
[   74.9] 应该都是顶尖的
[   76.2] 然后是对这个工作流
[   78.6] 怎么使用进行讲解
[   80.3] 首先我们以V6的单次采样版本为例
[   83.3] 当用户拿到这个工作流的时候
[   85.1] 可以看到这里是有一个分段数量
[   88.1] 随机种子和各段时长表
[   90.0] 还有一个运行名称的
[   91.1] 首先看一下这里的分段数量
[   93.0] 你要生成10段视频
[   94.1] 在这里就写10
[   95.5] 然后你需要对它们填入每段的时长
[   98.7] 每段的时长用户是可以自定义的
[  101.5] 但是你一定要保证这里的数字的个数
[  104.1] 跟分段的数量是对上的
[  105.9] 这里我们有12个
[  107.2] 那我们就得删掉两个
[  108.9] 要注意表之间的数字需要用英文逗号分隔
[  111.7] 最后一个数字后面是不需要加逗号的
[  113.9] 然后这里是一个运行名称
[  115.6] 它其实就是你最后输出的那个视频
[  118.5] 以及中间产物存放的文件夹的名称
[  121.2] 为了避免输出的内容混放
[  123.3] 每次在不同的任务生成的时候
[  125.8] 记得把运行名称改掉
[  127.7] 然后这里是写提示词的部分
[  129.8] 它用来告诉H3你具体要生成的视频内容
[  133.4] 我这里写了10段分段数量
[  135.3] 那我就必须在这里填满10个H3提示词的输入框
[  139.5] 需要注意的是这里只预留了12个完整的提示词输入框
[  143.3] 如果你的分段数量设置大于12
[  145.8] 那么需要在这里修改
[  147.7] 比如说你要生成15个视频
[  151.4] 那么就把这里的12改到15
[  153.0] 然后点击更新输入之后
[  155.2] 它会多出来三个接口
[  156.4] 然后你随便挑一个输入框复制一下
[  158.7] 再改一下名字
[  159.6] 再重复一下
[  160.9] 建完之后
[  161.7] 把它们有序连接到这里就可以了
[  164.4] 然后是图像输入的部分
[  166.2] 这里预制了很多图像桥接的接口
[  169.2] 它们其实就是连接H3传入参考图的地方
[  173.2] 用户只需要把这个图像接口拉出来
[  175.8] 然后在弹出来的下拉菜单中选择加载图像
[  179.0] 然后再选择对应的文件上传
[  180.8] 就能把这个参考图上传到工作流中
[  184.4] 如果你还需要对视频进行参考
[  188.6] 也就是所谓的视频升视频
[  191.0] 首先你需要一个加载视频的一个节点
[  193.4] 然后把这个视频连入一个获取视频元素
[  197.5] 或者get video complements
[  199.2] 再把这个视频中的图像
[  201.2] 序列连接到rev video 0中
[  204.2] 如果你同时需要这个视频中的声音信息
[  207.9] 那么你就把audio连接到这个对应的
[  211.9] rev video audio 0中
[  214.3] 当然你也可以继续添加更多的视频
[  216.5] 这里还有Ref Video 1
[  218.2] 以及Ref Video Audio 1和2
[  220.8] 如果你只是想上传一段音频
[  224.2] 比如说作为一个人物的音色参考
[  226.3] 那么同理
[  227.0] 可以使用这个加载音频
[  228.8] 选择文件上传之后
[  230.2] 把音频连接到这个单独的Ref Audio中
[  233.4] 注意啊
[  234.6] 这里还有一个Ref Video Audio
[  236.1] 是视频的音轨
[  237.3] 不要弄混了
[  238.3] 同样的Ref Audio还有它的1和2
[  240.6] 上传完所有的参考素材之后呢
[  242.8] 接下来是视频分辨率的选择
[  245.6] 有长宽比以及具体的百万像素
[  248.1] 这个跟官方模板中的内容是一模一样的
[  251.4] 具体的分辨率可以参考官方的质量表格
[  254.6] 然后是V3版本中添加的加速节点部分
[  259.4] 目前我们选用的是一个Tobu LoRa和一个Siga Tension
[  263.8] 以及一个降低显存用的LoFi RAM关组注意力机制
[  267.0] 你只需要把这里的模型放在到Configure UI的Model LoRa的文件夹中
[  271.6] 并且安装这个Tobolora节点就可以使用了
[  275.1] 然后这里是impact的循环总控
[  278.0] 它就是用来控制你当前具体执行的分段生成到哪一段了
[  283.0] 如果这里value为0
[  284.1] 那么意思是执行的是第一段
[  285.8] 它是会自动更新的
[  287.9] 并且自动更新的值会直接影响下一次循环从哪开始
[  292.0] 如果你的视频正常在生成中
[  294.9] 那么请不要手动修改这个值
[  297.8] 如果您是在分段生成的中途取消了任务
[  300.2] 想要重新生成
[  301.3] 那么你可以通过修改这个值
[  303.4] 来确定重新开始的起点
[  305.4] 比如说你在生成第六段的时候终止了
[  308.8] 此时第一到第五段已经完成生成
[  311.5] 下一次你在打开这张工作流的时候
[  313.8] 你需要在运行名称不变的情况下
[  317.0] 把这里的value改为5
[  318.7] 让它来生成第六段
[  320.1] 然后是单段生成的核心
[  322.4] 这里其实就是跟官方模板的后半部分相近
[  326.3] 无非就是对视频做了一个裁切的动作
[  328.9] 我们这里就不多赘述了
[  331.2] 用户也不需要修改这里的参数
[  333.7] 然后是impact对列调度的部分
[  336.5] 在第一段视频生成的时候
[  338.3] 把它的最后几十帧给抽取出来
[  340.9] 并且保存到本地
[  342.4] 然后在第二段视频生成时
[  344.7] 这个调度器会读取之前保存的音视频latent
[  349.0] 作为第二段视频的开头参考
[  351.3] 第六版本也正是通过这保存到本地的音视频尾帧
[  355.7] 来确保分段视频生成时的断间一致性
[  359.3] 这也是目前社区验证过的最优方案
[  362.2] 这里有两个数值
[  363.7] 分别是音频截取的帧数和视频截取的帧数
[  367.3] 一般来说我们这个数值设置的越大
[  370.1] 那么保存的帧数就越多
[  372.4] 那么视频生成的连续性也就会越强
[  375.0] 但是它的代价就是在下一次生成时占用的时间越多
[  380.5] 比如说第一段视频是15秒的
[  383.5] 第二段视频由于使用了22帧来保证视频的连续性
[  387.5] 那么实际生成的15秒视频里面就有一秒
[  390.4] 是跟上一段视频的最后重复的
[  393.4] 一秒差不多是24帧
[  395.0] 这个数越大
[  396.5] 那么段间连续性就越好
[  398.8] 同时占用第二段的重复时长也就会变多
[  402.3] 这里会给出一张表格
[  403.7] 里面有几个比较推荐使用的参考Layton的帧数
[  408.2] 在保存Layton之后
[  409.8] 我们还有一个伪帧保存的机制
[  413.4] 这个是在前几个版本的分段生成工作流中延续下来的
[  417.9] 在V1到V5的版本中
[  419.7] 都是通过这个保存的尾针来进行下一段视频的手针参考生成
[  425.0] V6版本已经全面改用音视频layton作为断键移植性保持的工具
[  430.0] 所以尾针在此处仅做一个预览或者完成的标记
[  434.2] 如果这一段的尾针落盘了
[  436.2] 那么意味着这段就已经彻底完成了
[  438.9] 请不要随意删除落盘的尾针
[  441.2] 它会对这个工作流的校验产生一定的影响
[  445.0] OK回到主线
[  446.9] 我们的V字其实是做了四个版本的
[  449.5] 其实就是单采双采和
[  451.1] 是否整合提示词的一个
[  452.9] 两种情况的一个D卡耳机
[  454.4] 我们先来看整合提示词版本
[  456.8] 注意整合提示词版本
[  458.4] 只是在提示词输入的部分改成了另一种方式
[  461.9] 后面所有的内容都是没有变化的
[  465.2] 也就是说跟之前的讲解是完全通用的
[  467.8] 具体提示词的填写方法
[  470.1] 改成了视频中这样
[  471.8] 我们使用三个等号来做段间的分割
[  475.5] 然后用两个and符号来框取一个每段的时长
[  480.4] 这种使用方法相对来说比较方便
[  483.5] 比如说我想要添加第13段
[  486.4] 那么我只需要输入三个等号
[  489.5] 然后在仅号后加上第13段
[  494.1] 以及对应的描述
[  495.6] 注意这个仅号后的内容是仅做用户提示的
[  499.5] 用两个and符号
[  500.5] 框选一个用户自定的时长
[  502.9] 比如说15秒钟
[  503.9] 作为这一段的具体时长
[  506.9] 然后开始填写故事的具体内容的提示词
[  510.8] 后续脚本会自动解析
[  513.0] 你的当前段长以及提示词的正文
[  516.2] 然后当前段提示词的正文
[  518.2] 也会在这个文本框中输出作为预览
[  521.3] 注意这里的参数也都不要修改
[  524.5] OK
[  526.6] 然后我们再来讲一下双彩
[  528.2] 同样
[  529.7] 为了最大程度保留用户的使用习惯
[  533.5] 其他所有的组件都是一样的
[  537.3] 没有进行任何的修改
[  538.6] 唯一的变化就是双材质部分
[  540.9] 二次采样这里我们使用了一个Light S2V的一个模型
[  545.1] 用户需要自行下载这个模型
[  547.3] 并且放在Modos Lora下
[  549.1] Lora之后还是照样两个加速节点
[  552.2] 这个跟上面的加速节点使用方法一模一样
[  555.9] 参数部分能改的不多
[  558.7] 一个是LORA模型的强度和基础调度器的降噪
[  566.0] 这两者共同决定了双彩的影响
[  568.4] 模型强度或者降噪强度越高
[  571.1] 那么二彩的细节修复就会越强
[  573.4] 但是出现其他影响画面的问题的可能性也会对应的提高
[  578.7] 而模型强度和降噪强度越低
[  581.8] 那么二彩的视频就会越接近一彩
[  584.6] 目前推荐的LORA模型强度是在0.3到0.55之间
[  589.0] 而降噪强度是0.2到0.35之间
[  593.0] 小伙伴们可以自行尝试
[  595.0] 最适合的参数值
[  597.4] 当然你也可以直接使用我视频中的
[  600.1] 模型强度0.5加降噪0.3
[  602.4] 还有一个要注意的节点就是这个超分节点
[  605.4] 它是用来控制你二彩具体的视频分辨率提升
[  608.7] 如果我一彩全核是480p
[  611.0] 那么1.5倍之后
[  612.7] 它就会变成一个720p的视频
[  614.2] 当然你也可以随便调整它的值
[  616.2] 具体的使用方式
[  618.1] 以及RTX Note不可用时的兼容方案
[  621.2] 可以参考我的往期视频
[  622.7] 如果您觉得这个工作流有用
[  624.6] 可以给我点赞收藏加关注支持一下
[  627.2] 如果有技术上的问题
[  628.8] 可以在评论区留下你的留言
[  630.8] 配套的工作流素材等都放在主页的粉丝群中了
[  635.8] 我们下期再见
[  637.5] 下期主要内容是
[  639.8] V6工作流使用过程中的疑难杂症解答
```
下载此文件