[00:00:00.000 - 00:00:12.720] MiniMax H3现在只需要三步采样了,最近阿里的TaoLab AIJC团队发布了一套新的MiniMax H3的加速方案,叫做TaoMate-H3。 [00:00:13.180 - 00:00:21.300] 以前我们常见的就是八步或者四步的Turbo LoRa,TaoMate-H3直接把这个采样压缩到了三步。 [00:00:21.300 - 00:00:30.800] 对于官方的演示来看,无论是自然风景、人物口播、产品展示还是科幻场景,第一眼的质量都还是相当不错的。 [00:00:30.920 - 00:00:39.380] 但是我的第一反应不是以后所有的H3都使用三步采样,那我的问题是三步这么快,它到底牺牲了什么? [00:00:39.660 - 00:00:48.620] 所以这期视频我们不会只给大家展示几个好看的结果,那我们会把TaoMate-H3放进ComfyUI,分别测试四种场景。 [00:00:48.620 - 00:00:50.400] 第一种就是大脸低动作。 [00:00:50.620 - 00:00:51.280] 第二个就是演示。 [00:00:51.300 - 00:00:53.060] 第三种就是延迟摄影当中的复杂光影。 [00:00:53.340 - 00:00:57.180] 第三种就是两位古典美女的快速笔键。 [00:00:57.700 - 00:01:01.740] 第四个是复杂的一个产品解构的视频。 [00:01:02.060 - 00:01:05.300] 测试结果应该说既有惊喜也有惊吓。 [00:01:05.500 - 00:01:08.320] 下面我们就先从准备工作开始。 [00:01:08.680 - 00:01:15.260] TaoMate-H3官方的模型是不能在ComfyUI里面直接使用的,我们必须下载这个转化的版本。 [00:01:15.680 - 00:01:19.620] 目前我们能找到的转化版本有很多,我重点介绍两个。 [00:01:19.620 - 00:01:21.120] 第一个来自于Robot。 [00:01:21.300 - 00:01:32.820] 它的大小大概是2.48G,这个版本只是格式转换,没有训练,这期后面所有的测试我们使用的都是它。 [00:01:32.820 - 00:01:41.520] 第二个是来自于KJ,它采用了平均Rank19,当前文件的大小只有182MB。 [00:01:41.520 - 00:01:50.620] 无论你使用哪个版本,安装的方法都是一样的,我们只需要将这个模型文件给它放到ComfyUI Models目录下。 [00:01:50.620 - 00:01:53.280] 再加上在领域里面的lauras文件夹里面就可以了。 [00:01:53.280 - 00:01:56.240] 因为这方便也是,我也把工作流构建到了RunningHub上。 [00:01:56.240 - 00:01:58.140] 下面我们简单说一下这个工作流。 [00:01:58.140 - 00:02:01.640] 这期视频里面我们给大家准备了两套工作流。 [00:02:02.040 - 00:02:04.840] 第一套是首尾针的这个工作流。 [00:02:04.840 - 00:02:07.800] 第二套是参考生成的工作流。 [00:02:07.980 - 00:02:14.460] 这两套工作流的基本结构是一样的,关键只有这个条件节点不一样。 [00:02:14.460 - 00:02:17.620] 首尾针使用的是Image-to-Video。 [00:02:17.620 - 00:02:20.420] 而我们的参考视频使用的是Reference-to-Video。 [00:02:20.620 - 00:02:24.500] 那Talmate H3需要加载一个三部的Laura [00:02:24.500 - 00:02:26.220] 就是大家现在看到的这个 [00:02:26.220 - 00:02:27.720] 它的强度呢 [00:02:27.720 - 00:02:29.200] 我们给的是1.0 [00:02:29.200 - 00:02:30.180] 大家注意啊 [00:02:30.180 - 00:02:31.500] 这个Laura呢 [00:02:31.500 - 00:02:34.900] 它是同时可以使用到首尾针 [00:02:34.900 - 00:02:38.040] 或者是参考生成的工作流上的 [00:02:38.040 - 00:02:39.100] 那主模型呢 [00:02:39.100 - 00:02:40.380] 我们给大家两种选择 [00:02:40.380 - 00:02:40.980] 第一种呢 [00:02:40.980 - 00:02:45.500] 就是大家可以采用官方的MiniMax H3的模型 [00:02:45.500 - 00:02:46.820] 第二种呢 [00:02:46.820 - 00:02:48.560] 就是Singularity [00:02:48.560 - 00:02:50.620] 就是我们之前给大家讲到的一个模型 [00:02:50.620 - 00:02:52.780] 它整体的效果呢 [00:02:52.780 - 00:02:53.700] 也是不错的 [00:02:53.700 - 00:02:55.320] 那这个模型接入之后呢 [00:02:55.320 - 00:02:56.320] 我们首先啊 [00:02:56.320 - 00:02:57.540] 接入了一个节点啊 [00:02:57.540 - 00:03:01.900] 这个节点叫做Memory Efficient Sage Attention [00:03:01.900 - 00:03:02.940] 然后呢 [00:03:02.940 - 00:03:04.360] 我们又使用了Soul Attention [00:03:04.360 - 00:03:07.220] 那这套注意力机制的处理方法 [00:03:07.220 - 00:03:09.120] 我们参考了Singularity [00:03:09.120 - 00:03:10.440] 那采样器呢 [00:03:10.440 - 00:03:11.220] 我们是Ola [00:03:11.220 - 00:03:12.520] 调度器呢 [00:03:12.520 - 00:03:13.340] 使用的是Beta [00:03:13.340 - 00:03:14.940] 采样的步数 [00:03:14.940 - 00:03:17.420] 我们直接设置了三步 [00:03:17.420 - 00:03:18.540] 那在分辨率方面 [00:03:18.540 - 00:03:22.540] 我这儿没有使用常见的0.7百万像素 [00:03:22.540 - 00:03:25.920] 而是直接设置了100万像素 [00:03:25.920 - 00:03:27.300] 那整个视频的时长呢 [00:03:27.300 - 00:03:28.500] 我这儿使用的是10秒 [00:03:28.500 - 00:03:30.300] 工作流其他的部分 [00:03:30.300 - 00:03:32.560] 其实和官方的工作流呢 [00:03:32.560 - 00:03:33.820] 是没有什么区别的 [00:03:33.820 - 00:03:34.700] 那在这儿呢 [00:03:34.700 - 00:03:36.080] 我就不逐一解释了 [00:03:36.080 - 00:03:36.860] 下边呢 [00:03:36.860 - 00:03:38.040] 我们直接看测试 [00:03:38.040 - 00:03:39.180] 那第一组测试的 [00:03:39.180 - 00:03:40.680] 我们叫做Big Face [00:03:40.680 - 00:03:41.820] 加上Low Motion [00:03:41.820 - 00:03:43.800] 也就是人物的脸 [00:03:43.800 - 00:03:45.460] 在画面当中占比比较大 [00:03:45.460 - 00:03:46.240] 动作呢 [00:03:46.240 - 00:03:47.780] 以表情变化为主啊 [00:03:47.780 - 00:03:48.520] 没有快速的动作 [00:03:48.540 - 00:03:50.700] 没有快速的转身和大幅的肢体动作 [00:03:50.700 - 00:03:52.260] 那我们的手针呢 [00:03:52.260 - 00:03:55.500] 是一段第一人称的视频通话 [00:03:55.500 - 00:03:57.920] 一个人手里拿着一部竖屏的手机 [00:03:57.920 - 00:04:00.220] 屏幕当中的女友把脸靠在手上 [00:04:00.220 - 00:04:02.900] 卧室当中使用了柔和的暖色灯光 [00:04:02.900 - 00:04:03.720] 那这一组呢 [00:04:03.720 - 00:04:06.120] 我们使用的是手尾针的工作流 [00:04:06.120 - 00:04:08.780] 那在主模型的选择方面呢 [00:04:08.780 - 00:04:10.640] 我们使用了两种不同的模型 [00:04:10.640 - 00:04:14.480] 那我们先来看一下官方的FL2VA模型 [00:04:14.480 - 00:04:18.480] 搭载我们的Talmate的三部Laura [00:04:18.540 - 00:04:19.780] 我们看一下效果 [00:04:19.780 - 00:04:20.460] 一套视频呢 [00:04:20.460 - 00:04:21.500] 非常的漂亮啊 [00:04:21.500 - 00:04:25.420] 女孩从闭眼微笑逐渐变成惊讶和大笑 [00:04:25.420 - 00:04:26.580] 接着鼓起脸颊 [00:04:26.580 - 00:04:28.680] 最后又回到温柔的笑容 [00:04:28.680 - 00:04:29.640] 眼睛眉毛 [00:04:29.640 - 00:04:32.780] 嘴角和面颊的变化都非常的丰富啊 [00:04:32.780 - 00:04:35.880] 不是简单的把嘴巴开合几次 [00:04:35.880 - 00:04:39.480] 更重要的是手机的外框手指的位置 [00:04:39.480 - 00:04:43.100] 视频通话按钮和右下角的小窗口呢 [00:04:43.100 - 00:04:44.460] 是基本稳定的 [00:04:44.460 - 00:04:46.140] 那对于三部采样来说 [00:04:46.140 - 00:04:47.260] 我觉得这个结果呢 [00:04:47.260 - 00:04:48.360] 已经非常具有说服力了 [00:04:48.540 - 00:04:49.580] 下面呢 [00:04:49.580 - 00:04:51.120] 我们来更换一下模型 [00:04:51.120 - 00:04:53.920] 那我们把主模型换成了Singularity [00:04:53.920 - 00:04:54.900] 其他的参数呢 [00:04:54.900 - 00:04:56.100] 保持不变 [00:04:56.100 - 00:04:58.420] 那我们来看一下生成的效果 [00:04:58.420 - 00:05:01.020] Singularity的表情同样自然啊 [00:05:01.020 - 00:05:02.300] 笑容和肤质呢 [00:05:02.300 - 00:05:04.340] 甚至会让人觉得更加柔和 [00:05:04.340 - 00:05:05.720] 但是大家要注意啊 [00:05:05.720 - 00:05:08.460] 当人物靠近镜头的位置 [00:05:08.460 - 00:05:10.680] 当脸部被放大以后啊 [00:05:10.680 - 00:05:15.600] 头发与手机屏幕的边缘发生了空间冲突 [00:05:15.600 - 00:05:18.420] 局部的发丝像是穿过了屏幕边缘 [00:05:18.420 - 00:05:21.060] 出现在本来不应该出现的位置 [00:05:21.060 - 00:05:22.800] 画面单独看很漂亮 [00:05:22.800 - 00:05:26.520] 但是人只能存在于手机屏幕里 [00:05:26.520 - 00:05:29.200] 这个约束没有完全的遵守 [00:05:29.200 - 00:05:30.520] 所以说这一组测试的 [00:05:30.520 - 00:05:35.080] 我更推荐使用官方的FL2VA这个模型 [00:05:35.080 - 00:05:35.800] 第二组测试 [00:05:35.800 - 00:05:38.920] 我们是为了测试一种特殊的摄影效果啊 [00:05:38.920 - 00:05:39.340] 在这儿呢 [00:05:39.340 - 00:05:42.160] 我提供了一张同一人物 [00:05:42.160 - 00:05:44.080] 不同视角的Character Sheet [00:05:44.080 - 00:05:47.560] 在中式的窗户边上生成这样一个角色 [00:05:47.560 - 00:05:48.520] 并且展现 [00:05:48.520 - 00:05:51.460] 出延迟摄影中的太阳运动 [00:05:51.460 - 00:05:55.780] 那太阳透过窗户会把阴影投射在人物的脸上 [00:05:55.780 - 00:05:57.700] 那这种明暗的边界啊 [00:05:57.700 - 00:05:59.860] 要能够正确的显示出来 [00:05:59.860 - 00:06:00.340] 下面呢 [00:06:00.340 - 00:06:02.200] 我们先来看一下Singularity [00:06:02.200 - 00:06:04.000] 它整体表现的一个效果 [00:06:04.000 - 00:06:05.680] 人物本身的很自然 [00:06:05.680 - 00:06:06.580] 面部短发 [00:06:06.580 - 00:06:08.380] 耳饰和深蓝色的旗袍呢 [00:06:08.380 - 00:06:09.700] 都是比较稳定的 [00:06:09.700 - 00:06:11.700] 光线的也有轻微的变化 [00:06:11.700 - 00:06:16.060] 但这种变化更像人物在窗边轻轻移动 [00:06:16.060 - 00:06:18.520] 或者是云遮住了一点太阳 [00:06:18.520 - 00:06:21.260] 并没有那种延迟摄影的感觉 [00:06:21.260 - 00:06:21.780] 然后呢 [00:06:21.780 - 00:06:25.520] 我们再来看一下官方的RF2VA模型 [00:06:25.520 - 00:06:26.860] 我们生成的效果 [00:06:26.860 - 00:06:30.140] 它同样没有把光影快速扫过面部 [00:06:30.140 - 00:06:32.280] 这个延迟摄影的效果呢 [00:06:32.280 - 00:06:33.100] 给表现出来 [00:06:33.100 - 00:06:35.040] 变化的幅度也不够大 [00:06:35.040 - 00:06:35.900] 相比之下 [00:06:35.900 - 00:06:37.660] 官方模型生成的人脸呢 [00:06:37.660 - 00:06:39.740] 让人觉得更像AI脸 [00:06:39.740 - 00:06:43.120] 而Singularity的复制表情和整体的光线 [00:06:43.120 - 00:06:44.080] 会更自然一些 [00:06:44.080 - 00:06:48.440] 问题是两条视频都没有完成最关键的摄影要求 [00:06:48.520 - 00:06:49.640] 下边呢 [00:06:49.640 - 00:06:51.720] 我们再看一下相同场景 [00:06:51.720 - 00:06:54.980] 我们使用Singularity八步才能得到的效果 [00:06:54.980 - 00:06:55.960] 在这个版本里边 [00:06:55.960 - 00:06:59.860] 窗格形成的亮斑和阴影明显扫过人脸的额头 [00:06:59.860 - 00:07:01.780] 眼睛鼻梁和衣服 [00:07:01.780 - 00:07:05.480] 那三步与八步之间的区别不只是锐度 [00:07:05.480 - 00:07:08.180] 而是模型有没有足够的去造过程 [00:07:08.180 - 00:07:11.560] 或者是建立时间加速这个观念 [00:07:11.560 - 00:07:12.300] 第三组呢 [00:07:12.300 - 00:07:13.880] 是测试快速动作的 [00:07:13.880 - 00:07:18.420] 手针里边的两位成年古典女性啊 [00:07:18.420 - 00:07:20.840] 在月夜的庭院里边持剑对峙 [00:07:20.840 - 00:07:24.780] 这里边我们使用的当然是手尾针的工作流 [00:07:24.780 - 00:07:27.000] 那我们先来看一下Singularity [00:07:27.000 - 00:07:28.420] 整体的画面呢 [00:07:28.420 - 00:07:29.580] 其实是很漂亮的 [00:07:29.580 - 00:07:31.020] 粉色和浅绿色的服装 [00:07:31.020 - 00:07:33.800] 月夜竹林和地面的反光都比较稳定 [00:07:33.800 - 00:07:36.500] 两个人也的确完成了连续对打啊 [00:07:36.500 - 00:07:39.920] 但是他并没有解决动作偏慢的问题 [00:07:39.920 - 00:07:43.000] 更明显就是四秒附近啊 [00:07:43.000 - 00:07:45.520] 粉衣人物低头躲剑的时候 [00:07:45.520 - 00:07:47.160] 头部长发 [00:07:47.160 - 00:07:48.400] 剑刃和另一位人 [00:07:48.420 - 00:07:51.120] 人物的宽大衣袖挤在同一个区域 [00:07:51.120 - 00:07:54.060] 局部的遮挡关系表现的非常的不清楚 [00:07:54.060 - 00:07:57.840] 剑的路径和人物的身体也缺少可靠的空间距离 [00:07:57.840 - 00:08:01.380] 那我们再来看一下官方的手尾针模型表现的效果 [00:08:01.380 - 00:08:05.160] 官方模型在前面的转头和闪避里边更加的干净 [00:08:05.160 - 00:08:07.580] 人物的轮廓也更容易毒 [00:08:07.580 - 00:08:08.720] 但是在七秒左右 [00:08:08.720 - 00:08:09.780] 左侧人物转身 [00:08:09.780 - 00:08:12.120] 两人重新交换站位时 [00:08:12.120 - 00:08:15.860] 身体的朝向衣袖之间的连接的出现了问题 [00:08:15.860 - 00:08:16.920] 也就是说呢 [00:08:16.920 - 00:08:18.100] 两条视频 [00:08:18.100 - 00:08:19.200] 失败的位置不同 [00:08:19.200 - 00:08:20.380] 本质却相同 [00:08:20.380 - 00:08:24.580] 三部能够建立两个美女在比肩的整体画面 [00:08:24.580 - 00:08:29.920] 但是却不能够稳定的计算出高速运动当中的整体的运动 [00:08:29.920 - 00:08:30.900] 遮挡关系 [00:08:30.900 - 00:08:32.400] 甚至重心的变化 [00:08:32.400 - 00:08:33.540] 最后一组呢 [00:08:33.540 - 00:08:35.280] 是难度最高的参考生成 [00:08:35.280 - 00:08:37.880] 我们先有一段三维的参考视频 [00:08:37.880 - 00:08:40.280] 一台相机的零件从四周聚集 [00:08:40.280 - 00:08:42.260] 形成了完整的相机 [00:08:42.260 - 00:08:43.280] 随后镜头 [00:08:43.280 - 00:08:44.020] 机身外壳 [00:08:44.020 - 00:08:47.240] 顶部部件和内部电路按正确的层次展开 [00:08:47.240 - 00:08:48.060] 最后呢 [00:08:48.100 - 00:08:49.920] 所有的零件重新组装 [00:08:49.920 - 00:08:51.440] 那这个测试呢 [00:08:51.440 - 00:08:53.180] 我们在上一个视频里边呢 [00:08:53.180 - 00:08:54.140] 已经做过了 [00:08:54.140 - 00:08:57.220] 只不过是我们换了一个模型 [00:08:57.220 - 00:08:59.140] 那这类参考视频的难点呢 [00:08:59.140 - 00:09:00.360] 不是画面好不好看 [00:09:00.360 - 00:09:02.980] 而是运动的逻辑能不能保留 [00:09:02.980 - 00:09:06.100] 那我们先来看一下我们上一个视频当中 [00:09:06.100 - 00:09:07.800] 他测试的这个结果 [00:09:07.800 - 00:09:12.760] 这一条视频的基本保留了参考动画的完整流程 [00:09:12.760 - 00:09:14.620] 零件先聚合成相机 [00:09:14.620 - 00:09:15.660] 然后呢 [00:09:15.660 - 00:09:17.180] 有一个停顿展示 [00:09:17.180 - 00:09:18.060] 随后呢 [00:09:18.100 - 00:09:21.040] 镜头沿着光轴展开 [00:09:21.040 - 00:09:21.940] 顶部的面板 [00:09:21.940 - 00:09:25.920] 电路板和机身外壳保持着清楚的前后关系 [00:09:25.920 - 00:09:27.140] 最后的重新收拢 [00:09:27.140 - 00:09:28.720] 形成了完整的产品 [00:09:28.720 - 00:09:32.820] 那我们再来看一下TOMate的三部模型生成的效果 [00:09:32.820 - 00:09:35.800] 这个结果第一眼觉得非常有视觉冲击力 [00:09:35.800 - 00:09:36.780] 相机是真实的 [00:09:36.780 - 00:09:37.720] 零件很多 [00:09:37.720 - 00:09:39.900] 金属和玻璃的材质也不差 [00:09:39.900 - 00:09:41.740] 但是只要对照参考视频 [00:09:41.740 - 00:09:45.580] 你会发现参考视频里边的逻辑几乎没有保留下来 [00:09:45.580 - 00:09:48.100] 相机的主体一开始就以力 [00:09:48.100 - 00:09:49.360] 这种结构出现了 [00:09:49.360 - 00:09:54.580] 周围的零件更像悬浮在周围的装饰性碎片啊 [00:09:54.580 - 00:09:55.660] 没有按照镜头 [00:09:55.660 - 00:09:56.440] 传感器 [00:09:56.440 - 00:09:57.120] 电路板 [00:09:57.120 - 00:09:59.020] 机身外壳的层次展开 [00:09:59.020 - 00:09:59.620] 所以说呢 [00:09:59.620 - 00:10:03.780] 这个就是三部最危险的一个地方 [00:10:03.780 - 00:10:05.520] 画面的可能好看 [00:10:05.520 - 00:10:06.640] 但是呢 [00:10:06.640 - 00:10:08.040] 你很容易忽略 [00:10:08.040 - 00:10:11.920] 他已经把我们要做的主体任务给做错了 [00:10:11.920 - 00:10:17.140] 那经过四组测试TOMate H3三部Laura的能力边界的已经非常清楚了 [00:10:17.140 - 00:10:17.960] 如果你生成的 [00:10:18.100 - 00:10:19.960] 这种大脸低动作 [00:10:19.960 - 00:10:25.000] 普通的人物表演简单的镜头推进或者是常规的氛围视频 [00:10:25.000 - 00:10:28.660] 他那非常值得去尝试使用不但速度快 [00:10:28.660 - 00:10:30.420] 效果的也会不错 [00:10:30.420 - 00:10:31.600] 那在主模型方面 [00:10:31.600 - 00:10:36.100] 如果非常在意自然的复制或者是较轻的AI感 [00:10:36.100 - 00:10:38.320] 可以尝试使用singularity [00:10:38.320 - 00:10:43.480] 如果最在意构图的边界指令的遵循和结构的准确度 [00:10:43.480 - 00:10:45.240] 那可以使用官方的模型 [00:10:45.240 - 00:10:46.980] 但是除此之外 [00:10:46.980 - 00:10:47.980] 其他 [00:10:47.980 - 00:10:52.420] 的高难度任务可能这个Laura的都是不能胜任的 [00:10:52.420 - 00:10:54.760] 比方说快速的动作 [00:10:54.760 - 00:10:59.980] 比方说特殊的摄影过程还包括高难度的参考生成 [00:10:59.980 - 00:11:04.500] 所以说那一个模型不是单纯的谈他好还是不好 [00:11:04.500 - 00:11:09.160] 而是要搞清楚他到底合用在什么地方好 [00:11:09.160 - 00:11:10.380] 今天我们就说这么多 [00:11:10.380 - 00:11:12.400] 关注我做一个懂爱的人