transcript.txt

[00:00:00.000 - 00:00:12.720] MiniMax H3现在只需要三步采样了,最近阿里的TaoLab AIJC团队发布了一套新的MiniMax H3的加速方案,叫做TaoMate-H3。
[00:00:13.180 - 00:00:21.300] 以前我们常见的就是八步或者四步的Turbo LoRa,TaoMate-H3直接把这个采样压缩到了三步。
[00:00:21.300 - 00:00:30.800] 对于官方的演示来看,无论是自然风景、人物口播、产品展示还是科幻场景,第一眼的质量都还是相当不错的。
[00:00:30.920 - 00:00:39.380] 但是我的第一反应不是以后所有的H3都使用三步采样,那我的问题是三步这么快,它到底牺牲了什么?
[00:00:39.660 - 00:00:48.620] 所以这期视频我们不会只给大家展示几个好看的结果,那我们会把TaoMate-H3放进ComfyUI,分别测试四种场景。
[00:00:48.620 - 00:00:50.400] 第一种就是大脸低动作。
[00:00:50.620 - 00:00:51.280] 第二个就是演示。
[00:00:51.300 - 00:00:53.060] 第三种就是延迟摄影当中的复杂光影。
[00:00:53.340 - 00:00:57.180] 第三种就是两位古典美女的快速笔键。
[00:00:57.700 - 00:01:01.740] 第四个是复杂的一个产品解构的视频。
[00:01:02.060 - 00:01:05.300] 测试结果应该说既有惊喜也有惊吓。
[00:01:05.500 - 00:01:08.320] 下面我们就先从准备工作开始。
[00:01:08.680 - 00:01:15.260] TaoMate-H3官方的模型是不能在ComfyUI里面直接使用的,我们必须下载这个转化的版本。
[00:01:15.680 - 00:01:19.620] 目前我们能找到的转化版本有很多,我重点介绍两个。
[00:01:19.620 - 00:01:21.120] 第一个来自于Robot。
[00:01:21.300 - 00:01:32.820] 它的大小大概是2.48G,这个版本只是格式转换,没有训练,这期后面所有的测试我们使用的都是它。
[00:01:32.820 - 00:01:41.520] 第二个是来自于KJ,它采用了平均Rank19,当前文件的大小只有182MB。
[00:01:41.520 - 00:01:50.620] 无论你使用哪个版本,安装的方法都是一样的,我们只需要将这个模型文件给它放到ComfyUI Models目录下。
[00:01:50.620 - 00:01:53.280] 再加上在领域里面的lauras文件夹里面就可以了。
[00:01:53.280 - 00:01:56.240] 因为这方便也是,我也把工作流构建到了RunningHub上。
[00:01:56.240 - 00:01:58.140] 下面我们简单说一下这个工作流。
[00:01:58.140 - 00:02:01.640] 这期视频里面我们给大家准备了两套工作流。
[00:02:02.040 - 00:02:04.840] 第一套是首尾针的这个工作流。
[00:02:04.840 - 00:02:07.800] 第二套是参考生成的工作流。
[00:02:07.980 - 00:02:14.460] 这两套工作流的基本结构是一样的,关键只有这个条件节点不一样。
[00:02:14.460 - 00:02:17.620] 首尾针使用的是Image-to-Video。
[00:02:17.620 - 00:02:20.420] 而我们的参考视频使用的是Reference-to-Video。
[00:02:20.620 - 00:02:24.500] 那Talmate H3需要加载一个三部的Laura
[00:02:24.500 - 00:02:26.220] 就是大家现在看到的这个
[00:02:26.220 - 00:02:27.720] 它的强度呢
[00:02:27.720 - 00:02:29.200] 我们给的是1.0
[00:02:29.200 - 00:02:30.180] 大家注意啊
[00:02:30.180 - 00:02:31.500] 这个Laura呢
[00:02:31.500 - 00:02:34.900] 它是同时可以使用到首尾针
[00:02:34.900 - 00:02:38.040] 或者是参考生成的工作流上的
[00:02:38.040 - 00:02:39.100] 那主模型呢
[00:02:39.100 - 00:02:40.380] 我们给大家两种选择
[00:02:40.380 - 00:02:40.980] 第一种呢
[00:02:40.980 - 00:02:45.500] 就是大家可以采用官方的MiniMax H3的模型
[00:02:45.500 - 00:02:46.820] 第二种呢
[00:02:46.820 - 00:02:48.560] 就是Singularity
[00:02:48.560 - 00:02:50.620] 就是我们之前给大家讲到的一个模型
[00:02:50.620 - 00:02:52.780] 它整体的效果呢
[00:02:52.780 - 00:02:53.700] 也是不错的
[00:02:53.700 - 00:02:55.320] 那这个模型接入之后呢
[00:02:55.320 - 00:02:56.320] 我们首先啊
[00:02:56.320 - 00:02:57.540] 接入了一个节点啊
[00:02:57.540 - 00:03:01.900] 这个节点叫做Memory Efficient Sage Attention
[00:03:01.900 - 00:03:02.940] 然后呢
[00:03:02.940 - 00:03:04.360] 我们又使用了Soul Attention
[00:03:04.360 - 00:03:07.220] 那这套注意力机制的处理方法
[00:03:07.220 - 00:03:09.120] 我们参考了Singularity
[00:03:09.120 - 00:03:10.440] 那采样器呢
[00:03:10.440 - 00:03:11.220] 我们是Ola
[00:03:11.220 - 00:03:12.520] 调度器呢
[00:03:12.520 - 00:03:13.340] 使用的是Beta
[00:03:13.340 - 00:03:14.940] 采样的步数
[00:03:14.940 - 00:03:17.420] 我们直接设置了三步
[00:03:17.420 - 00:03:18.540] 那在分辨率方面
[00:03:18.540 - 00:03:22.540] 我这儿没有使用常见的0.7百万像素
[00:03:22.540 - 00:03:25.920] 而是直接设置了100万像素
[00:03:25.920 - 00:03:27.300] 那整个视频的时长呢
[00:03:27.300 - 00:03:28.500] 我这儿使用的是10秒
[00:03:28.500 - 00:03:30.300] 工作流其他的部分
[00:03:30.300 - 00:03:32.560] 其实和官方的工作流呢
[00:03:32.560 - 00:03:33.820] 是没有什么区别的
[00:03:33.820 - 00:03:34.700] 那在这儿呢
[00:03:34.700 - 00:03:36.080] 我就不逐一解释了
[00:03:36.080 - 00:03:36.860] 下边呢
[00:03:36.860 - 00:03:38.040] 我们直接看测试
[00:03:38.040 - 00:03:39.180] 那第一组测试的
[00:03:39.180 - 00:03:40.680] 我们叫做Big Face
[00:03:40.680 - 00:03:41.820] 加上Low Motion
[00:03:41.820 - 00:03:43.800] 也就是人物的脸
[00:03:43.800 - 00:03:45.460] 在画面当中占比比较大
[00:03:45.460 - 00:03:46.240] 动作呢
[00:03:46.240 - 00:03:47.780] 以表情变化为主啊
[00:03:47.780 - 00:03:48.520] 没有快速的动作
[00:03:48.540 - 00:03:50.700] 没有快速的转身和大幅的肢体动作
[00:03:50.700 - 00:03:52.260] 那我们的手针呢
[00:03:52.260 - 00:03:55.500] 是一段第一人称的视频通话
[00:03:55.500 - 00:03:57.920] 一个人手里拿着一部竖屏的手机
[00:03:57.920 - 00:04:00.220] 屏幕当中的女友把脸靠在手上
[00:04:00.220 - 00:04:02.900] 卧室当中使用了柔和的暖色灯光
[00:04:02.900 - 00:04:03.720] 那这一组呢
[00:04:03.720 - 00:04:06.120] 我们使用的是手尾针的工作流
[00:04:06.120 - 00:04:08.780] 那在主模型的选择方面呢
[00:04:08.780 - 00:04:10.640] 我们使用了两种不同的模型
[00:04:10.640 - 00:04:14.480] 那我们先来看一下官方的FL2VA模型
[00:04:14.480 - 00:04:18.480] 搭载我们的Talmate的三部Laura
[00:04:18.540 - 00:04:19.780] 我们看一下效果
[00:04:19.780 - 00:04:20.460] 一套视频呢
[00:04:20.460 - 00:04:21.500] 非常的漂亮啊
[00:04:21.500 - 00:04:25.420] 女孩从闭眼微笑逐渐变成惊讶和大笑
[00:04:25.420 - 00:04:26.580] 接着鼓起脸颊
[00:04:26.580 - 00:04:28.680] 最后又回到温柔的笑容
[00:04:28.680 - 00:04:29.640] 眼睛眉毛
[00:04:29.640 - 00:04:32.780] 嘴角和面颊的变化都非常的丰富啊
[00:04:32.780 - 00:04:35.880] 不是简单的把嘴巴开合几次
[00:04:35.880 - 00:04:39.480] 更重要的是手机的外框手指的位置
[00:04:39.480 - 00:04:43.100] 视频通话按钮和右下角的小窗口呢
[00:04:43.100 - 00:04:44.460] 是基本稳定的
[00:04:44.460 - 00:04:46.140] 那对于三部采样来说
[00:04:46.140 - 00:04:47.260] 我觉得这个结果呢
[00:04:47.260 - 00:04:48.360] 已经非常具有说服力了
[00:04:48.540 - 00:04:49.580] 下面呢
[00:04:49.580 - 00:04:51.120] 我们来更换一下模型
[00:04:51.120 - 00:04:53.920] 那我们把主模型换成了Singularity
[00:04:53.920 - 00:04:54.900] 其他的参数呢
[00:04:54.900 - 00:04:56.100] 保持不变
[00:04:56.100 - 00:04:58.420] 那我们来看一下生成的效果
[00:04:58.420 - 00:05:01.020] Singularity的表情同样自然啊
[00:05:01.020 - 00:05:02.300] 笑容和肤质呢
[00:05:02.300 - 00:05:04.340] 甚至会让人觉得更加柔和
[00:05:04.340 - 00:05:05.720] 但是大家要注意啊
[00:05:05.720 - 00:05:08.460] 当人物靠近镜头的位置
[00:05:08.460 - 00:05:10.680] 当脸部被放大以后啊
[00:05:10.680 - 00:05:15.600] 头发与手机屏幕的边缘发生了空间冲突
[00:05:15.600 - 00:05:18.420] 局部的发丝像是穿过了屏幕边缘
[00:05:18.420 - 00:05:21.060] 出现在本来不应该出现的位置
[00:05:21.060 - 00:05:22.800] 画面单独看很漂亮
[00:05:22.800 - 00:05:26.520] 但是人只能存在于手机屏幕里
[00:05:26.520 - 00:05:29.200] 这个约束没有完全的遵守
[00:05:29.200 - 00:05:30.520] 所以说这一组测试的
[00:05:30.520 - 00:05:35.080] 我更推荐使用官方的FL2VA这个模型
[00:05:35.080 - 00:05:35.800] 第二组测试
[00:05:35.800 - 00:05:38.920] 我们是为了测试一种特殊的摄影效果啊
[00:05:38.920 - 00:05:39.340] 在这儿呢
[00:05:39.340 - 00:05:42.160] 我提供了一张同一人物
[00:05:42.160 - 00:05:44.080] 不同视角的Character Sheet
[00:05:44.080 - 00:05:47.560] 在中式的窗户边上生成这样一个角色
[00:05:47.560 - 00:05:48.520] 并且展现
[00:05:48.520 - 00:05:51.460] 出延迟摄影中的太阳运动
[00:05:51.460 - 00:05:55.780] 那太阳透过窗户会把阴影投射在人物的脸上
[00:05:55.780 - 00:05:57.700] 那这种明暗的边界啊
[00:05:57.700 - 00:05:59.860] 要能够正确的显示出来
[00:05:59.860 - 00:06:00.340] 下面呢
[00:06:00.340 - 00:06:02.200] 我们先来看一下Singularity
[00:06:02.200 - 00:06:04.000] 它整体表现的一个效果
[00:06:04.000 - 00:06:05.680] 人物本身的很自然
[00:06:05.680 - 00:06:06.580] 面部短发
[00:06:06.580 - 00:06:08.380] 耳饰和深蓝色的旗袍呢
[00:06:08.380 - 00:06:09.700] 都是比较稳定的
[00:06:09.700 - 00:06:11.700] 光线的也有轻微的变化
[00:06:11.700 - 00:06:16.060] 但这种变化更像人物在窗边轻轻移动
[00:06:16.060 - 00:06:18.520] 或者是云遮住了一点太阳
[00:06:18.520 - 00:06:21.260] 并没有那种延迟摄影的感觉
[00:06:21.260 - 00:06:21.780] 然后呢
[00:06:21.780 - 00:06:25.520] 我们再来看一下官方的RF2VA模型
[00:06:25.520 - 00:06:26.860] 我们生成的效果
[00:06:26.860 - 00:06:30.140] 它同样没有把光影快速扫过面部
[00:06:30.140 - 00:06:32.280] 这个延迟摄影的效果呢
[00:06:32.280 - 00:06:33.100] 给表现出来
[00:06:33.100 - 00:06:35.040] 变化的幅度也不够大
[00:06:35.040 - 00:06:35.900] 相比之下
[00:06:35.900 - 00:06:37.660] 官方模型生成的人脸呢
[00:06:37.660 - 00:06:39.740] 让人觉得更像AI脸
[00:06:39.740 - 00:06:43.120] 而Singularity的复制表情和整体的光线
[00:06:43.120 - 00:06:44.080] 会更自然一些
[00:06:44.080 - 00:06:48.440] 问题是两条视频都没有完成最关键的摄影要求
[00:06:48.520 - 00:06:49.640] 下边呢
[00:06:49.640 - 00:06:51.720] 我们再看一下相同场景
[00:06:51.720 - 00:06:54.980] 我们使用Singularity八步才能得到的效果
[00:06:54.980 - 00:06:55.960] 在这个版本里边
[00:06:55.960 - 00:06:59.860] 窗格形成的亮斑和阴影明显扫过人脸的额头
[00:06:59.860 - 00:07:01.780] 眼睛鼻梁和衣服
[00:07:01.780 - 00:07:05.480] 那三步与八步之间的区别不只是锐度
[00:07:05.480 - 00:07:08.180] 而是模型有没有足够的去造过程
[00:07:08.180 - 00:07:11.560] 或者是建立时间加速这个观念
[00:07:11.560 - 00:07:12.300] 第三组呢
[00:07:12.300 - 00:07:13.880] 是测试快速动作的
[00:07:13.880 - 00:07:18.420] 手针里边的两位成年古典女性啊
[00:07:18.420 - 00:07:20.840] 在月夜的庭院里边持剑对峙
[00:07:20.840 - 00:07:24.780] 这里边我们使用的当然是手尾针的工作流
[00:07:24.780 - 00:07:27.000] 那我们先来看一下Singularity
[00:07:27.000 - 00:07:28.420] 整体的画面呢
[00:07:28.420 - 00:07:29.580] 其实是很漂亮的
[00:07:29.580 - 00:07:31.020] 粉色和浅绿色的服装
[00:07:31.020 - 00:07:33.800] 月夜竹林和地面的反光都比较稳定
[00:07:33.800 - 00:07:36.500] 两个人也的确完成了连续对打啊
[00:07:36.500 - 00:07:39.920] 但是他并没有解决动作偏慢的问题
[00:07:39.920 - 00:07:43.000] 更明显就是四秒附近啊
[00:07:43.000 - 00:07:45.520] 粉衣人物低头躲剑的时候
[00:07:45.520 - 00:07:47.160] 头部长发
[00:07:47.160 - 00:07:48.400] 剑刃和另一位人
[00:07:48.420 - 00:07:51.120] 人物的宽大衣袖挤在同一个区域
[00:07:51.120 - 00:07:54.060] 局部的遮挡关系表现的非常的不清楚
[00:07:54.060 - 00:07:57.840] 剑的路径和人物的身体也缺少可靠的空间距离
[00:07:57.840 - 00:08:01.380] 那我们再来看一下官方的手尾针模型表现的效果
[00:08:01.380 - 00:08:05.160] 官方模型在前面的转头和闪避里边更加的干净
[00:08:05.160 - 00:08:07.580] 人物的轮廓也更容易毒
[00:08:07.580 - 00:08:08.720] 但是在七秒左右
[00:08:08.720 - 00:08:09.780] 左侧人物转身
[00:08:09.780 - 00:08:12.120] 两人重新交换站位时
[00:08:12.120 - 00:08:15.860] 身体的朝向衣袖之间的连接的出现了问题
[00:08:15.860 - 00:08:16.920] 也就是说呢
[00:08:16.920 - 00:08:18.100] 两条视频
[00:08:18.100 - 00:08:19.200] 失败的位置不同
[00:08:19.200 - 00:08:20.380] 本质却相同
[00:08:20.380 - 00:08:24.580] 三部能够建立两个美女在比肩的整体画面
[00:08:24.580 - 00:08:29.920] 但是却不能够稳定的计算出高速运动当中的整体的运动
[00:08:29.920 - 00:08:30.900] 遮挡关系
[00:08:30.900 - 00:08:32.400] 甚至重心的变化
[00:08:32.400 - 00:08:33.540] 最后一组呢
[00:08:33.540 - 00:08:35.280] 是难度最高的参考生成
[00:08:35.280 - 00:08:37.880] 我们先有一段三维的参考视频
[00:08:37.880 - 00:08:40.280] 一台相机的零件从四周聚集
[00:08:40.280 - 00:08:42.260] 形成了完整的相机
[00:08:42.260 - 00:08:43.280] 随后镜头
[00:08:43.280 - 00:08:44.020] 机身外壳
[00:08:44.020 - 00:08:47.240] 顶部部件和内部电路按正确的层次展开
[00:08:47.240 - 00:08:48.060] 最后呢
[00:08:48.100 - 00:08:49.920] 所有的零件重新组装
[00:08:49.920 - 00:08:51.440] 那这个测试呢
[00:08:51.440 - 00:08:53.180] 我们在上一个视频里边呢
[00:08:53.180 - 00:08:54.140] 已经做过了
[00:08:54.140 - 00:08:57.220] 只不过是我们换了一个模型
[00:08:57.220 - 00:08:59.140] 那这类参考视频的难点呢
[00:08:59.140 - 00:09:00.360] 不是画面好不好看
[00:09:00.360 - 00:09:02.980] 而是运动的逻辑能不能保留
[00:09:02.980 - 00:09:06.100] 那我们先来看一下我们上一个视频当中
[00:09:06.100 - 00:09:07.800] 他测试的这个结果
[00:09:07.800 - 00:09:12.760] 这一条视频的基本保留了参考动画的完整流程
[00:09:12.760 - 00:09:14.620] 零件先聚合成相机
[00:09:14.620 - 00:09:15.660] 然后呢
[00:09:15.660 - 00:09:17.180] 有一个停顿展示
[00:09:17.180 - 00:09:18.060] 随后呢
[00:09:18.100 - 00:09:21.040] 镜头沿着光轴展开
[00:09:21.040 - 00:09:21.940] 顶部的面板
[00:09:21.940 - 00:09:25.920] 电路板和机身外壳保持着清楚的前后关系
[00:09:25.920 - 00:09:27.140] 最后的重新收拢
[00:09:27.140 - 00:09:28.720] 形成了完整的产品
[00:09:28.720 - 00:09:32.820] 那我们再来看一下TOMate的三部模型生成的效果
[00:09:32.820 - 00:09:35.800] 这个结果第一眼觉得非常有视觉冲击力
[00:09:35.800 - 00:09:36.780] 相机是真实的
[00:09:36.780 - 00:09:37.720] 零件很多
[00:09:37.720 - 00:09:39.900] 金属和玻璃的材质也不差
[00:09:39.900 - 00:09:41.740] 但是只要对照参考视频
[00:09:41.740 - 00:09:45.580] 你会发现参考视频里边的逻辑几乎没有保留下来
[00:09:45.580 - 00:09:48.100] 相机的主体一开始就以力
[00:09:48.100 - 00:09:49.360] 这种结构出现了
[00:09:49.360 - 00:09:54.580] 周围的零件更像悬浮在周围的装饰性碎片啊
[00:09:54.580 - 00:09:55.660] 没有按照镜头
[00:09:55.660 - 00:09:56.440] 传感器
[00:09:56.440 - 00:09:57.120] 电路板
[00:09:57.120 - 00:09:59.020] 机身外壳的层次展开
[00:09:59.020 - 00:09:59.620] 所以说呢
[00:09:59.620 - 00:10:03.780] 这个就是三部最危险的一个地方
[00:10:03.780 - 00:10:05.520] 画面的可能好看
[00:10:05.520 - 00:10:06.640] 但是呢
[00:10:06.640 - 00:10:08.040] 你很容易忽略
[00:10:08.040 - 00:10:11.920] 他已经把我们要做的主体任务给做错了
[00:10:11.920 - 00:10:17.140] 那经过四组测试TOMate H3三部Laura的能力边界的已经非常清楚了
[00:10:17.140 - 00:10:17.960] 如果你生成的
[00:10:18.100 - 00:10:19.960] 这种大脸低动作
[00:10:19.960 - 00:10:25.000] 普通的人物表演简单的镜头推进或者是常规的氛围视频
[00:10:25.000 - 00:10:28.660] 他那非常值得去尝试使用不但速度快
[00:10:28.660 - 00:10:30.420] 效果的也会不错
[00:10:30.420 - 00:10:31.600] 那在主模型方面
[00:10:31.600 - 00:10:36.100] 如果非常在意自然的复制或者是较轻的AI感
[00:10:36.100 - 00:10:38.320] 可以尝试使用singularity
[00:10:38.320 - 00:10:43.480] 如果最在意构图的边界指令的遵循和结构的准确度
[00:10:43.480 - 00:10:45.240] 那可以使用官方的模型
[00:10:45.240 - 00:10:46.980] 但是除此之外
[00:10:46.980 - 00:10:47.980] 其他
[00:10:47.980 - 00:10:52.420] 的高难度任务可能这个Laura的都是不能胜任的
[00:10:52.420 - 00:10:54.760] 比方说快速的动作
[00:10:54.760 - 00:10:59.980] 比方说特殊的摄影过程还包括高难度的参考生成
[00:10:59.980 - 00:11:04.500] 所以说那一个模型不是单纯的谈他好还是不好
[00:11:04.500 - 00:11:09.160] 而是要搞清楚他到底合用在什么地方好
[00:11:09.160 - 00:11:10.380] 今天我们就说这么多
[00:11:10.380 - 00:11:12.400] 关注我做一个懂爱的人
下载此文件