1
00:00:00,000 --> 00:00:12,720
MiniMax H3现在只需要三步采样了,最近阿里的TaoLab AIJC团队发布了一套新的MiniMax H3的加速方案,叫做TaoMate-H3。

2
00:00:13,179 --> 00:00:21,300
以前我们常见的就是八步或者四步的Turbo LoRa,TaoMate-H3直接把这个采样压缩到了三步。

3
00:00:21,300 --> 00:00:30,800
对于官方的演示来看,无论是自然风景、人物口播、产品展示还是科幻场景,第一眼的质量都还是相当不错的。

4
00:00:30,920 --> 00:00:39,380
但是我的第一反应不是以后所有的H3都使用三步采样,那我的问题是三步这么快,它到底牺牲了什么?

5
00:00:39,659 --> 00:00:48,619
所以这期视频我们不会只给大家展示几个好看的结果,那我们会把TaoMate-H3放进ComfyUI,分别测试四种场景。

6
00:00:48,619 --> 00:00:50,399
第一种就是大脸低动作。

7
00:00:50,619 --> 00:00:51,280
第二个就是演示。

8
00:00:51,299 --> 00:00:53,060
第三种就是延迟摄影当中的复杂光影。

9
00:00:53,340 --> 00:00:57,179
第三种就是两位古典美女的快速笔键。

10
00:00:57,700 --> 00:01:01,740
第四个是复杂的一个产品解构的视频。

11
00:01:02,060 --> 00:01:05,299
测试结果应该说既有惊喜也有惊吓。

12
00:01:05,500 --> 00:01:08,319
下面我们就先从准备工作开始。

13
00:01:08,680 --> 00:01:15,260
TaoMate-H3官方的模型是不能在ComfyUI里面直接使用的,我们必须下载这个转化的版本。

14
00:01:15,680 --> 00:01:19,620
目前我们能找到的转化版本有很多,我重点介绍两个。

15
00:01:19,620 --> 00:01:21,120
第一个来自于Robot。

16
00:01:21,299 --> 00:01:32,819
它的大小大概是2.48G,这个版本只是格式转换,没有训练,这期后面所有的测试我们使用的都是它。

17
00:01:32,819 --> 00:01:41,519
第二个是来自于KJ,它采用了平均Rank19,当前文件的大小只有182MB。

18
00:01:41,519 --> 00:01:50,620
无论你使用哪个版本,安装的方法都是一样的,我们只需要将这个模型文件给它放到ComfyUI Models目录下。

19
00:01:50,620 --> 00:01:53,280
再加上在领域里面的lauras文件夹里面就可以了。

20
00:01:53,280 --> 00:01:56,239
因为这方便也是,我也把工作流构建到了RunningHub上。

21
00:01:56,239 --> 00:01:58,140
下面我们简单说一下这个工作流。

22
00:01:58,140 --> 00:02:01,640
这期视频里面我们给大家准备了两套工作流。

23
00:02:02,040 --> 00:02:04,840
第一套是首尾针的这个工作流。

24
00:02:04,840 --> 00:02:07,799
第二套是参考生成的工作流。

25
00:02:07,980 --> 00:02:14,460
这两套工作流的基本结构是一样的,关键只有这个条件节点不一样。

26
00:02:14,460 --> 00:02:17,620
首尾针使用的是Image-to-Video。

27
00:02:17,620 --> 00:02:20,419
而我们的参考视频使用的是Reference-to-Video。

28
00:02:20,620 --> 00:02:24,500
那Talmate H3需要加载一个三部的Laura

29
00:02:24,500 --> 00:02:26,219
就是大家现在看到的这个

30
00:02:26,219 --> 00:02:27,719
它的强度呢

31
00:02:27,719 --> 00:02:29,199
我们给的是1.0

32
00:02:29,199 --> 00:02:30,180
大家注意啊

33
00:02:30,180 --> 00:02:31,500
这个Laura呢

34
00:02:31,500 --> 00:02:34,900
它是同时可以使用到首尾针

35
00:02:34,900 --> 00:02:38,039
或者是参考生成的工作流上的

36
00:02:38,039 --> 00:02:39,099
那主模型呢

37
00:02:39,099 --> 00:02:40,379
我们给大家两种选择

38
00:02:40,379 --> 00:02:40,979
第一种呢

39
00:02:40,979 --> 00:02:45,500
就是大家可以采用官方的MiniMax H3的模型

40
00:02:45,500 --> 00:02:46,819
第二种呢

41
00:02:46,819 --> 00:02:48,560
就是Singularity

42
00:02:48,560 --> 00:02:50,620
就是我们之前给大家讲到的一个模型

43
00:02:50,620 --> 00:02:52,780
它整体的效果呢

44
00:02:52,780 --> 00:02:53,699
也是不错的

45
00:02:53,699 --> 00:02:55,319
那这个模型接入之后呢

46
00:02:55,319 --> 00:02:56,319
我们首先啊

47
00:02:56,319 --> 00:02:57,539
接入了一个节点啊

48
00:02:57,539 --> 00:03:01,900
这个节点叫做Memory Efficient Sage Attention

49
00:03:01,900 --> 00:03:02,939
然后呢

50
00:03:02,939 --> 00:03:04,360
我们又使用了Soul Attention

51
00:03:04,360 --> 00:03:07,219
那这套注意力机制的处理方法

52
00:03:07,219 --> 00:03:09,120
我们参考了Singularity

53
00:03:09,120 --> 00:03:10,439
那采样器呢

54
00:03:10,439 --> 00:03:11,219
我们是Ola

55
00:03:11,219 --> 00:03:12,520
调度器呢

56
00:03:12,520 --> 00:03:13,340
使用的是Beta

57
00:03:13,340 --> 00:03:14,939
采样的步数

58
00:03:14,939 --> 00:03:17,419
我们直接设置了三步

59
00:03:17,419 --> 00:03:18,539
那在分辨率方面

60
00:03:18,539 --> 00:03:22,539
我这儿没有使用常见的0.7百万像素

61
00:03:22,539 --> 00:03:25,919
而是直接设置了100万像素

62
00:03:25,919 --> 00:03:27,300
那整个视频的时长呢

63
00:03:27,300 --> 00:03:28,500
我这儿使用的是10秒

64
00:03:28,500 --> 00:03:30,300
工作流其他的部分

65
00:03:30,300 --> 00:03:32,560
其实和官方的工作流呢

66
00:03:32,560 --> 00:03:33,819
是没有什么区别的

67
00:03:33,819 --> 00:03:34,699
那在这儿呢

68
00:03:34,699 --> 00:03:36,080
我就不逐一解释了

69
00:03:36,080 --> 00:03:36,860
下边呢

70
00:03:36,860 --> 00:03:38,039
我们直接看测试

71
00:03:38,039 --> 00:03:39,180
那第一组测试的

72
00:03:39,180 --> 00:03:40,680
我们叫做Big Face

73
00:03:40,680 --> 00:03:41,819
加上Low Motion

74
00:03:41,819 --> 00:03:43,800
也就是人物的脸

75
00:03:43,800 --> 00:03:45,460
在画面当中占比比较大

76
00:03:45,460 --> 00:03:46,240
动作呢

77
00:03:46,240 --> 00:03:47,780
以表情变化为主啊

78
00:03:47,780 --> 00:03:48,520
没有快速的动作

79
00:03:48,539 --> 00:03:50,699
没有快速的转身和大幅的肢体动作

80
00:03:50,699 --> 00:03:52,259
那我们的手针呢

81
00:03:52,259 --> 00:03:55,500
是一段第一人称的视频通话

82
00:03:55,500 --> 00:03:57,919
一个人手里拿着一部竖屏的手机

83
00:03:57,919 --> 00:04:00,219
屏幕当中的女友把脸靠在手上

84
00:04:00,219 --> 00:04:02,900
卧室当中使用了柔和的暖色灯光

85
00:04:02,900 --> 00:04:03,719
那这一组呢

86
00:04:03,719 --> 00:04:06,120
我们使用的是手尾针的工作流

87
00:04:06,120 --> 00:04:08,780
那在主模型的选择方面呢

88
00:04:08,780 --> 00:04:10,639
我们使用了两种不同的模型

89
00:04:10,639 --> 00:04:14,479
那我们先来看一下官方的FL2VA模型

90
00:04:14,479 --> 00:04:18,480
搭载我们的Talmate的三部Laura

91
00:04:18,540 --> 00:04:19,779
我们看一下效果

92
00:04:19,779 --> 00:04:20,459
一套视频呢

93
00:04:20,459 --> 00:04:21,500
非常的漂亮啊

94
00:04:21,500 --> 00:04:25,420
女孩从闭眼微笑逐渐变成惊讶和大笑

95
00:04:25,420 --> 00:04:26,579
接着鼓起脸颊

96
00:04:26,579 --> 00:04:28,680
最后又回到温柔的笑容

97
00:04:28,680 --> 00:04:29,639
眼睛眉毛

98
00:04:29,639 --> 00:04:32,779
嘴角和面颊的变化都非常的丰富啊

99
00:04:32,779 --> 00:04:35,879
不是简单的把嘴巴开合几次

100
00:04:35,879 --> 00:04:39,480
更重要的是手机的外框手指的位置

101
00:04:39,480 --> 00:04:43,100
视频通话按钮和右下角的小窗口呢

102
00:04:43,100 --> 00:04:44,459
是基本稳定的

103
00:04:44,459 --> 00:04:46,139
那对于三部采样来说

104
00:04:46,139 --> 00:04:47,259
我觉得这个结果呢

105
00:04:47,259 --> 00:04:48,360
已经非常具有说服力了

106
00:04:48,540 --> 00:04:49,579
下面呢

107
00:04:49,579 --> 00:04:51,120
我们来更换一下模型

108
00:04:51,120 --> 00:04:53,920
那我们把主模型换成了Singularity

109
00:04:53,920 --> 00:04:54,899
其他的参数呢

110
00:04:54,899 --> 00:04:56,100
保持不变

111
00:04:56,100 --> 00:04:58,420
那我们来看一下生成的效果

112
00:04:58,420 --> 00:05:01,019
Singularity的表情同样自然啊

113
00:05:01,019 --> 00:05:02,300
笑容和肤质呢

114
00:05:02,300 --> 00:05:04,339
甚至会让人觉得更加柔和

115
00:05:04,339 --> 00:05:05,720
但是大家要注意啊

116
00:05:05,720 --> 00:05:08,459
当人物靠近镜头的位置

117
00:05:08,459 --> 00:05:10,680
当脸部被放大以后啊

118
00:05:10,680 --> 00:05:15,600
头发与手机屏幕的边缘发生了空间冲突

119
00:05:15,600 --> 00:05:18,420
局部的发丝像是穿过了屏幕边缘

120
00:05:18,420 --> 00:05:21,060
出现在本来不应该出现的位置

121
00:05:21,060 --> 00:05:22,800
画面单独看很漂亮

122
00:05:22,800 --> 00:05:26,519
但是人只能存在于手机屏幕里

123
00:05:26,519 --> 00:05:29,199
这个约束没有完全的遵守

124
00:05:29,199 --> 00:05:30,519
所以说这一组测试的

125
00:05:30,519 --> 00:05:35,079
我更推荐使用官方的FL2VA这个模型

126
00:05:35,079 --> 00:05:35,800
第二组测试

127
00:05:35,800 --> 00:05:38,920
我们是为了测试一种特殊的摄影效果啊

128
00:05:38,920 --> 00:05:39,339
在这儿呢

129
00:05:39,339 --> 00:05:42,160
我提供了一张同一人物

130
00:05:42,160 --> 00:05:44,079
不同视角的Character Sheet

131
00:05:44,079 --> 00:05:47,560
在中式的窗户边上生成这样一个角色

132
00:05:47,560 --> 00:05:48,519
并且展现

133
00:05:48,519 --> 00:05:51,459
出延迟摄影中的太阳运动

134
00:05:51,459 --> 00:05:55,779
那太阳透过窗户会把阴影投射在人物的脸上

135
00:05:55,779 --> 00:05:57,699
那这种明暗的边界啊

136
00:05:57,699 --> 00:05:59,860
要能够正确的显示出来

137
00:05:59,860 --> 00:06:00,339
下面呢

138
00:06:00,339 --> 00:06:02,199
我们先来看一下Singularity

139
00:06:02,199 --> 00:06:04,000
它整体表现的一个效果

140
00:06:04,000 --> 00:06:05,680
人物本身的很自然

141
00:06:05,680 --> 00:06:06,579
面部短发

142
00:06:06,579 --> 00:06:08,379
耳饰和深蓝色的旗袍呢

143
00:06:08,379 --> 00:06:09,699
都是比较稳定的

144
00:06:09,699 --> 00:06:11,699
光线的也有轻微的变化

145
00:06:11,699 --> 00:06:16,060
但这种变化更像人物在窗边轻轻移动

146
00:06:16,060 --> 00:06:18,519
或者是云遮住了一点太阳

147
00:06:18,519 --> 00:06:21,259
并没有那种延迟摄影的感觉

148
00:06:21,259 --> 00:06:21,779
然后呢

149
00:06:21,779 --> 00:06:25,519
我们再来看一下官方的RF2VA模型

150
00:06:25,519 --> 00:06:26,860
我们生成的效果

151
00:06:26,860 --> 00:06:30,139
它同样没有把光影快速扫过面部

152
00:06:30,139 --> 00:06:32,279
这个延迟摄影的效果呢

153
00:06:32,279 --> 00:06:33,100
给表现出来

154
00:06:33,100 --> 00:06:35,040
变化的幅度也不够大

155
00:06:35,040 --> 00:06:35,899
相比之下

156
00:06:35,899 --> 00:06:37,660
官方模型生成的人脸呢

157
00:06:37,660 --> 00:06:39,740
让人觉得更像AI脸

158
00:06:39,740 --> 00:06:43,120
而Singularity的复制表情和整体的光线

159
00:06:43,120 --> 00:06:44,079
会更自然一些

160
00:06:44,079 --> 00:06:48,439
问题是两条视频都没有完成最关键的摄影要求

161
00:06:48,519 --> 00:06:49,639
下边呢

162
00:06:49,639 --> 00:06:51,720
我们再看一下相同场景

163
00:06:51,720 --> 00:06:54,980
我们使用Singularity八步才能得到的效果

164
00:06:54,980 --> 00:06:55,959
在这个版本里边

165
00:06:55,959 --> 00:06:59,860
窗格形成的亮斑和阴影明显扫过人脸的额头

166
00:06:59,860 --> 00:07:01,779
眼睛鼻梁和衣服

167
00:07:01,779 --> 00:07:05,480
那三步与八步之间的区别不只是锐度

168
00:07:05,480 --> 00:07:08,180
而是模型有没有足够的去造过程

169
00:07:08,180 --> 00:07:11,560
或者是建立时间加速这个观念

170
00:07:11,560 --> 00:07:12,300
第三组呢

171
00:07:12,300 --> 00:07:13,879
是测试快速动作的

172
00:07:13,879 --> 00:07:18,420
手针里边的两位成年古典女性啊

173
00:07:18,420 --> 00:07:20,839
在月夜的庭院里边持剑对峙

174
00:07:20,839 --> 00:07:24,779
这里边我们使用的当然是手尾针的工作流

175
00:07:24,779 --> 00:07:27,000
那我们先来看一下Singularity

176
00:07:27,000 --> 00:07:28,420
整体的画面呢

177
00:07:28,420 --> 00:07:29,579
其实是很漂亮的

178
00:07:29,579 --> 00:07:31,019
粉色和浅绿色的服装

179
00:07:31,019 --> 00:07:33,800
月夜竹林和地面的反光都比较稳定

180
00:07:33,800 --> 00:07:36,500
两个人也的确完成了连续对打啊

181
00:07:36,500 --> 00:07:39,920
但是他并没有解决动作偏慢的问题

182
00:07:39,920 --> 00:07:43,000
更明显就是四秒附近啊

183
00:07:43,000 --> 00:07:45,519
粉衣人物低头躲剑的时候

184
00:07:45,519 --> 00:07:47,160
头部长发

185
00:07:47,160 --> 00:07:48,399
剑刃和另一位人

186
00:07:48,420 --> 00:07:51,120
人物的宽大衣袖挤在同一个区域

187
00:07:51,120 --> 00:07:54,060
局部的遮挡关系表现的非常的不清楚

188
00:07:54,060 --> 00:07:57,839
剑的路径和人物的身体也缺少可靠的空间距离

189
00:07:57,839 --> 00:08:01,379
那我们再来看一下官方的手尾针模型表现的效果

190
00:08:01,379 --> 00:08:05,160
官方模型在前面的转头和闪避里边更加的干净

191
00:08:05,160 --> 00:08:07,579
人物的轮廓也更容易毒

192
00:08:07,579 --> 00:08:08,720
但是在七秒左右

193
00:08:08,720 --> 00:08:09,779
左侧人物转身

194
00:08:09,779 --> 00:08:12,120
两人重新交换站位时

195
00:08:12,120 --> 00:08:15,860
身体的朝向衣袖之间的连接的出现了问题

196
00:08:15,860 --> 00:08:16,920
也就是说呢

197
00:08:16,920 --> 00:08:18,100
两条视频

198
00:08:18,100 --> 00:08:19,199
失败的位置不同

199
00:08:19,199 --> 00:08:20,379
本质却相同

200
00:08:20,379 --> 00:08:24,579
三部能够建立两个美女在比肩的整体画面

201
00:08:24,579 --> 00:08:29,920
但是却不能够稳定的计算出高速运动当中的整体的运动

202
00:08:29,920 --> 00:08:30,899
遮挡关系

203
00:08:30,899 --> 00:08:32,399
甚至重心的变化

204
00:08:32,399 --> 00:08:33,539
最后一组呢

205
00:08:33,539 --> 00:08:35,279
是难度最高的参考生成

206
00:08:35,279 --> 00:08:37,879
我们先有一段三维的参考视频

207
00:08:37,879 --> 00:08:40,279
一台相机的零件从四周聚集

208
00:08:40,279 --> 00:08:42,259
形成了完整的相机

209
00:08:42,259 --> 00:08:43,279
随后镜头

210
00:08:43,279 --> 00:08:44,019
机身外壳

211
00:08:44,019 --> 00:08:47,240
顶部部件和内部电路按正确的层次展开

212
00:08:47,240 --> 00:08:48,059
最后呢

213
00:08:48,100 --> 00:08:49,919
所有的零件重新组装

214
00:08:49,919 --> 00:08:51,440
那这个测试呢

215
00:08:51,440 --> 00:08:53,179
我们在上一个视频里边呢

216
00:08:53,179 --> 00:08:54,139
已经做过了

217
00:08:54,139 --> 00:08:57,220
只不过是我们换了一个模型

218
00:08:57,220 --> 00:08:59,139
那这类参考视频的难点呢

219
00:08:59,139 --> 00:09:00,360
不是画面好不好看

220
00:09:00,360 --> 00:09:02,980
而是运动的逻辑能不能保留

221
00:09:02,980 --> 00:09:06,100
那我们先来看一下我们上一个视频当中

222
00:09:06,100 --> 00:09:07,799
他测试的这个结果

223
00:09:07,799 --> 00:09:12,759
这一条视频的基本保留了参考动画的完整流程

224
00:09:12,759 --> 00:09:14,620
零件先聚合成相机

225
00:09:14,620 --> 00:09:15,659
然后呢

226
00:09:15,659 --> 00:09:17,179
有一个停顿展示

227
00:09:17,179 --> 00:09:18,059
随后呢

228
00:09:18,100 --> 00:09:21,039
镜头沿着光轴展开

229
00:09:21,039 --> 00:09:21,940
顶部的面板

230
00:09:21,940 --> 00:09:25,919
电路板和机身外壳保持着清楚的前后关系

231
00:09:25,919 --> 00:09:27,139
最后的重新收拢

232
00:09:27,139 --> 00:09:28,720
形成了完整的产品

233
00:09:28,720 --> 00:09:32,820
那我们再来看一下TOMate的三部模型生成的效果

234
00:09:32,820 --> 00:09:35,799
这个结果第一眼觉得非常有视觉冲击力

235
00:09:35,799 --> 00:09:36,779
相机是真实的

236
00:09:36,779 --> 00:09:37,720
零件很多

237
00:09:37,720 --> 00:09:39,899
金属和玻璃的材质也不差

238
00:09:39,899 --> 00:09:41,740
但是只要对照参考视频

239
00:09:41,740 --> 00:09:45,580
你会发现参考视频里边的逻辑几乎没有保留下来

240
00:09:45,580 --> 00:09:48,100
相机的主体一开始就以力

241
00:09:48,100 --> 00:09:49,360
这种结构出现了

242
00:09:49,360 --> 00:09:54,580
周围的零件更像悬浮在周围的装饰性碎片啊

243
00:09:54,580 --> 00:09:55,659
没有按照镜头

244
00:09:55,659 --> 00:09:56,440
传感器

245
00:09:56,440 --> 00:09:57,120
电路板

246
00:09:57,120 --> 00:09:59,019
机身外壳的层次展开

247
00:09:59,019 --> 00:09:59,620
所以说呢

248
00:09:59,620 --> 00:10:03,779
这个就是三部最危险的一个地方

249
00:10:03,779 --> 00:10:05,519
画面的可能好看

250
00:10:05,519 --> 00:10:06,639
但是呢

251
00:10:06,639 --> 00:10:08,039
你很容易忽略

252
00:10:08,039 --> 00:10:11,919
他已经把我们要做的主体任务给做错了

253
00:10:11,919 --> 00:10:17,139
那经过四组测试TOMate H3三部Laura的能力边界的已经非常清楚了

254
00:10:17,139 --> 00:10:17,960
如果你生成的

255
00:10:18,100 --> 00:10:19,960
这种大脸低动作

256
00:10:19,960 --> 00:10:25,000
普通的人物表演简单的镜头推进或者是常规的氛围视频

257
00:10:25,000 --> 00:10:28,659
他那非常值得去尝试使用不但速度快

258
00:10:28,659 --> 00:10:30,419
效果的也会不错

259
00:10:30,419 --> 00:10:31,600
那在主模型方面

260
00:10:31,600 --> 00:10:36,100
如果非常在意自然的复制或者是较轻的AI感

261
00:10:36,100 --> 00:10:38,320
可以尝试使用singularity

262
00:10:38,320 --> 00:10:43,480
如果最在意构图的边界指令的遵循和结构的准确度

263
00:10:43,480 --> 00:10:45,240
那可以使用官方的模型

264
00:10:45,240 --> 00:10:46,980
但是除此之外

265
00:10:46,980 --> 00:10:47,980
其他

266
00:10:47,980 --> 00:10:52,419
的高难度任务可能这个Laura的都是不能胜任的

267
00:10:52,419 --> 00:10:54,759
比方说快速的动作

268
00:10:54,759 --> 00:10:59,980
比方说特殊的摄影过程还包括高难度的参考生成

269
00:10:59,980 --> 00:11:04,500
所以说那一个模型不是单纯的谈他好还是不好

270
00:11:04,500 --> 00:11:09,159
而是要搞清楚他到底合用在什么地方好

271
00:11:09,159 --> 00:11:10,379
今天我们就说这么多

272
00:11:10,379 --> 00:11:12,399
关注我做一个懂爱的人
