触发问题:「Singularity 太糊了,前面生成的几个视频也非常糊,官方怎么说,社区怎么说」 日期:2026-09-11 · 实测机:192.168.31.31(RTX 5060 Ti 16GB)
minimax_h3_ref2v_turbo_4step_v0.1 这个 4 步加速 LoRA。模型卡原文(HF 模型卡,本站走 hf-mirror 抓取):
minimax_h3_ref2v_turbo_4step_v0.1"→ 也就是说:"Singularity 糊"这件事,官方既没承认是模型问题,也就没给补救参数;它认为配 4 步 LoRA 是"几乎无质量损失"的快路径。我们踩的坑不在这句话覆盖范围内。
res_multistep / simple / guidance 1 / shift 12·317n+5 网格(24fps 下 124 帧 = 5s)video_shift(如 8–10)"(默认 12 把预算压在高噪声的大结构上);"大结构/运动不稳 → 调高到 14–16";改 shift 必须重新目视验证音画同步res_multistep + 21 sigma 点是二阶积分器:20 次 DiT ≈ euler 40–50 步的精度,"同一份权重,不需要重新量化"| 变体 | 体积 | 官方/社区定位 |
|---|---|---|
| bf16 | 66 GB | 无损天花板 |
| int8_convrot | 34 GB | 主流甜点 |
| pruned fp8 / pruned int8_convrot | 21 GB | 低显存折中(我们用的就是这一类) |
(对照表见 66G/34G/21G 怎么选)
InstaSD 对 r/StableDiffusion 那条 186 评论热帖的复盘 是这次最有价值的一手材料:
| 社区反馈 | 成因(写在 LoRA 仓库 README 里,但帖子里几乎没人看) |
|---|---|
| "output is a blurry mess" | LoRA 强度默认 1.0 在模糊侧;模糊/重影要调高到 1.05–1.2;反之"过锐、塑料感、颗粒"要调到 0.8–0.95 |
| "量化底座上完全没效果" | 在量化底座(int8 / fp8 / pruned)上开 low_vram/merge,会把小的低秩更新"合并后舍入掉"——省了显存,效果丢大半 |
| 音频失真、爆音 | H3 视频/音频跑 不同 shift 调度(12 vs 3);4 步时普通采样器在一根时间表上推两条流 → 音频被过冲。需用双时钟采样器,或 ComfyUI 已合入的 PR #15243 |
| "只快了 10%" | 许多人的"基线"其实是 10 步而非 20 步;且文本编码、VAE 解码、模型加载不受 LoRA 影响 |
| 训练暂停而非完成 | 作者明说:把锐度推到这个程度开始出现塑料皮肤与过锐颗粒,于是 ckpt850 之后暂停训练 → 说明"锐 vs 塑料"本身就是这对旋钮的两端 |
| 缓存节点不能叠 Turbo | 4 步下相邻步已不相似,EasyCache/TeaCache 之类叠上去无意义 |
ref2v_turbo_4step 是为原始 H3 ref2v 训练的,直接压到 Singularity 这个融合微调上,本身就属于"跨模型套 LoRA",效果没有保证(Singularity 官方推荐它,但没有给出"量化的 Singularity + merge"这种组合的验证数据)。| 项 | 官方质量基线 | 我们实际跑的 | 后果 |
|---|---|---|---|
| 分辨率 | 1344×768(1.0 MP);0.5 MP 只是"预览档,细节更软" | 0.4 MP(544×736 / 864×480) | 出片低于官方预览档,细节天然不足;这就是"整体发虚"的第一来源 |
| 步数 | 20 步(或 turbo 4–8 步但需匹配 + 调强度) | 4 步 | 4 步是最激进档 |
| 采样器 | res_multistep(二阶,20 点 ≈ euler 40–50 步精度) | euler(一阶) | 同预算下细节最少 |
| shift | 12/3 默认;细节糊可降到 8–10 | 12/3 未动 | 丢了一个现成的"补细节"旋钮 |
| Turbo LoRA 施加方式 | 迭代替换用;量化底座上应避免合并 | LoRA 强度 1.0 且合并进 pruned-int8 权重 | 社区实测:量化底座 merge 会把 LoRA 效果舍入掉大半;而 4 步模糊的正确方向是调高到 1.05–1.2 |
| 底座精度 | — | pruned(剪枝)+ int8 | 21GB 低显存档,本身是折中方案 |
| 注意力 | — | Sol-Attn 稀疏 | 次要因素(近似注意力会略微软化,但不是主因) |
| 观感测 | — | — | 见第五节实测 |
一句话:把 0.4MP、4 步、euler、量化的 Singularity、合并式 LoRA 五个"省字诀"叠在一起,得到的就是一条糊片。 换 V18 之所以明显更锐,是因为它 8 步、且 turbo 是烘焙进模型的(不是外挂合并),加上 dasiwa 那套模型本身就是为快速档调过的。
只改「步数 / LoRA / 底座」这三件事,抽 6 帧(1/3/5/7/9/11s)算 Laplacian 方差均值:
| 组 | 配置 | Laplacian 方差 | 相对 A |
|---|---|---|---|
| A | Singularity + 4 步 + Turbo LoRA(强度 1.0,合并进 int8 权重) | 235.6 | 1.00× |
| B | Singularity + 8 步 + 不加 LoRA | 374.1 | 1.59× |
| C | V18 fused 8turbo + 8 步(turbo 烘焙在权重里) | 463.4 | 1.97× |
8.0s 同帧三方对比图(对比_三方_08.0s_ABC.jpg)肉眼结论一致:
读法:把「4 步 + merge 式 LoRA」换成「8 步 + 不加 LoRA」,单独就追回 59% 的锐度;剩下到 V18 的 24% 差距才是模型/配方层面(Singularity 是 pruned int8 且 turbo 外挂,V18 是 hybrid bf16 + 8turbo 混合精度、turbo 内建)。
2026-09-11 深夜按第六节配方实测跑通,同提示词 / 同 seed 1790377983 / 同 12s:
| 组 | 配置 | 原生分辨率 | 归一化到 544×736 | 相对 A |
|---|---|---|---|---|
| A | Singularity 4 步 + Turbo(merge) 0.40MP | 235.6 | 235.6 | 1.00× |
| B | Singularity 8 步 无 LoRA 0.40MP | 374.1 | 374.1 | 1.59× |
| C | V18 8 步 0.40MP | 463.4 | 463.4 | 1.97× |
| D | Singularity 20 步 res_multistep 无 LoRA 0.89MP | 284.3 | 573.8 | 2.44× |
两个必须注意的读数陷阱:
代价:33.2 分钟/条(0.89MP 下单步约 1.8 分钟 × 20 步 ≈ 28 分钟采样),是 A 组(4.1 分钟)的 8 倍、C 组 V18(5.9 分钟)的 5.6 倍。
成品:20260911_哥斯拉摧毁储气罐_12s_832x1120_Sing20步res_multistep.mp4,同帧四方对比 对比_四方_08.0s_ABCD.jpg——D 里储气罐鳞片状外壁、哥斯拉头颈鳞纹、背鳍边缘、篷顶布面褶皱都清晰可辨,A 组那种"整幅橘色雾化"消失。
| 视频 | 路线 | Laplacian 方差 |
|---|---|---|
| 哥斯拉雕像 12s(静止大场景) | Singularity 4 步 + Turbo + Sol | 618.1 |
| smoke 864×480(人物跑动+运动模糊) | Singularity 4 步 + Turbo + Sol | 38.4 |
⚠️ Laplacian 方差强依赖画面内容(火焰/烟雾/运动模糊拉低,静止高对比纹理拉高)。雕像那条比 V18 灾难还高,正说明不能拿跨内容数字下结论——只有 5.1 的三组是严格可比的。
res_multistep + simple:官方文档实测同画质下比 euler 快 2.46×(denoise 层),反过来说就是"同样的时间能换回更多细节"。原来 4 步 euler 的位置,改成 8 步 res_multistep,时间差不多、细节明显更好。一采:960×544 或 1280×704(0.5–0.9MP)
步数 20(res_multistep + simple) 或 turbo 8 步 + 强度调优
guidance 1,shift video 12 / audio 3
二采:H3 学习型潜空间放大 → 目标 2×
basic scheduler beta / 3 步 / denoise 0.2–0.4
⚠️ conditioning 里的参考图/首尾帧必须同步放大
这就是我们 9 月 11 日已经在 minimax_h3_director_二采_Singularity_0.4MP_1.5x_1280x704.json 里接好的那条链路——只是它的"一采"我们之前一直用 0.4MP/4 步在跑。把一采提到 0.5–0.9MP、步数提上去,二采才有意义。
video_shift 从 12 降到 9–10(文档原文:"细节糊、纹理少 → 调低"),改完必须复查音画同步;Denoise/detail 型二次采样(就是"二采");官方说 Singularity 就是主打不糊的,还让你配 4 步 LoRA;社区说 4 步 + 量化合并这条路本来就容易糊(要调强度、别 merge),并且公认的补细节手段是"提分辨率 + 二阶采样器 + 二采放大"。我们实测:同内容下 V18 比"0.4MP/4 步 Singularity"锐约 2 倍——问题主要出在我们自己给一采配的 0.4MP + 4 步 euler + merge 式 LoRA 上,而不是 Singularity 这个模型。按修正配方跑出的 D 组(0.9MP / 20 步 res_multistep / 无 LoRA)归一化后锐度 573.8,反超 V18 24%、是原糊片的 2.44 倍,代价是 33 分钟/条。