Singularity糊不糊-官方与社区口径+实测归因.md

Singularity 糊不糊?——官方口径、社区口碑与我们的实测归因

触发问题:「Singularity 太糊了,前面生成的几个视频也非常糊,官方怎么说,社区怎么说」 日期:2026-09-11 · 实测机:192.168.31.31(RTX 5060 Ti 16GB)


一、结论先行(三句话)

  1. 官方口径:不承认糊,反而主打"抗糊"。Singularity 模型卡把「HDR 画质、减少高速动作运动模糊、修复中远景糊脸」写在第一行卖点,自称 clean, sharp,并且官方明确推荐配 minimax_h3_ref2v_turbo_4step_v0.1 这个 4 步加速 LoRA。
  2. 社区口径:4 步 Turbo 路径"一半人说香、一半人说糊",且糊是有明确成因的——① 4 步 + 量化底座上把 LoRA 合并进权重会把 LoRA 效果抹掉大半;② 模糊时要调高 LoRA 强度(1.05–1.2),而不是调低;③ H3 音视频双时钟,4 步时普通采样器会让音频过冲。
  3. 我们这几条确实糊,但主因是参数不是模型:0.4MP(低于官方"预览档 0.5MP")+ 4 步 euler(一阶)+ turbo LoRA 合并进 pruned-int8 权重,三重叠加。官方质量基线是 1344×768 / 20 步 / res_multistep。
  4. 控制变量实测(同提示词同 seed):只把「4 步 + merge 式 LoRA」换成「8 步 + 不加 LoRA」,锐度就从 235.6 提到 374.1(+59%);再换成 V18 的 8turbo 模型到 463.4(+97%)。而按修正配方补跑的 D 组(Singularity / 0.89MP / 20 步 res_multistep / 无 LoRA)在归一化到同一尺寸后达 573.8,是四组最高——比原始糊片高 2.44 倍,比 V18 还高 24%;代价是 33 分钟/条(约 8 倍于 4 步档)。→ "糊"里大部分是参数问题;要最高画质,把分辨率与步数提上去即可,不必换模型。

二、官方怎么说

2.1 Singularity 作者(AIGC-Singularity / WarmBloodAban)

模型卡原文(HF 模型卡,本站走 hf-mirror 抓取):

→ 也就是说:"Singularity 糊"这件事,官方既没承认是模型问题,也就没给补救参数;它认为配 4 步 LoRA 是"几乎无质量损失"的快路径。我们踩的坑不在这句话覆盖范围内。

2.2 MiniMax H3 官方体系的画质基线(社区转述的官方设置)

2.3 权重精度(官方发布的变体)

变体体积官方/社区定位
bf1666 GB无损天花板
int8_convrot34 GB主流甜点
pruned fp8 / pruned int8_convrot21 GB低显存折中(我们用的就是这一类)

(对照表见 66G/34G/21G 怎么选)


三、社区怎么说

3.1 4 步 Turbo LoRA:186 条评论吵成两半,一半在喊糊

InstaSD 对 r/StableDiffusion 那条 186 评论热帖的复盘 是这次最有价值的一手材料:

社区反馈成因(写在 LoRA 仓库 README 里,但帖子里几乎没人看)
"output is a blurry mess"LoRA 强度默认 1.0 在模糊侧;模糊/重影要调高到 1.05–1.2;反之"过锐、塑料感、颗粒"要调到 0.8–0.95
"量化底座上完全没效果"在量化底座(int8 / fp8 / pruned)上开 low_vram/merge,会把小的低秩更新"合并后舍入掉"——省了显存,效果丢大半
音频失真、爆音H3 视频/音频跑 不同 shift 调度(12 vs 3);4 步时普通采样器在一根时间表上推两条流 → 音频被过冲。需用双时钟采样器,或 ComfyUI 已合入的 PR #15243
"只快了 10%"许多人的"基线"其实是 10 步而非 20 步;且文本编码、VAE 解码、模型加载不受 LoRA 影响
训练暂停而非完成作者明说:把锐度推到这个程度开始出现塑料皮肤与过锐颗粒,于是 ckpt850 之后暂停训练 → 说明"锐 vs 塑料"本身就是这对旋钮的两端
缓存节点不能叠 Turbo4 步下相邻步已不相似,EasyCache/TeaCache 之类叠上去无意义

3.2 社区公认的"补细节"手段:二采 / 潜空间放大

3.3 关于"是不是 Singularity 这个融合模型自己的问题"


四、我们这几条为什么糊(逐项归因)

项官方质量基线我们实际跑的后果
分辨率1344×768(1.0 MP);0.5 MP 只是"预览档,细节更软"0.4 MP(544×736 / 864×480)出片低于官方预览档,细节天然不足;这就是"整体发虚"的第一来源
步数20 步(或 turbo 4–8 步但需匹配 + 调强度)4 步4 步是最激进档
采样器res_multistep(二阶,20 点 ≈ euler 40–50 步精度)euler(一阶)同预算下细节最少
shift12/3 默认;细节糊可降到 8–1012/3 未动丢了一个现成的"补细节"旋钮
Turbo LoRA 施加方式迭代替换用;量化底座上应避免合并LoRA 强度 1.0 且合并进 pruned-int8 权重社区实测:量化底座 merge 会把 LoRA 效果舍入掉大半;而 4 步模糊的正确方向是调高到 1.05–1.2
底座精度—pruned(剪枝)+ int821GB 低显存档,本身是折中方案
注意力—Sol-Attn 稀疏次要因素(近似注意力会略微软化,但不是主因)
观感测——见第五节实测

一句话:把 0.4MP、4 步、euler、量化的 Singularity、合并式 LoRA 五个"省字诀"叠在一起,得到的就是一条糊片。 换 V18 之所以明显更锐,是因为它 8 步、且 turbo 是烘焙进模型的(不是外挂合并),加上 dasiwa 那套模型本身就是为快速档调过的。


五、客观测量 + 控制变量实验

5.1 严格 A/B/C(同提示词、同 seed 1790377983、同画布 544×736、同 12s、同 Sol-Attn)

只改「步数 / LoRA / 底座」这三件事,抽 6 帧(1/3/5/7/9/11s)算 Laplacian 方差均值:

组配置Laplacian 方差相对 A
ASingularity + 4 步 + Turbo LoRA(强度 1.0,合并进 int8 权重)235.61.00×
BSingularity + 8 步 + 不加 LoRA374.11.59×
CV18 fused 8turbo + 8 步(turbo 烘焙在权重里)463.41.97×

8.0s 同帧三方对比图(对比_三方_08.0s_ABC.jpg)肉眼结论一致:

读法:把「4 步 + merge 式 LoRA」换成「8 步 + 不加 LoRA」,单独就追回 59% 的锐度;剩下到 V18 的 24% 差距才是模型/配方层面(Singularity 是 pruned int8 且 turbo 外挂,V18 是 hybrid bf16 + 8turbo 混合精度、turbo 内建)。

5.1b 按修正配方补跑:0.9MP + 20 步 + res_multistep + 无 LoRA(D 组)

2026-09-11 深夜按第六节配方实测跑通,同提示词 / 同 seed 1790377983 / 同 12s:

组配置原生分辨率归一化到 544×736相对 A
ASingularity 4 步 + Turbo(merge) 0.40MP235.6235.61.00×
BSingularity 8 步 无 LoRA 0.40MP374.1374.11.59×
CV18 8 步 0.40MP463.4463.41.97×
DSingularity 20 步 res_multistep 无 LoRA 0.89MP284.3573.82.44×

两个必须注意的读数陷阱:

  1. 原生分辨率下的 Laplacian 不可跨分辨率比较:D 在原生 832×1120 下只有 284.3,反而低于 B/C。原因是同一份画面细节摊到 2.3 倍像素上,单位像素梯度能量自然下降——不是 D 更糊。
  2. 公平做法是归一化到同一尺寸再算(本表第三列,统一缩到 544×736):D 的 573.8 是四组最高,比 V18(463.4)还高 24%,是原始糊片(235.6)的 2.44 倍。 ⚠️ 但也要说清:高分辨率图缩到小尺寸本身有超采样红利,这一列衡量的是"画面里真实存在的细节量",不是"同一构图下的逐像素锐度"(D 因为分辨率/采样器变化,镜头构图已经漂移,与 A/B/C 并非同一帧构图)。

代价:33.2 分钟/条(0.89MP 下单步约 1.8 分钟 × 20 步 ≈ 28 分钟采样),是 A 组(4.1 分钟)的 8 倍、C 组 V18(5.9 分钟)的 5.6 倍。

成品:20260911_哥斯拉摧毁储气罐_12s_832x1120_Sing20步res_multistep.mp4,同帧四方对比 对比_四方_08.0s_ABCD.jpg——D 里储气罐鳞片状外壁、哥斯拉头颈鳞纹、背鳍边缘、篷顶布面褶皱都清晰可辨,A 组那种"整幅橘色雾化"消失。

5.2 顺带测量(跨内容,仅作参考)

视频路线Laplacian 方差
哥斯拉雕像 12s(静止大场景)Singularity 4 步 + Turbo + Sol618.1
smoke 864×480(人物跑动+运动模糊)Singularity 4 步 + Turbo + Sol38.4

⚠️ Laplacian 方差强依赖画面内容(火焰/烟雾/运动模糊拉低,静止高对比纹理拉高)。雕像那条比 V18 灾难还高,正说明不能拿跨内容数字下结论——只有 5.1 的三组是严格可比的。


六、修正配方(按性价比排序)

立刻能改的三件事(不加成本或小幅加成本)

  1. 把分辨率提回 0.5 MP 以上:竖版 576×1024(0.59MP)/ 608×1088(0.66MP);横版 960×544(0.52 MP)。这一步对"糊"的改善最直接。
  2. 采样器换 res_multistep + simple:官方文档实测同画质下比 euler 快 2.46×(denoise 层),反过来说就是"同样的时间能换回更多细节"。原来 4 步 euler 的位置,改成 8 步 res_multistep,时间差不多、细节明显更好。
  3. turbo LoRA 不要用 merge 到量化底座:走运行时注入(bypass enable)/或干脆不用 LoRA 跑到 8–12 步;如果继续用 4 步,把强度从 1.0 提到 1.05–1.2(社区给的"糊 → 提强度"方向)。

要质量就上这条(时间换质量)

一采:960×544 或 1280×704(0.5–0.9MP)
      步数 20(res_multistep + simple) 或 turbo 8 步 + 强度调优
      guidance 1,shift video 12 / audio 3
二采:H3 学习型潜空间放大 → 目标 2×
      basic scheduler beta / 3 步 / denoise 0.2–0.4
      ⚠️ conditioning 里的参考图/首尾帧必须同步放大

这就是我们 9 月 11 日已经在 minimax_h3_director_二采_Singularity_0.4MP_1.5x_1280x704.json 里接好的那条链路——只是它的"一采"我们之前一直用 0.4MP/4 步在跑。把一采提到 0.5–0.9MP、步数提上去,二采才有意义。

如果细节还是不够


七、一句话回答你

官方说 Singularity 就是主打不糊的,还让你配 4 步 LoRA;社区说 4 步 + 量化合并这条路本来就容易糊(要调强度、别 merge),并且公认的补细节手段是"提分辨率 + 二阶采样器 + 二采放大"。我们实测:同内容下 V18 比"0.4MP/4 步 Singularity"锐约 2 倍——问题主要出在我们自己给一采配的 0.4MP + 4 步 euler + merge 式 LoRA 上,而不是 Singularity 这个模型。按修正配方跑出的 D 组(0.9MP / 20 步 res_multistep / 无 LoRA)归一化后锐度 573.8,反超 V18 24%、是原糊片的 2.44 倍,代价是 33 分钟/条。


附:参考链接

下载此文件