# Singularity 糊不糊？——官方口径、社区口碑与我们的实测归因

> 触发问题：「Singularity 太糊了，前面生成的几个视频也非常糊，官方怎么说，社区怎么说」
> 日期：2026-09-11 · 实测机：192.168.31.31（RTX 5060 Ti 16GB）

---

## 一、结论先行（三句话）

1. **官方口径：不承认糊，反而主打"抗糊"**。Singularity 模型卡把「HDR 画质、减少高速动作运动模糊、修复中远景糊脸」写在第一行卖点，自称 *clean, sharp*，并且**官方明确推荐配 `minimax_h3_ref2v_turbo_4step_v0.1` 这个 4 步加速 LoRA**。
2. **社区口径：4 步 Turbo 路径"一半人说香、一半人说糊"，且糊是有明确成因的**——① 4 步 + 量化底座上把 LoRA **合并**进权重会把 LoRA 效果抹掉大半；② 模糊时要**调高** LoRA 强度（1.05–1.2），而不是调低；③ H3 音视频双时钟，4 步时普通采样器会让音频过冲。
3. **我们这几条确实糊，但主因是参数不是模型**：**0.4MP（低于官方"预览档 0.5MP"）+ 4 步 euler（一阶）+ turbo LoRA 合并进 pruned-int8 权重**，三重叠加。官方质量基线是 **1344×768 / 20 步 / res_multistep**。
4. **控制变量实测（同提示词同 seed）**：只把「4 步 + merge 式 LoRA」换成「8 步 + 不加 LoRA」，锐度就从 235.6 提到 374.1（**+59%**）；再换成 V18 的 8turbo 模型到 463.4（**+97%**）。**而按修正配方补跑的 D 组（Singularity / 0.89MP / 20 步 res_multistep / 无 LoRA）在归一化到同一尺寸后达 573.8，是四组最高——比原始糊片高 2.44 倍，比 V18 还高 24%**；代价是 33 分钟/条（约 8 倍于 4 步档）。→ **"糊"里大部分是参数问题；要最高画质，把分辨率与步数提上去即可，不必换模型。**

---

## 二、官方怎么说

### 2.1 Singularity 作者（AIGC-Singularity / WarmBloodAban）

模型卡原文（[HF 模型卡](https://huggingface.co/WarmBloodAban/Minimax-h3_Singularity)，本站走 hf-mirror 抓取）：

- *"The result is a clean, sharp, and highly dynamic video generation model."*
- 核心改动第一条：**"HDR Image Quality & Blur Reduction：在高动态范围（HDR）视频数据集上微调，显著提升清晰度并消除高速动作下的运动模糊"**
- 第二条：**"Distant Face Restoration：大幅减少中长镜头中的面部畸变、模糊与崩坏"**
- 第三条：**"Clean & De-Oiled Aesthetic：去掉厚重油光"**
- 第八条：**"Full Base Capability Retention：100% 保留 H3 原有的提示词跟随、风格适应与基础能力"**
- **加速推荐**：*"For high-speed generation with minimal quality loss, we strongly recommend pairing with `minimax_h3_ref2v_turbo_4step_v0.1`"*

→ 也就是说：**"Singularity 糊"这件事，官方既没承认是模型问题，也就没给补救参数**；它认为配 4 步 LoRA 是"几乎无质量损失"的快路径。我们踩的坑不在这句话覆盖范围内。

### 2.2 MiniMax H3 官方体系的画质基线（社区转述的官方设置）

- **[Best MiniMax H3 Settings](https://www.seedance.tv/blog/best-minimax-h3-settings)**（2026-08-18，汇总官方/ComfyUI 基线）：
  - 画质基线 = **1344×768（≈1.0 MP）/ 20 步 / `res_multistep` / `simple` / guidance 1 / shift 12·3**
  - **本地开源权重上限就是 768p 档**；**0.5 MP 的定位原话是 "Local preview … Fastest, softer detail"（更快、细节更软）**；4–8 步**只在配了匹配的 Turbo LoRA 且只做迭代**时使用
  - H3 是 guidance-distilled，"keep guidance at 1"
  - 帧数必须踩 `17n+5` 网格（24fps 下 124 帧 = 5s）
- **RunningHub 官方插件文档**（[Dual Sigma Sampler 参数与选择指南](https://github.com/HM-RunningHub/ComfyUI_RH_MinMaxH3/blob/main/docs/sampling_CN.md)）：
  - **H3 的唯一正确采样入口是双时钟采样器**（视频 shift 12 / 音频 shift 3 各走各的调度）；标准 KSampler 替代不了
  - **"细节糊、纹理少 → 调低 `video_shift`（如 8–10）"**（默认 12 把预算压在高噪声的大结构上）；"大结构/运动不稳 → 调高到 14–16"；改 shift 必须重新目视验证音画同步
  - `res_multistep` + 21 sigma 点是**二阶积分器**：20 次 DiT ≈ euler 40–50 步的精度，**"同一份权重，不需要重新量化"**
  - 一切 accel/cache 档位都是近似路径，输出与基准不同

### 2.3 权重精度（官方发布的变体）

| 变体 | 体积 | 官方/社区定位 |
|---|---|---|
| bf16 | 66 GB | 无损天花板 |
| int8_convrot | 34 GB | 主流甜点 |
| pruned fp8 / pruned int8_convrot | 21 GB | **低显存折中**（我们用的就是这一类） |

（对照表见 [66G/34G/21G 怎么选](https://www.cnblogs.com/easyeye/articles/22256960)）

---

## 三、社区怎么说

### 3.1 4 步 Turbo LoRA：186 条评论吵成两半，一半在喊糊

[InstaSD 对 r/StableDiffusion 那条 186 评论热帖的复盘](https://www.instasd.com/post/minimax-h3-turbo-lora-comfyui-4-steps) 是这次最有价值的一手材料：

| 社区反馈 | 成因（写在 LoRA 仓库 README 里，但帖子里几乎没人看） |
|---|---|
| "output is a blurry mess" | **LoRA 强度默认 1.0 在模糊侧**；模糊/重影要**调高到 1.05–1.2**；反之"过锐、塑料感、颗粒"要调到 0.8–0.95 |
| "量化底座上完全没效果" | **在量化底座（int8 / fp8 / pruned）上开 `low_vram`/merge，会把小的低秩更新"合并后舍入掉"——省了显存，效果丢大半** |
| 音频失真、爆音 | H3 视频/音频跑 **不同 shift 调度（12 vs 3）**；4 步时普通采样器在一根时间表上推两条流 → 音频被过冲。需用双时钟采样器，或 ComfyUI 已合入的 PR #15243 |
| "只快了 10%" | 许多人的"基线"其实是 10 步而非 20 步；且文本编码、VAE 解码、模型加载**不受 LoRA 影响** |
| 训练暂停而非完成 | 作者明说：**把锐度推到这个程度开始出现塑料皮肤与过锐颗粒**，于是 ckpt850 之后暂停训练 → 说明"锐 vs 塑料"本身就是这对旋钮的两端 |
| 缓存节点不能叠 Turbo | 4 步下相邻步已不相似，EasyCache/TeaCache 之类叠上去无意义 |

### 3.2 社区公认的"补细节"手段：二采 / 潜空间放大

- [MiniMax H3 两阶段工作流指南](https://www.seedance.tv/zh/blog/minimax-h3-two-stage-workflow)：第一遍低清定运动/构图/音频，**放大 H3 latent 后低噪声重采样**补高频细节；风险是"过度重加噪声会改人脸/音轨"
- [Sigma Refine + 潜空间放大，改善小脸崩坏](https://bbs.monster/thread-4721-1-1.html)：同类思路
- [LBH 学习型潜空间放大器](https://huggingface.co/LBH-123-AI/Minimax_h3_latent_Upscaler)（我们机器上已装）：社区用神经网络做 latent 放大而不是插值
- B 站 T8 的 [Singularity 大量测评对比 + 单采 VDN + 双采非官方工作流](https://www.bilibili.com/video/BV1rDbs6jE55/)：**社区自己也是把 Singularity 当"底座"，再叠 VDN / 双采**，而不是指望单采 4 步出高清

### 3.3 关于"是不是 Singularity 这个融合模型自己的问题"

- 社区对它的一致评价是"锐、动态强、去掉油光"，**抱怨集中在"配 4 步 turbo 后的模糊/塑料"**，而不是模型本身糊；
- 也有一个容易混淆的坑：**LoRA 与底座要配套**。我们用的 `ref2v_turbo_4step` 是为**原始 H3 ref2v** 训练的，直接压到 Singularity 这个融合微调上，本身就属于"跨模型套 LoRA"，效果没有保证（Singularity 官方推荐它，但没有给出"量化的 Singularity + merge"这种组合的验证数据）。

---

## 四、我们这几条为什么糊（逐项归因）

| 项 | 官方质量基线 | 我们实际跑的 | 后果 |
|---|---|---|---|
| **分辨率** | 1344×768（1.0 MP）；0.5 MP 只是"预览档，细节更软" | **0.4 MP**（544×736 / 864×480） | 出片**低于官方预览档**，细节天然不足；这就是"整体发虚"的第一来源 |
| **步数** | 20 步（或 turbo 4–8 步但需匹配 + 调强度） | **4 步** | 4 步是最激进档 |
| **采样器** | `res_multistep`（二阶，20 点 ≈ euler 40–50 步精度） | **`euler`（一阶）** | 同预算下细节最少 |
| **shift** | 12/3 默认；**细节糊可降到 8–10** | 12/3 未动 | 丢了一个现成的"补细节"旋钮 |
| **Turbo LoRA 施加方式** | 迭代替换用；量化底座上应避免合并 | **LoRA 强度 1.0 且合并进 pruned-int8 权重** | 社区实测：量化底座 merge 会把 LoRA 效果舍入掉大半；而 4 步模糊的正确方向是**调高到 1.05–1.2** |
| **底座精度** | — | **pruned（剪枝）+ int8** | 21GB 低显存档，本身是折中方案 |
| **注意力** | — | Sol-Attn 稀疏 | 次要因素（近似注意力会略微软化，但不是主因） |
| **观感测** | — | — | 见第五节实测 |

**一句话：把 0.4MP、4 步、euler、量化的 Singularity、合并式 LoRA 五个"省字诀"叠在一起，得到的就是一条糊片。** 换 V18 之所以明显更锐，是因为它 8 步、且 turbo 是**烘焙进模型**的（不是外挂合并），加上 dasiwa 那套模型本身就是为快速档调过的。

---

## 五、客观测量 + 控制变量实验

### 5.1 严格 A/B/C（**同提示词、同 seed 1790377983、同画布 544×736、同 12s、同 Sol-Attn**）

只改「步数 / LoRA / 底座」这三件事，抽 6 帧（1/3/5/7/9/11s）算 Laplacian 方差均值：

| 组 | 配置 | Laplacian 方差 | 相对 A |
|---|---|---|---|
| **A** | Singularity + **4 步** + Turbo LoRA（强度 1.0，**合并进 int8 权重**） | **235.6** | 1.00× |
| **B** | Singularity + **8 步** + **不加 LoRA** | **374.1** | **1.59×** |
| **C** | **V18** fused 8turbo + 8 步（turbo 烘焙在权重里） | **463.4** | **1.97×** |

8.0s 同帧三方对比图（`对比_三方_08.0s_ABC.jpg`）肉眼结论一致：

- **A**：整幅被橘色雾化，哥斯拉只剩一团轮廓，储气罐是一根扁平圆柱——就是你说的"糊"；
- **B**：结构回来了——能看清储气罐被撕成两截、烟柱走向、哥斯拉头部与背鳍轮廓；细节仍偏软；
- **C**：最锐——背鳍一根根、张口与发光眼、篷顶被撕成一片片带 1/2/3 号牌、桁架与火焰纹理都在。

**读法**：把「4 步 + merge 式 LoRA」换成「8 步 + 不加 LoRA」，**单独就追回 59% 的锐度**；剩下到 V18 的 24% 差距才是模型/配方层面（Singularity 是 pruned int8 且 turbo 外挂，V18 是 hybrid bf16 + 8turbo 混合精度、turbo 内建）。

### 5.1b 按修正配方补跑：**0.9MP + 20 步 + res_multistep + 无 LoRA**（D 组）

2026-09-11 深夜按第六节配方实测跑通，同提示词 / 同 seed 1790377983 / 同 12s：

| 组 | 配置 | 原生分辨率 | **归一化到 544×736** | 相对 A |
|---|---|---|---|---|
| **A** | Singularity 4 步 + Turbo(merge) 0.40MP | 235.6 | **235.6** | 1.00× |
| **B** | Singularity 8 步 无 LoRA 0.40MP | 374.1 | **374.1** | 1.59× |
| **C** | V18 8 步 0.40MP | 463.4 | **463.4** | 1.97× |
| **D** | **Singularity 20 步 res_multistep 无 LoRA 0.89MP** | 284.3 | **573.8** | **2.44×** |

**两个必须注意的读数陷阱**：

1. **原生分辨率下的 Laplacian 不可跨分辨率比较**：D 在原生 832×1120 下只有 284.3，反而低于 B/C。原因是同一份画面细节摊到 2.3 倍像素上，单位像素梯度能量自然下降——**不是 D 更糊**。
2. **公平做法是归一化到同一尺寸再算**（本表第三列，统一缩到 544×736）：**D 的 573.8 是四组最高**，比 V18（463.4）还高 **24%**，是原始糊片（235.6）的 **2.44 倍**。
   ⚠️ 但也要说清：高分辨率图缩到小尺寸本身有超采样红利，这一列衡量的是"画面里真实存在的细节量"，不是"同一构图下的逐像素锐度"（D 因为分辨率/采样器变化，镜头构图已经漂移，与 A/B/C 并非同一帧构图）。

**代价**：33.2 分钟/条（0.89MP 下单步约 1.8 分钟 × 20 步 ≈ 28 分钟采样），是 A 组（4.1 分钟）的 **8 倍**、C 组 V18（5.9 分钟）的 **5.6 倍**。

**成品**：`20260911_哥斯拉摧毁储气罐_12s_832x1120_Sing20步res_multistep.mp4`，同帧四方对比 `对比_四方_08.0s_ABCD.jpg`——D 里储气罐鳞片状外壁、哥斯拉头颈鳞纹、背鳍边缘、篷顶布面褶皱都清晰可辨，A 组那种"整幅橘色雾化"消失。

### 5.2 顺带测量（跨内容，仅作参考）

| 视频 | 路线 | Laplacian 方差 |
|---|---|---|
| 哥斯拉雕像 12s（静止大场景） | Singularity 4 步 + Turbo + Sol | 618.1 |
| smoke 864×480（人物跑动+运动模糊） | Singularity 4 步 + Turbo + Sol | 38.4 |

⚠️ **Laplacian 方差强依赖画面内容**（火焰/烟雾/运动模糊拉低，静止高对比纹理拉高）。雕像那条比 V18 灾难还高，正说明**不能拿跨内容数字下结论**——只有 5.1 的三组是严格可比的。

---

## 六、修正配方（按性价比排序）

### 立刻能改的三件事（不加成本或小幅加成本）

1. **把分辨率提回 0.5 MP 以上**：竖版 576×1024（0.59MP）/ 608×1088（0.66MP）；横版 960×544（0.52 MP）。这一步对"糊"的改善最直接。
2. **采样器换 `res_multistep` + `simple`**：官方文档实测同画质下**比 euler 快 2.46×（denoise 层）**，反过来说就是"同样的时间能换回更多细节"。原来 4 步 euler 的位置，改成 8 步 res_multistep，时间差不多、细节明显更好。
3. **turbo LoRA 不要用 merge 到量化底座**：走运行时注入（bypass enable）/或干脆不用 LoRA 跑到 8–12 步；如果继续用 4 步，把**强度从 1.0 提到 1.05–1.2**（社区给的"糊 → 提强度"方向）。

### 要质量就上这条（时间换质量）

```
一采：960×544 或 1280×704（0.5–0.9MP）
      步数 20（res_multistep + simple） 或 turbo 8 步 + 强度调优
      guidance 1，shift video 12 / audio 3
二采：H3 学习型潜空间放大 → 目标 2×
      basic scheduler beta / 3 步 / denoise 0.2–0.4
      ⚠️ conditioning 里的参考图/首尾帧必须同步放大
```
这就是我们 9 月 11 日已经在 `minimax_h3_director_二采_Singularity_0.4MP_1.5x_1280x704.json` 里接好的那条链路——**只是它的"一采"我们之前一直用 0.4MP/4 步在跑**。把一采提到 0.5–0.9MP、步数提上去，二采才有意义。

### 如果细节还是不够

- **`video_shift` 从 12 降到 9–10**（文档原文："细节糊、纹理少 → 调低"），改完必须复查音画同步；
- 加 `Denoise`/detail 型二次采样（就是"二采"）；
- 接受"锐 vs 塑料"是同一根旋钮：过分追求锐度会得到塑料皮肤与颗粒（LoRA 作者自己在 ckpt850 停训就是这个原因）。

---

## 七、一句话回答你

**官方说 Singularity 就是主打不糊的，还让你配 4 步 LoRA；社区说 4 步 + 量化合并这条路本来就容易糊（要调强度、别 merge），并且公认的补细节手段是"提分辨率 + 二阶采样器 + 二采放大"。我们实测：同内容下 V18 比"0.4MP/4 步 Singularity"锐约 2 倍——问题主要出在我们自己给一采配的 0.4MP + 4 步 euler + merge 式 LoRA 上，而不是 Singularity 这个模型。按修正配方跑出的 D 组（0.9MP / 20 步 res_multistep / 无 LoRA）归一化后锐度 573.8，反超 V18 24%、是原糊片的 2.44 倍，代价是 33 分钟/条。**

---

## 附：参考链接

- Singularity 官方模型卡（hf-mirror 抓取）：https://hf-mirror.com/WarmBloodAban/Minimax-h3_Singularity
- ComfyUI Wiki 新闻：https://comfyui-wiki.com/zh/news/2026-09-07-h3-singularity
- 官方设置基线汇总：https://www.seedance.tv/blog/best-minimax-h3-settings
- 两阶段（二采）指南：https://www.seedance.tv/zh/blog/minimax-h3-two-stage-workflow
- RunningHub 双时钟采样器参数指南：https://github.com/HM-RunningHub/ComfyUI_RH_MinMaxH3/blob/main/docs/sampling_CN.md
- 4 步 Turbo 社区复盘（186 评论帖）：https://www.instasd.com/post/minimax-h3-turbo-lora-comfyui-4-steps
- 权重变体对比：https://www.cnblogs.com/easyeye/articles/22256960
- 学习型潜空间放大器：https://huggingface.co/LBH-123-AI/Minimax_h3_latent_Upscaler
- 社区 Singularity 测评/双采工作流（B 站）：https://www.bilibili.com/video/BV1rDbs6jE55/
