SDXL与Krea2-Boogu同提示词对比实测-2026-09-13.md

SDXL vs Krea2 Turbo vs Boogu Turbo:同提示词 A/B 实测

测试日期:2026-09-13 23:50 CST | 执行机:DSH 机 192.168.31.76 | 推理机:GPU 机 192.168.31.31 环境:ComfyUI 0.34.0 · RTX 5060 Ti 16GB · LOW_VRAM 档(--lowvram --force-fp16 --reserve-vram 1.0 --fast-disk) 触发:用户判断「SD1.5 和 SDXL 的效果已经远弱于目前主流生图模型」——本文用同一条提示词做四档 A/B 验证


一、结论速览

判断成立,且差距是结构性(架构级)的,不是调参能补的。

评判维度① SDXL base 1.0② SDXL uberRealistic 合并档③ Krea2 Turbo④ Boogu Turbo
核心主体「店主」❌ 完全缺失❌ 完全缺失✅ 亚洲老年男性、米色开衫✅ 老年男性、米色毛衣
核心动作「把书放上书架」❌❌✅ 双手举书入架✅ 单手扶书入架
橘猫 / 茶杯 / 黄铜台灯仅猫❌ 全缺✅ 三样全中✅ 三样全中
木招牌文字 "BOOKS"❌ 乱码 BSUNDPSLOES❌ 无文字✅ 拼写完全正确✅ 拼写完全正确
窗外蓝霓虹 + 雨痕部分(蓝色门板,非霓虹)❌✅ 日式霓虹街景 + 雨窗✅ 日式霓虹街景 + 雨窗
手部结构无(画面无人)无(画面无人)✅ 双手自然持书✅ 单手自然扶书
采样步数303094
出图耗时(含模型加载)~20 s~30 s~60 s~46 s

一句话:四张图里,两档 SDXL 都把提示词的主语(店主)整个丢了 —— ① 退化成"书店门面+一只猫",② 退化成"无人书店内景"。而 Krea2 / Boogu 把人物、动作、道具、空间关系、窗外街景全部落地,招牌英文还拼对了。

对比拼图:AB_compare_grid.png(2×2,左上→右下 = ①②③④)


二、方法(公平性说明)

先堵住"是不是故意挑弱模型 / 用弱参数"的质疑:

提示词(全文,可复现):

a cozy japanese secondhand bookstore at dusk, an elderly shopkeeper in a beige cardigan
carefully places a worn hardcover onto a tall wooden shelf, stacks of vintage paperbacks
and a brass reading lamp on the counter, a ginger cat asleep beside a ceramic teacup,
warm tungsten light spilling across the floorboards while rain-streaked windows reflect
blue neon signs outside, a hand-painted wooden sign reading "BOOKS" above the doorway,
shot on 35mm film, shallow depth of field, fine grain, cinematic color grading

四档的 API 请求 JSON 原样归档在同目录 prompts/ 下(sdxl_base.json、sdxl_urpm.json、krea2.json、boogu.json)。


三、机制证据:SDXL 为什么抓不住长提示

用 ComfyUI venv 的 SDTokenizer 对这条提示词做实测:

CLIP-L 编码结果:2 个 chunk,各 77 token
  chunk 0:75 个有效 token
     "a cozy japanese secondhand bookstore at dusk, an elderly shopkeeper in a beige
      cardigan carefully places a worn hardcover onto a tall wooden shelf, ... blue neon
      signs outside, a"
  chunk 1:30 个有效 token + 46 个 padding
     "- painted wooden sign reading "books" above the doorway, shot on 35mm film,
      shallow depth of field, fine grain, cinematic color grading"

⚠️ 这里纠正一个流传很广的误解(我在本次会话中也先说错了,后经实测更正):

所以差距不在于"词有没有被看到",而在于文本理解器的容量与编码方式,以及主干的架构代际(U-Net+交叉注意力 vs DiT+rectified flow)。这一点无法通过调参、加权、加 LoRA 弥补。


四、逐张点评

#文件实际画面
①AB1_sdxl_base_00001_.png从店外看书店正门:木门、两侧书架、一只橘猫走过地板。招牌上是一串乱码 BSUNDPSLOES(模型知道该有文字,但字母顺序失控)。没有店主、没有放书动作、没有茶杯、没有台灯。整体偏数码平光、材质塑料感
②AB2_sdxl_urpm_00001_.png无人的书店内部全景:密集书架、吊灯、暖色木调、窗外绿树。构图与光照比 ① 精致、质感更好,但店主和橘猫都不存在,提示词的核心事件(把书放上书架)完全没有发生;招牌文字也未生成
③AB3_krea2_00001_.png完整实现提示词:亚洲老年男性穿米色开衫,双手把一本精装书举上书架;柜台上一只橘猫酣睡在茶杯旁,黄铜台灯暖光,木招牌 "BOOKS" 拼写正确,窗外是雨夜日式霓虹街景,胶片颗粒与浅景深到位
④AB4_boogu_00001_.png与 ③ 高度接近的高质量实现:老年男性在书架前取放书,橘猫睡在柜台上,台灯/茶杯/书堆齐备,"BOOKS" 木招牌正确,窗外蓝色霓虹+湿街反光。仅 4 步采样即达到该质量

五、耗时与显存


六、结论与建议

  1. 你的判断成立,而且这次实测把差距定位得很具体:不在"画风好不好看",而在提示词遵循度、主体完整性、文字渲染这三项现代生图的核心能力上,SDXL 世代出现的是整段语义丢失(连主语都没了),这属于架构级差距。
  2. 你机器上早就不是只有老模型:Krea2 Turbo、JANK2、Boogu-Image(Base/Edit/Turbo)权重、文本编码器、VAE、官方工作流 JSON 全部就位,零下载成本即可用。真正的问题是一直在用 checkpoints/ 那 27 个老档(125GB)。
  3. 保留 SDXL 的正当理由只有一条:它海量的 LoRA / ControlNet 生态与可自训练性(尤其特定动漫审美、特定人物 likeness、特定构图控制)。作为通用出图主力,建议切到 Krea2(写实与美感)或 Boogu(快,4 步)。
  4. 若要进一步提升,16GB 卡的现代候选:Z-Image Turbo(6B,消费卡 5–10s/图,Apache 2.0)、FLUX.2 [klein] 4B(~8GB,Apache 2.0)、Qwen-Image 2.0(7B,中英文字渲染最强,Apache 2.0)。
  5. 磁盘现状 91% 已用(剩 109GB),而那 125GB 老 checkpoint 是最大可回收池 —— 建议在确认不再使用后分批清理。

附:文件清单

文件说明
AB_compare_grid.png2×2 对比拼图(带标签)
AB1_sdxl_base_00001_.pngSDXL base 1.0 官方基线
AB2_sdxl_urpm_00001_.pngSDXL uberRealisticPornMerge v12 写实合并档
AB3_krea2_00001_.pngKrea2 Turbo fp8(9 步)
AB4_boogu_00001_.pngBoogu-Image Turbo nvfp4(4 步)
prompts/*.json四档的 ComfyUI API 请求原文(可直接 POST /prompt 复现)

复现命令(GPU 机 ComfyUI 运行时,从 DSH 机执行):

curl -s --noproxy '*' -X POST http://192.168.31.31:8189/prompt \
  -H 'Content-Type: application/json' -d @prompts/krea2.json
下载此文件