C-本地ComfyUI复现方案.md

C · 本地 ComfyUI 复现方案(RTX 5060 Ti 16GB / Blackwell sm_120)

调研时间:2026-09-12 目标机:单卡 RTX 5060 Ti 16GB(sm_120,驱动 610.43.02 / CUDA 13.2)、32GB RAM、Linux、ComfyUI 已部署 8189、已有 MiniMax H3 工作流经验。 题材:①「仙宫/天宫」宏大场景 ②「珠光宝气古风美女」人物特写。 文中标注「(未证实)」的为单一来源或推算值,其余尽量给实测出处。


0. 结论速览(先看这段)

  1. 出图主力选 FLUX.1 Krea dev(fp8 或 GGUF Q8),992×1440 / 20 步在本卡热启动约 53 秒(Aidec 实测);Qwen-Image Q4_K_S 更适合做「换脸/换镜头」的编辑环节(4 步加速版算图 21~23 秒)。
  2. 不要碰 FLUX.2 dev:fp8 版本 33GB,本卡能跑但需要 83GB 总内存,GGUF Q5 出 992×1440 要 4 分钟以上、1024×1024 也要 1.5~3 分钟,性价比远低于 Qwen-Image。
  3. 视频主力 Wan2.2:I2V 14B(smoothMix Q8/Q6 + BlockSwap + Sage)在本卡 496×720 / 81 帧热启动 133 秒、97 帧 158 秒;HunyuanVideo 1.5 同尺寸 97 帧 198 秒(稍慢但更省显存、物理更真)。
  4. MiniMax H3 继续保留:864×480 / 5.17 秒 / 20 步 + EasyCache = 194 秒(不加缓存 633 秒),是目前唯一能本地出带同步音频 + 身份保持较好的路线;Turbo LoRA 可把 20 步 230s 压到 8 步 116s。
  5. 古风/仙侠资源以 SD1.5 / SDXL / Illustrious 老生态最全(汉服、仙侠、古建 LoRA 绝大多数是这两个底模),Flux 侧靠「通用古风 LoRA + 光影 LoRA + 提示词」补;社区已有人做 LTXV 2.3 的仙侠 LoRA,可直接进视频侧。
  6. 单条「5 秒 720p 成品」本地链路:关键帧 60s + 放大 30s + I2V 130~200s ≈ 4~5 分钟;同等质量上云(Kling 2.1 Pro)约 $0.28/5s。建议:本地跑循环试错与关键帧,云端只出终稿镜头。

1. 软件底座:sm_120 的四个必踩坑

坑现象处理
PyTorch CUDA 版本低于 cu128 的轮子无 sm_120 kernel → no kernel image is available 或首次 kernel 直接崩必须 pip install --force-reinstall --index-url https://download.pytorch.org/whl/cu130 torch torchvision torchaudio(cu128 亦可,cu130 才有 ComfyUI 的量化加速)
requirements 顺序torch 未 pin,在 cu130 安装之后再跑 requirements.txt 会把 torch 覆盖回默认源,静默失去加速顺序固定:requirements.txt 先,CUDA 13 栈最后装;启动日志必须看到 +cu130 与 comfy-kitchen CUDA backend available: True
Triton / torch.compilesm_120 的 triton 支持滞后,Cannot find a working triton installation不强求 triton;SageAttention 走源码编译:TORCH_CUDA_ARCH_LIST=12.0 MAX_JOBS=8 pip install --no-build-isolation "git+https://github.com/thu-ml/SageAttention.git"(--no-build-isolation 必须,否则 pip 会拉第二份 torch)
32GB 内存 + pinned memoryH3 这类大模型在 32GB 机器上被 OOM-killer 杀启动加 --disable-pinned-memory(3090/32GB 实测:默认 29,866MB 被杀 → 7,508MB 跑通);另可 --fast-disk、--reserve-vram 0.5、--lowvram

补充事实:


2. 出图模型选型(16GB 实际可行配置)

2.1 实测对照(均为 RTX 5060 Ti 16GB)

模型量化/文件显存占用实测耗时结论
FLUX.1 Krea devfp8_e4m3fn 或 GGUF Q8_0(约 12.6GB,Q4_K_M 约 7.4GB,(未证实精确字节))~13GB992×1440 / 20 步 = 53s 纯算图(冷启含加载 121.7s)⭐ 写实古风首选
FLUX.1 dev同上~13GBfp8 下与 Krea dev、Art Fusion 速度无差异;default 权重下 Krea 稍慢与 Krea 二选一
Qwen-Image官方 fp8 20.43GB → 必 OOM;GGUF qwen-image-Q4_K_S.gguf 12.14GB(Q4_K_M 13.07 / Q5_K_S 14.12 / Q5_K_M 14.93)~13GB(Q4_K_S),Q5 需文本编码器 offload参考 A4000 16GB:50 步 ≈7min、Lightning 8 步 ≈2min、4 步 ≈1min;本卡实测 Qwen-Rapid-AIO 4 步:1080×1360 算图 23s(总 36.8s)⭐ 中文提示词/画面内文字最强、编辑首选
Flux.2 devfp8 33GB + 16.7GB 文本编码器靠 ComfyUI 分块能塞进 16.5GB,但吃 83.3GB 总内存1024×1024 / 20 步 = 171.6s❌ 本机不实用
Flux.2 dev GGUFQ4_K_M / Q5_K_MQ5 无法完全驻留1024×1024 >3min;992×1440 >4min;开 EasyCache 后 1024×1024 / 20 步 = 91s❌ 除非只要 1024 且开缓存
Krea 2 Turbo社区 FP8 krea2_turbo_fp8.safetensors 12.01GB + Qwen3-VL-4B fp8(4.88GB)+ Qwen-Image VAE采样期约 12GB + 小 VAE无本卡公开实测(verdict: unknown)备选新秀,8 步 / CFG 1.0 / er_sde / 1280×720
SDXL 古风生态见 §36~8GB秒级~十几秒/张⭐ 资源最全,做 2.5D 古风/汉服最省事
NoobAI / Illustrious见 §36~8GB秒级二次元仙侠,不适合写实

推荐配置

来源:FLUX.1 dev × 5060 Ti、Qwen-Image × 5060 Ti 配方、Krea 2 配方、Aidec 5060Ti 实测、Aidec Flux2 GGUF 实测。


3. 古风 / 仙侠 LoRA 与 Checkpoint 资源清单

以下均为 Civitai 上真实可检索到的条目(通过 Civitai API 逐条拉取验证,含底模与下载量)。Civitai 官方域名在本网被 DNS 污染,实际下载可用 civitai.red 镜像(API key 见 ~/Downloads/civitai_api_key.txt);哩布/LiblibAI(liblib.art)站点可达(HTTP 200),但其搜索 API 返回 500,本次无法程序化枚举,需手工站内搜「古风/仙侠/汉服」。

3.1 仙侠 / 国风风格

模型名类型/底模下载量链接
Xianxia Art Style(触发词 xianxia style)LoRA / Illustrious759https://civitai.com/models/1955005
仙侠道/xianxia/taoist/法天象地LoRA / SD1.55,099https://civitai.com/models/96244
PAseer 的仙侠之境LoRA / SD1.56,613https://civitai.com/models/33107
Illustrious Xianxia – v1LoRA / Illustrious164https://civitai.com/models/972599
xianxiaLoRA / Flux.1 D304https://civitai.com/models/821282
Xianxia/wuxia StyleLoRA / Flux.2 Klein 9B-base334https://civitai.com/models/2503410
ChineseXianxiaStyleLoRA / LTXV 2.3447https://civitai.com/models/2489394
花想容/Chinese style/古风LoRA / SD1.5+Anima17,152https://civitai.com/models/89348
国风3 GuoFeng3Checkpoint / SD1.5160,805https://civitai.com/models/10415
国风4 GuoFeng4 XLCheckpoint / SDXL 1.027,357https://civitai.com/models/118009
GuoFeng Photo Realistic XLCheckpoint / SDXL 1.0626https://civitai.com/models/844395
PAseer-SDXL-Immortal FairyLoRA / SDXL353https://civitai.com/models/140768

麦橘 majicMIX 系列(SDXL 写实国风常用底模)本次未在 API 检索中确认具体条目号,标注(未证实),需在 Civitai 站内手搜。

3.2 汉服 / 宫廷服饰

模型名底模下载量链接
hanfu 汉服SD1.5106,378https://civitai.com/models/15365
hanfu tang 汉服唐风 / song 宋风 / ming 明风SD1.523,684 / 9,000 / 5,23244395 / 47916 / 65314
漢服/Hanfu(XL,ill,Pony)Illustrious,NoobAI,Pony6,231https://civitai.com/models/441397
汉服合集 [Flux.1] Hanfu Collection [Female]Flux.1 D4,867https://civitai.com/models/832674
Hanfu Chinese Girl Flux lora(写实摄影)Flux.1 D700https://civitai.com/models/719331
hanfu(palace style)中国宫廷服饰SD1.51,377https://civitai.com/models/82535
汉服服装概念加强Illustrious714https://civitai.com/models/1320362
NSFW汉服_Flux_LoraFlux.1 D13,301https://civitai.com/models/730204

3.3 仙宫 / 古建 / 云海

模型名底模下载量链接
Ancient Chinese architectural style(中国古建筑样式)SD1.511,191https://civitai.com/models/18679
Chinese architecture SD1.5&SDXLSD1.5+SDXL3,342https://civitai.com/models/133096
Chinese Traditional Architecture 中式古建筑SDXL987https://civitai.com/models/236217
中国天坛 CHINA_temple of heavenSDXL355https://civitai.com/models/321431
Chinese architectural style Suzhou gardensSD1.55,490https://civitai.com/models/24187
A_Guochao Architectural Illustrations_Ancient Style SceneFlux.1 D65https://civitai.com/models/1870190
DN_Chinese Architectural DesignFlux.1 D69https://civitai.com/models/1935230

「云海」没有专门的 LoRA(Civitai 无有效结果),建议走提示词 + 体积光 LoRA:sea of clouds, cloud ocean, aerial view above clouds, volumetric god rays, mist, atmospheric perspective, ethereal。

3.4 珠光宝气 / 珠宝材质

模型名底模下载量链接
Bracelet Jewelry Gemstone Pearl Diamond Flux1.d LoraFlux.1 D465https://civitai.com/models/859143
Love Yourself Jewelry Dazzling Diamond Necklace Flux1.dFlux.1 D455https://civitai.com/models/855908
jewelry黄金钻石珠宝水晶翡翠饰品SDXL Checkpoint2,634https://civitai.com/models/188730
jewelry Slider - Pony / SDXLPony4,105https://civitai.com/models/535926
GemstoneAI - konyconiSD1.59,081https://civitai.com/models/49374
gems, crystal art/conceptSD1.52,840https://civitai.com/models/79815
Kanzashi - Japanese Hair Ornament (Illustrious)Illustrious442https://civitai.com/models/1084415

3.5 电影感打光 / 逆光轮廓光(仙宫必备)

模型名底模下载量链接
Backlight (Hair light) cinematic lighting style XL + F1DFlux.1 D + SDXL3,901https://civitai.com/models/380852
Cinematic "Warm Light" 3200k Lighting Style XL + F1D + Illu + PonyFlux.1 D/SDXL/Illustrious12,361https://civitai.com/models/290860
Cinematic Volumetric (God Rays) Lighting Style同上6,233https://civitai.com/models/289500
Cinematic Moonlight "Cool Light" 5600k同上3,128https://civitai.com/models/290864
Silhouette (cinematic lighting) style XL + F1D + zitFlux.1 D/SDXL/ZIT3,228https://civitai.com/models/391031
Cinematic Dark LightingFlux.2 Klein 9B, Krea 22,860https://civitai.com/models/2477155
Golden Healing Light Effect / Dreamy Color PaletteFlux.1 D446https://civitai.com/models/1197893

3.6 降 AI 味(颗粒 / 色散 / 胶片)

模型名底模链接
NL2 | film grain & chromatic aberrationIllustrioushttps://civitai.com/models/2670117
Film Grain - CEFlux.2 Klein 9B / Qwen / ZImagehttps://civitai.com/models/693745
FilmGrain.RedmondFlux.2 / Qwen / SDXL / ZIThttps://civitai.com/models/233140
Film Grain SliderZImageTurbohttps://civitai.com/models/2642226
水墨风格_ink wash paintingPony / SDXLhttps://civitai.com/models/231966
Ink Wash FusionFlux.1 D / Flux.1 Kreahttps://civitai.com/models/993138

3.7 推荐权重组合(Flux Krea dev 为基准)

古风底味:     风格 LoRA (xianxia/古风)        0.5 ~ 0.7
服装:         汉服 Collection [Flux.1]         0.7 ~ 0.9
配饰:         Jewelry Gemstone Pearl Diamond   0.6 ~ 0.8
打光:         Backlight (Hair light)           0.6 ~ 0.8   ← 轮廓光/发丝光
               Cinematic Warm Light 3200k       0.5 ~ 0.7   ← 与上面二选一或叠加降权
氛围:         Volumetric God Rays              0.4 ~ 0.6
质感:         film grain & chromatic aberration 0.3 ~ 0.5  ← 只在这一步加,最后加
加速:         Flux Lightning 8step             0.6 ~ 0.8   (与风格 LoRA 同开时整体再降 0.1~0.2)
换脸:         BFS 换脸 LoRA                    0.8         (实测 1.0 会出画面问题)

经验规则:风格类 ≤0.8、材质/光照类 ≤0.8、加速类 0.6~0.8、颗粒类 ≤0.5;总 LoRA 数超过 4 个时 Flux 会掉细节,建议串成两级采样(第一级只放风格+服装,第二级只放打光+颗粒)。


4. 三套节点级工作流

工作流 A(主力):Flux Krea 出关键帧 → 4x 放大 → Wan2.2 5B 图生视频

[1] Unet Loader (GGUF)          flux1-krea-dev-Q8_0.gguf        ← city96/FLUX.1-Krea-dev-gguf
[2] DualCLIPLoader              t5xxl_fp8_e4m3fn + clip_l
[3] CLIPTextEncode              中文长句 + 英文材质词(见 §7)
[4] EmptyLatentImage            896 × 1344(或 832×1216,16 的倍数)
[5] LoraLoader 链(顺序即优先级)
      ① 古风/汉服 LoRA 0.80
      ② 珠宝 LoRA 0.65
      ③ Backlight(Hair light) 0.70
      ④ Flux Lightning 8step 0.70
[6] KSampler                    euler / simple / steps 20(无 Lightning)或 8(有 Lightning)
                                cfg 1.0 / denoise 1.0 / 固定 seed
[7] VAEDecode → SaveImage
──────────── 放大(可选,出 2K 关键帧) ────────────
[8] Upscale Image (using Model)  4x-UltraSharp.pth   ← 1024→4096 一次到位
[9] ImageScaleBy                 ×0.5(4096→2048,避免 I2V 吃分辨率)
    备选:Ultimate SD Upscale(tile 1024, denoise 0.20, ControlNet tile)做细节回补
──────────── 图生视频(Wan2.2 5B) ────────────
[10] Wan22ImageToVideoLatent     width 1024 / height 576 / length 121(5s@24fps)/ batch 1
[11] Unet Loader (GGUF)          Wan2.2-TI2V-5B-Q8_0.gguf(QuantStack,5.4GB)
[12] LoraLoaderModelOnly         lightx2v Wan2.2-Lightning 4step(high/low noise 各一)
[13] KSampler                    4 步 / cfg 1.0 / lcm 或 euler
[14] VAEDecode → CreateVideo(24fps) → SaveVideo

工作流 B:Qwen-Image 出图 → Qwen-Image-Edit 2509 改镜头/换脸 → I2V

[1] Unet Loader (GGUF)     qwen-image-Q4_K_S.gguf (12.14GB)
[2] CLIPLoader             qwen_2.5_vl_7b_fp8_scaled.safetensors(type: qwen_image)
[3] LoraLoaderModelOnly    Qwen-Image-Lightning-8steps-V1.0.safetensors
[4] KSampler               8 步(或 Rapid-AIO 4 步)/ cfg 1.0 / euler
[5] VAEDecode → SaveImage
──────── 生成角色三视图(用于身份锚定)────────
[6] TextEncodeQwenImageEdit  "character turnaround sheet, front / side / back view,
                              same person, plain background, full body"
[7] TextEncodeQwenImageEdit  + BFS 换脸 LoRA 0.80
    提示词模板(实测有效):
      "head swap from Image 1 to Image 2, keep all facial details and hair from
       Image 1, blend naturally with Image 2's body, keep the same expression and
       head proportion as in Image 2"
[8] 输出:同一人 × N 个镜头/角度 → 交给工作流 A 的第 10 步

来源:Qwen-Image Edit 2509 换脸实例(含 BFS LoRA 提示词与 0.8 权重)、city96/Qwen-Image-gguf。

工作流 C:仙宫航拍长镜头(全本地)

Flux Krea(云海+仙宫+God Rays LoRA 0.55)
  → 4x-UltraSharp 放大到 2560×1440
  → Wan2.2 I2V 14B(Q8 High + Q6 Low,BlockSwap 10~16)
     496×720 / 97 帧 / sage auto / EasyCache
  → RIFE/FILM 插帧 24→48fps(可选)
  → 胶片颗粒 + 色散 LoRA 或后处理滤镜

与已有 H3 的分工:H3 出「有人物 + 要说话/有音效」的镜头,Wan2.2 出纯场景/运镜镜头。


5. 视频侧横向对比(16GB 实测优先)

模型配置分辨率 / 帧5060 Ti 实测来源可信度
Wan2.2 I2V 14BsmoothMixWan22 High Q8 + Low Q6 + BlockSwap + Sage + TorchPatch496×720 / 81f冷启 222.8s → 热启 133.2sAidec 本卡实测 ⭐
同上同上496×720 / 97f158.6sAidec 本卡实测 ⭐
同上(另一篇)同工作流496×720 / 97f131.7sAidec 本卡实测 ⭐
Wan2.2 TI2V-5BQ8_0 GGUF + SageAttention 2.21024×574 / 5s≈7 分钟HF 讨论区单条二手数据(未证实)
Wan2.2 14B GGUF Q4+ T5 CPU offload480p显存 6~8GB,时长 20min+/条(未证实)估算
HunyuanVideo 1.5720p i2v cfg-distilled fp8,cfg 1,euler beta,ModelSamplingSD3=5496×720 / 97f198.0s(比 Wan 慢些,显存更省,物理更好,24fps)Aidec 本卡实测 ⭐
LTX-2.5 22BQ3_K_M GGUF(10.73GB)+ conv VAE1920×1088 / 97f183.1s;0.97 s/megapixel-frame;峰值 14.1~15.5GB单机 15 次实测,confidence 0.6 ⭐
LTX-2.5同上1664×960 / 193f294.1s同上
MiniMax H3pruned int8-convrot + qwen3vl-32b nvfp4,20 步 + EasyCache864×480 / 5.17s194s(热 185s);无 EasyCache 633s两篇公开实测 ⭐
MiniMax H3同上0.9MP / 10s≈20 分钟(用户报告)讨论区
MiniMax H3 + Turbo LoRA8 步—20 步 230s → 8 步 116s(未标 GPU)讨论区(未证实)
CogVideoX 5B——已明显落后于 Wan/Hunyuan,不建议新上共识

选型建议

  1. 主力 = Wan2.2:I2V 14B 质量最好(496×720 / 4 秒热启 130~160s);追求速度/省显存用 5B TI2V + Lightning 4 步(显存仅需 8GB 级)。
  2. 要音效/对白 → MiniMax H3(已有,唯一本地同步出音频;注意 768p 是本地上限,2K 阶段未开源)。
  3. 要长镜头 + 音频的快速草稿 → LTX-2.5 Q3_K_M(1080p / 4 秒 183s,且它能跑到 1920×1088 还有 1.8GB 余量)。
  4. HunyuanVideo 1.5 作为 Wan 的对照:更省显存、物理更真,但略慢、动作偏"过动"。
  5. 14B 的 T2V/I2V 官方文档写「单卡至少 80GB」,那是 FP16 全量;社区 GGUF + T5 offload 才是本卡的可行路径。

来源:Wan2.2 VRAM 全档位表、HunyuanVideo 1.5 VRAM 表、Wan2.2 5B on 5060 Ti 配方、LTX-2.5 15 次仪器化实测。


6. 一致性技术(同一个人出现在多个镜头)

按「成本 / 效果」排序:

方案底模16GB 可行性用途
三视图 + ref2v已有 H3 工作流✅ 已在用最强的身份锚定;配 h3-turnaround-autoprep 技能先裁出正面图
Qwen-Image-Edit 2509 + BFS 换脸 LoRA(0.8)Qwen-Image✅ 4 步加速后 20~35s/张把已定妆的脸批量贴到不同镜头/角度,v1 保脸型、v2 换整头
PuLID for FLUX(PaoloC68/ComfyUI-PuLID-Flux-Chroma)FLUX.1 / Chroma✅(约 +2~3GB)单张参考图锁脸,比 InstantID 轻
PuLID ✦ Flux.2Flux.2需先解决 Flux.2 内存问题未来路线
InstantIDSDXL⚠️ 需 insightface,Py3.13 上编译常失败SDXL 老工作流可用
IP-Adapter FaceIDSDXL⚠️ 同样依赖 insightface同上报错 No module named insightface 是常见坑
FLUX ReduxFLUX.1✅保风格/构图/服装,不保脸;权重 0.4~0.6 用
FLUX.1 Kontext devFLUX.1✅(GGUF 有量化版)指令式编辑:「同一个人换到侧脸/换背景」
固定 seed + 同 LoRA 组合全部✅免费的一致性基础,务必先做

跨镜头实操配方

  1. 用 Qwen-Image 或 Flux 出一张「定妆照」,锁定 seed;
  2. 走 Qwen-Image-Edit 2509 + BFS(0.8) 生成 3~5 个角度的同人图(或直接出一张三视图);
  3. 每个镜头:参考图 + 服装 LoRA 0.8 + 打光 LoRA 0.7 + Redux 0.5;
  4. 视频阶段统一用同一参考图走 Wan2.2 I2V,或走 H3 ref2v(身份保持是 H3 的强项,实测"比 LTX 好很多");
  5. LTX-2.5 上要注意:身份漂移与分辨率绑死——640×320 会明显漂,768×448 以上才稳(未证实是否可外推到其它模型)。

7. 「珠光宝气」质感 + 降 AI 味的具体手段

7.1 材质与光照(LoRA + 提示词)

7.2 ControlNet

用途模型说明
锁构图Flux: ControlNet-Union / SDXL: controlnet-depth、canny放大前锁结构
锁姿势SDXL openpose / Flux 的 pose 适配多镜头保持一致姿态
放大细节回补controlnet-tileUltimate SD Upscale 标配
建筑结构古建 LoRA + depth仙宫柱廊/飞檐不走形

7.3 降 AI 味(四步走)

  1. 加颗粒:film grain LoRA 0.3~0.5,或后期节点(ComfyUI 的 滤镜调节 / AdvancedImageFilter)加 grain + 轻微 chromatic aberration;
  2. 破完美:提示词加 skin texture, pores, slight asymmetry, film scan, imperfect focus, motion blur;降低 cfg(Flux cfg 固定 1.0,则靠降 LoRA 权重);
  3. 胶片 LUT:本地用 ColorCorrect / Image Filter Adjustments 节点套胶片 LUT,或在 DaVinci Resolve 里统一调(推荐:本地方案的最后一步统一走 Resolve,输出更"人味");
  4. 混入噪点/压缩痕迹:轻微 JPEG 或 8-bit 量化,能显著降低"过于干净"的 AI 感(谨慎,容易过头)。

8. 时间与成本估算:本地 vs 云

8.1 单件耗时(本卡,热启动)

环节模型/配置耗时
关键帧出图FLUX.1 Krea dev fp8,992×1440 / 20 步≈53 秒
关键帧出图(大尺寸)同上 + DyPE,1440×2560≈94 秒
关键帧出图(快速迭代)Qwen-Image 4 步/Rapid-AIO,1080×1360≈21~23 秒
放大4x-UltraSharp 1024→4096数秒~十余秒(未证实)
放大(高质量)SUPIR 单张 1024 级1~3 分钟(未证实)
视频 5 秒 720pWan2.2 I2V 14B(496×720 / 97f ≈ 4 秒)130~160 秒
视频 5 秒 720pWan2.2 5B TI2V Q8≈7 分钟(未证实)
视频 5 秒 720pHunyuanVideo 1.5 i2v fp8≈198 秒
视频 4 秒 1080pLTX-2.5 Q3_K_M≈183 秒
视频 5 秒 480p 带音频MiniMax H3 + EasyCache≈194 秒

成品链路预算:关键帧 60s + 放大 30s + I2V 150s ≈ 4 分钟/条 5 秒 720p;一天 8 小时可出约 100~120 条(含试错迭代会打 5~8 折 → 实际 15~30 条可用)。

8.2 与云 API 对比(2026-05 公开价)

供应商模型$/秒5 秒成本生成时长
快手Kling 2.1 Standard(720p)0.014$0.07~60s
快手Kling 2.1 Pro(1080p)0.056$0.28~90s
GoogleVeo3(1080p,上限 8s)0.10$0.50~150s
RunwayGen 4 Turbo / Standard0.10 / 0.05$0.50 / $0.2530~60s
OpenAISora0.12$0.60~120s
字节Seedance 2.00.06$0.30~80s

关键修正:失败率 10~15%、平均需 2~3 次迭代,所以真实成本要乘 2.5×,加上抽卡损耗,行业实测「一条能用的 AI 视频,实际成本是标价的 5~20 倍」。

本地成本:5060 Ti 满载约 180W × 4 分钟 ≈ 0.012 kWh ≈ 电费不到 1 分钱/条(不含硬件折旧与时间)。

8.3 「哪些放本地 / 哪些上云」

环节建议理由
概念探索、构图、风格试错本地(Flux Krea 8~20 步 / Qwen-Image 4 步)秒级反馈,零边际成本
古风 LoRA 调权重、打光试错本地需要几十次快速迭代
关键帧定稿 + 放大本地(+ 放大)2K 出图本地已够用
人物一致性镜头(同一人多角度)本地(Qwen-Image-Edit + BFS / H3 ref2v)云端无对应开源级控脸能力
纯场景/运镜镜头(仙宫航拍、云海)本地 Wan2.2 / LTX-2.5130~200s/条可接受
带对白/音效的镜头本地 MiniMax H3(已有)唯一本地同步音频方案
复杂多人交互、需要 1080p 物理正确上云 Kling 2.1 Pro / Veo3本地 16GB 做不到稳定
商业终稿、客户交付素材上云(Kling Pro 或 Veo3)质量与一致性上限更高
快速打样给客户看上云 Kling Standard($0.07/5s)便宜到接近电费

一句话策略:本地承担 80% 的迭代 + 所有关键帧 + 所有身份一致性工作;云端只买 "复杂动作 + 1080p 终稿" 这两个本地做不到的能力。


9. 落地检查清单


主要来源

下载此文件