README.md

学习型 Latent 放大与二阶段生成

这一组把低分辨率 H3 首次生成的干净联合 AV latent,经独立 3D 学习型模型放大视频空间,再在高分辨率画布继续联合音画去噪。它与普通插值放大不同,也不会修改原来的 Latent Upscale by 32 稳定节点。

工作流

模型与成果

学习型工作流读取 ComfyUI/models/latent_upscale_models/minimax_h3_latent_upscaler_3d_fp16.safetensors。当前固定文件SHA-256为 043E5A48E161610EF6C3EA974645220354D06FA618ABCA15F76D084812EB55C2,322个FP16张量、24通道3D输入输出。节点只处理视频latent,音频latent保持联合H3原值;默认每次完成后只定向卸载该放大模型的GPU权重。

当前已确认本地和上游网络的322个参数及固定随机输入输出逐位一致。最新示例固定到上游工作流 64fc9d4的I2VA合同:FL2VA full INT8、正确comfyui_alpha8 LightX2V LoRA、量化底模bypass加载、 shift 12/3、低清simple8前4步,以及高分原始4步sigma 0.9035, 0.8, 0.6316, 0.3158, 0。不要使用缺少PEFT alpha处理的普通_comfyui文件;它会把LoRA更新 放大约16倍并造成整幅融化。

高分第二阶段从video sigma 0.9035开始时,shift 12/3对应的audio sigma约为0.701。Comfy通用 Custom Sampler会先按video sigma初始化整个packed AV latent;T8自定义双时钟现在会在第一次模型调用前, 只把audio slice从video时钟精确重建到audio时钟。该修复保留video初态和随机噪声,不改上游3D网络; 当前默认4+4共8 NFE。

历史真实I2VA 4+3基线使用736×416低清latent和scale_by=2.0,节点输出1472×832并自动连接高分 Conditioning宽高,无需维护第二套尺寸。任务626.969秒完成,输出1472×832、124帧、24fps、32kHz 双声道,视频/音频严格解码通过;8帧检查未见前一错误LoRA样本的整幅崩坏。单素材仍不能证明普遍 画质或显存优势,因此继续保留Advanced/EXP。 历史v1.35.0的1120×640链曾只开启二采Mixer的Tail +3:高分辨率阶段由3次增至6次前向,任务 302.85秒,媒体合同与严格解码通过。它不是本轮1472×832、corrected alpha8路线的同图A/B,只证明 节点可以串联,不自动证明画质增益。

2026-08-21新默认4+4中文对白实测使用句子“你在干嘛呢,我在这里呀,看看效果如何”, 日志完整执行低清4/4+高分4/4联合AV前向。RTX 4060 Ti 16GB上按ComfyUI任务时间戳计算总耗时 1572.264秒,主要受DynamicVRAM权重换页影响。成片1472×832、124帧、24fps、32kHz双声道, 视频/音频严格解码零错误。本地Whisper识别只将“呀”识别为“啊”,归一化CER为1/16=6.25%; 这只证明该单条音频内容可辨,听感是否较旧4+3改善仍需人耳评审。

使用方法

  1. 第一套 Conditioning 使用低分辨率;第一采样器必须把 denoised_output 接到 Learned Latent Upscale,不能使用仍处在中间噪声状态的 output。
  2. 第二套 Conditioning 必须用相同提示词、首帧、参考媒体和时长;其宽高直接连接Learned Latent Upscale的width/height输出。用户只改scale_by,不要再手填第二套高分尺寸。Reconcile会拒绝低分辨率旧keyframe,避免 cond_video_rows 错配。
  3. 使用Learned Two-Pass Parity Plan,默认base_steps=8 / coarse_steps=4 / refine_steps=4 / shift 12/3;旧工作流若已保存refine_steps=3/5仍按原值加载。旧Two-Pass Sigma Plan继续保留兼容。
  4. Parity Plan的coarse_sigmas接第一采样器;refine_sigmas接Two-Pass Detail Mixer.refine_sigmas。Mixer的MODEL、SAMPLER、SIGMAS三路接第二采样器。
  5. Mixer全部开关关闭时严格透传高分辨率refine schedule;需要Tail +3时只打开enable_tail=true并保留extra_tail_steps=3。Bias/STG/Restart可组合但会改变联合音画预测,必须试听审片。
  6. Temporal Detail Enhance不能接在latent放大和第二采样器之间;它只能接在AV Decode的IMAGE输出之后,AUDIO直接旁路到保存节点。
  7. native作者对齐路线保持second_pass_audio_source=legacy_policy,第二采样器output直接进入AV Decode。 第一阶段audio随放大后video一起进入第二阶段,第二阶段继续完成联合AV轨迹;不要把第一阶段尚未完成的 audio x0估计当作最终声音。
  8. first_pass + second_pass_audio_strength=0.0是显式音频锁定实验,不是native默认。它会阻止第二阶段 完成audio,可能改变口型条件和声音质量。只有确实需要冻结某条已验证audio latent时才使用,并单独做 完整试听与口型检查;highres_template同样属于显式实验来源。
  9. Two-Pass Audio Audit只服务上述零mask锁定实验:它校验采样前后audio latent并回锁。不要把它插到 native默认图中,否则会把第一阶段中间音频误当成最终成品。
  10. 默认 offload_after 只释放学习型放大模型;clear_after连CPU缓存一起清理,keep_loaded会持续占显存,只适合连续批量放大。
  11. 示例固定用VHS的H.265 MP4。本机Windows上H.264曾产生一帧损坏;H.265结果已通过124帧、32kHz双声道和-xerror -err_detect explode严格解码。
  12. 量化H3底模使用LoraLoaderBypassModelOnly加载minimax_h3_fl2v_turbo_4step_v0.1_comfyui_alpha8.safetensors、强度1.0。普通minimax_h3_fl2v_turbo_4step_v0.1_comfyui.safetensors为已否决转换,不要替换回去。

边界

这是二阶段生成,不是把最终视频直接锐化。模型最大仍只允许4倍空间放大,但节点不再用2MP面积上限阻止执行:目标像素可按原作者范围设置到8MP/4096边长,超过1920×1088参考面积时只报告显存风险,由用户决定是否运行。不能据单次运行宣称普遍更清晰或16GB永不OOM。

2026-08-21的历史同prompt/seed/model/4+3 NFE检查中,Comfy原生ModelSamplingAV + Euler输出与修正后的 T8自定义双时钟输出均由用户完整试听确认为声音正常;二者解码PCM相关约0.9491。此前第一阶段audio 零mask硬锁版本由用户明确判定声音异常,已撤销为默认。随后同一正脸首帧、5.152秒LibriSpeech语音、 seed 2608215001和相同4+3路线分别完成lock_source、remix_source=0.20、reference_only与native 清晰语音生成;四条完整成片均由用户试听/观看后审核通过。上述四个保存工作流固定该次连线和参数, 但结论仍只覆盖单图、单语音、单seed、单模型和单评审,不能外推为通用音素同步、音色保持或16GB保证。

下载此文件