本地环境核查-20260922.md

数字人选型:本机环境核查(2026-09-22)

一、目标硬件(GPU 机 192.168.31.31 / zywpc)

项目实测值命令
GPUNVIDIA GeForce RTX 5060 Ti,16311 MiB(sm120 / Blackwell)nvidia-smi
系统盘/dev/sda5 1.2T,已用 950G,可用 138G(88%)df -h /home
ComfyUI 版本commit c194dd00,2026-09-20(很新,原生支持 Wan 全系节点)git log -1
Python 环境torch 2.11.0+cu130(CUDA 13.0)venv/bin/python -c ...

与数字人相关的已装自定义节点(有用于推理加速/量化)

ComfyUI-GGUF(GGUF 量化加载)、ComfyUI-KJNodes、comfyui-KJNodes、comfyui-VideoHelperSuite(视频合成/导出)、ComfyUI-INT8-Fast、ComfyUI-SolAttn_triton、Nvidia_RTX_Nodes_ComfyUI、ComfyUI-MiniMaxH3-Director、ComfyUI-Florence2。

当前 models/diffusion_models/ 占用(无任何 Wan 模型)

配套服务(同机)

ComfyUI :8189(手动启停,与 LLM 互斥);LM Studio :1234;Ridge / KO-Ridge LLM :8080;相册 :8900。

二、候选模型权重体积(经 hf-mirror API 实测,2026-09-22)

模型许可证关键文件体积
Wan-AI/Wan2.2-S2V-14BApache-2.0DiT bf16 四片 9.28+9.21+9.27+2.58 GiB;umt5-xxl enc 10.58 GiB;wav2vec2-large-xlsr-53-english 1.18 GiB;Wan2.1 VAE 0.47 GiB仓库共 45.8 GiB(ComfyUI 用 fp8_scaled DiT + fp8 umt5 约 23 GiB 可跑)
meituan-longcat/LongCat-Video-Avatar-1.5MITbase bf16 六片 ≈29.5 GiB;base_model_int8 四片 = 14.81 GiB;dmd_lora 2.35 GiB;whisper-large-v3 2.88 GiB仓库共 69.7 GiB(int8 路线约 20 GiB 可用)
MeiGen-AI/InfiniteTalkApache-2.0comfyui/infinitetalk_single.safetensors 2.53 GiB(挂 Wan2.1-I2V-14B 之上);fp8/int8 全量 18.16 GiB ×N仓库共 157 GiB(ComfyUI 只取 2.5 GiB 的 LoRA/补丁)

注:OmniAvatar/OmniAvatar-14B 仓库当前只有 1.15 GiB 的 pytorch_model.pt,其余权重已下架/迁移,已不推荐作为首选。

三、官方自述的硬门槛(重要)

四、对「离线口播」最关键的差异点

维度Wan2.2-S2V-14BLongCat-Video-Avatar-1.5
音频编码器wav2vec2-large-xlsr-53-english → 中文口型是弱项(社区靠中文语料微调/LoRA 补救)Whisper-large-v3(多语言,原生中英双语评测)
长视频ComfyUI「Video S2V Extend」子图,每片 77 帧(≈4.8s,16fps)拼接原生 --num_segments 视频续写(Video Continuation)
多人弱原生单/多人、说话人区分
速度fp8 + Lightning LoRA 4 步8 步 DMD2,官方称 10 秒视频约 1 分钟
ComfyUI 生态官方原生工作流,教程最丰富社区节点 rookiestar28/ComfyUI-LongCat-Avatar(36 star)、smthemex/ComfyUI_LongCat_Avatar(6 star),不成熟
16GB 可行性社区验证较多需实测(int8 14.81 GiB + 编码器,靠 offload)
下载此文件