# 数字人选型：本机环境核查（2026-09-22）

## 一、目标硬件（GPU 机 192.168.31.31 / zywpc）

| 项目 | 实测值 | 命令 |
|---|---|---|
| GPU | NVIDIA GeForce RTX 5060 Ti，16311 MiB（sm120 / Blackwell） | `nvidia-smi` |
| 系统盘 | `/dev/sda5 1.2T，已用 950G，可用 138G（88%）` | `df -h /home` |
| ComfyUI 版本 | commit `c194dd00`，**2026-09-20**（很新，原生支持 Wan 全系节点） | `git log -1` |
| Python 环境 | `torch 2.11.0+cu130`（CUDA 13.0） | `venv/bin/python -c ...` |

### 与数字人相关的已装自定义节点（有用于推理加速/量化）
`ComfyUI-GGUF`（GGUF 量化加载）、`ComfyUI-KJNodes`、`comfyui-KJNodes`、`comfyui-VideoHelperSuite`（视频合成/导出）、`ComfyUI-INT8-Fast`、`ComfyUI-SolAttn_triton`、`Nvidia_RTX_Nodes_ComfyUI`、`ComfyUI-MiniMaxH3-Director`、`ComfyUI-Florence2`。

### 当前 `models/diffusion_models/` 占用（无任何 Wan 模型）
- MiniMax H3 系列 ×5（11.7G～21G，共约 88G）
- LTX-2.5-22B ×2（约 40G）、Boogu-Image ×4（约 37G）、Krea2 turbo fp8（13G）、JANK2 (14G)、qwen_image_2.1 int8 (7.3G)
- **结论：要跑 Wan-S2V / LongCat-Avatar 需另行下载 15～35 GiB，磁盘 138G 可用，够但要清理旧 H3 备份才宽裕。**

### 配套服务（同机）
ComfyUI `:8189`（手动启停，与 LLM 互斥）；LM Studio `:1234`；Ridge / KO-Ridge LLM `:8080`；相册 `:8900`。

## 二、候选模型权重体积（经 hf-mirror API 实测，2026-09-22）

| 模型 | 许可证 | 关键文件 | 体积 |
|---|---|---|---|
| `Wan-AI/Wan2.2-S2V-14B` | Apache-2.0 | DiT bf16 四片 9.28+9.21+9.27+2.58 GiB；umt5-xxl enc 10.58 GiB；wav2vec2-large-xlsr-53-**english** 1.18 GiB；Wan2.1 VAE 0.47 GiB | **仓库共 45.8 GiB**（ComfyUI 用 fp8_scaled DiT + fp8 umt5 约 23 GiB 可跑） |
| `meituan-longcat/LongCat-Video-Avatar-1.5` | **MIT** | base bf16 六片 ≈29.5 GiB；**base_model_int8 四片 = 14.81 GiB**；dmd_lora 2.35 GiB；whisper-large-v3 2.88 GiB | **仓库共 69.7 GiB**（int8 路线约 20 GiB 可用） |
| `MeiGen-AI/InfiniteTalk` | Apache-2.0 | `comfyui/infinitetalk_single.safetensors` 2.53 GiB（挂 Wan2.1-I2V-14B 之上）；fp8/int8 全量 18.16 GiB ×N | 仓库共 157 GiB（ComfyUI 只取 2.5 GiB 的 LoRA/补丁） |

> 注：`OmniAvatar/OmniAvatar-14B` 仓库当前只有 1.15 GiB 的 `pytorch_model.pt`，其余权重已下架/迁移，**已不推荐作为首选**。

## 三、官方自述的硬门槛（重要）

- **Wan2.2-S2V-14B 官方 `generate.py`**：单卡需 **≥80GB 显存**（`--offload_model True --convert_model_dtype`）；要落地 16GB 只能走 **ComfyUI 原生 fp8 / GGUF 量化 + 分层 offload** 路线（社区已大量验证）。
- **LongCat-Video-Avatar-1.5 官方脚本**：`torchrun --nproc_per_node=2`（**默认双卡 context parallel**），但提供 `--use_int8` + `--use_distill`（8 步 DMD2 蒸馏）——**int8 权重 14.81 GiB 是它有望压进 16GB 单卡的关键**。官方明确：`--use_int8` 仅支持 `--model_type avatar-v1.5`，且 v1.5 必须配 `--use_distill`。
- 两者许可证都允许商用（Apache-2.0 / MIT）。

## 四、对「离线口播」最关键的差异点

| 维度 | Wan2.2-S2V-14B | LongCat-Video-Avatar-1.5 |
|---|---|---|
| 音频编码器 | wav2vec2-large-**xlsr-53-english** → 中文口型是弱项（社区靠中文语料微调/LoRA 补救） | **Whisper-large-v3（多语言，原生中英双语评测）** |
| 长视频 | ComfyUI「Video S2V Extend」子图，每片 77 帧（≈4.8s，16fps）拼接 | 原生 `--num_segments` 视频续写（Video Continuation） |
| 多人 | 弱 | 原生单/多人、说话人区分 |
| 速度 | fp8 + Lightning LoRA 4 步 | 8 步 DMD2，官方称 10 秒视频约 1 分钟 |
| ComfyUI 生态 | **官方原生工作流**，教程最丰富 | 社区节点 `rookiestar28/ComfyUI-LongCat-Avatar`（36 star）、`smthemex/ComfyUI_LongCat_Avatar`（6 star），不成熟 |
| 16GB 可行性 | 社区验证较多 | 需实测（int8 14.81 GiB + 编码器，靠 offload） |
