# C3 组核实结果：实时数字人（Talking Head）开源项目 × RTX 5060 Ti 16GB (sm_120)

核实日期：**2026-09-22**。目标硬件：RTX 5060 Ti 16GB / sm_120 Blackwell / 32GB RAM / Ubuntu / 驱动 610.43.02 / CUDA 13.2。
标注约定：**【作者声明】**= 官方 README/文档原文；**【第三方实测】**= 他人博客/镜像页/wik 实测或整理；**【估算】**= 依据官方数据推算；**未查到** = 无法核实，未编造。

> 抓取方法说明：GitHub REST API 在本次会话已被限流（`API rate limit exceeded`，core remaining=0），故星标/日期改用 GitHub 仓库 HTML（`"stargazerCount"`）与 commits Atom feed（`/commits/<br>.atom`）核对，均为 2026-09-22 当日抓取。

---

## 1. KwaiVGI/LivePortrait（已改名 KlingAIResearch/LivePortrait）

| 项 | 值 |
|---|---|
| 仓库现状 | 已从 `KwaiVGI/LivePortrait` **重定向为** `KlingAIResearch/LivePortrait`（GitHub HTML `<meta description>`：*"Contribute to **KlingAIResearch/LivePortrait** development"*）|
| Stars | **19,084**（2026-09-22 抓取 HTML `"stargazerCount":19084`）|
| 最后提交 | **2026-06-01T17:24:54Z**（`/commits/main.atom`）→ 约 3.7 个月无提交，处于「稳定/低维护」状态 |
| 默认分支 | `main`；**说明文件是小写 `readme.md`**（`README.md` 返回 404，抓取时注意）|

### (c) VRAM 与 16GB 单卡可行性

- **官方未给出推理显存数字**（README 全文无 VRAM/显存要求段落）→ 显存要求：**官方未声明**。
- **官方权重规模（可推算显存下限）**——`assets/docs/speed.md` 原文表格：

| Model | Parameters(M) | Model Size(MB) | Inference(ms) |
|---|---|---|---|
| Appearance Feature Extractor | 0.84 | 3.3 | 0.82 |
| Motion Extractor | 28.12 | 108 | 0.84 |
| Spade Generator | 55.37 | 212 | 7.59 |
| Warping Module | 45.53 | 174 | 5.21 |
| Stitching and Retargeting Modules | 0.23 | 2.3 | 0.31 |

  原文小注：*"The values for the Stitching and Retargeting Modules represent the combined parameter counts and total inference time of three sequential MLP networks."*
  合计 **≈130.1M 参数 / ≈499.6 MB 权重**（作者在表头口径为 RTX 4090 + 原生 PyTorch + `torch.compile`，单帧）。
  → **【估算】fp16 权重 ≈ 0.25–0.5 GB**；整流程（特征提取 + 3D 关键点 + SPADE 生成器 + warping + 拼接）在 1024px 级分辨率下的激活显存，官方未给数；**保守估计峰值远低于 8GB，16GB 单卡余量充足**（此项为估算，非实测）。
- **【第三方声明】显存下限 6GB**：第三方打包项目 Lytanshade/LivePortrait-pinokio 仓库标题原文 *"LivePortrait [Nvidia and MacOS silicon supported]: Bring a portrait to life using a Video source -> **6GB VRAM ~8GB install**"* → [github.com/Lytanshade/LivePortrait-pinokio](https://github.com/Lytanshade/LivePortrait-pinokio)。属第三方封装声明，未见 nvidia-smi 截图实测。
- **正面对比**：表头的 **RTX 4090 24GB** 是作者唯一给出的参考卡，说明官方定位的参考硬件远高于 6GB。

### (d) 端到端延迟 / FPS

- **单帧推理（RTX 4090 + torch.compile，官方 `speed.md`）**：`0.82+0.84+7.59+5.21+0.31 = 14.77 ms/帧` → **【估算】≈ 67.7 FPS**。
- `torch.compile` 收益（作者声明）：*"The first-time inference triggers an optimization process (about one minute), making subsequent inferences **20-30% faster**. Performance gains may vary with different CUDA versions."* → **首次编译约 1 分钟**（属于首帧延迟开销）。
- **注意：LivePortrait 是「视频/模板驱动」的肖像动画，不是音频驱动 lip-sync。** 因此「首帧延迟」「ASR→TTS→口型」这类链路指标在官方语境中**不存在，未查到**。
- 相对锚点（作者声明）：macOS Apple Silicon 走 MPS *"this maybe **20x slower than RTX 4090**"*。

### (e) 流式 / 可打断

- **官方无流式/双工声明**。`app.py` 为 Gradio 交互式推理，`inference.py` 为离线视频生成 → 属于**逐段/离线推理，非流式**。
- 社区生态有实时化分支（README 收录）：`FasterLivePortrait`（TensorRT 实时版）、`FacePoke`（*"A real-time head transformation app, controlled by your mouse!"*）、`ComfyUI-AdvancedLivePortrait`（*"A faster ComfyUI node with **real-time preview**"*）→ 实时能力来自**第三方改造**，非官方。
- **可打断/对话打断：无**（无 ASR/LLM/TTS 环节）。

### (f) 中文支持 / 半身-全身

- **中文**：与语言无关（不涉及 ASR/TTS）；驱动信号是视频/模板 pkl，**无中文语义层**。
- **半身/全身**：官方定位 **portrait（人像/头肩）**；支持 humans、cats and dogs 三种模式（README *"efficient portrait-animation (humans, cats and dogs) solution"*）。**无半身/全身声明，未查到全身支持**。

### (g) 已知坑（sm_120 / Blackwell / 依赖）

1. **`onnxruntime-gpu==1.18.0` 硬钉版本** —— liveportrait `requirements.txt` 原文：
   ```
   -r requirements_base.txt
   onnxruntime-gpu==1.18.0
   transformers==4.38.0
   ```
   1.18.0 为 2024 年构建，**不含 sm_120 (Blackwell) CUDA kernel**。
2. **sm_120 上 onnxruntime CUDA EP 存在已知 Blackwell 缺陷**：microsoft/onnxruntime issue **#27621** 标题原文 *"[CUDA EP] **Silent deadlock** when calling `InferenceSession.run()` from Python thread on **Blackwell GPU (RTX 5060, sm_120, Windows)**"* → [issue #27621](https://github.com/microsoft/onnxruntime/issues/27621)。（该 issue 为 Windows 复现，Linux 未确认，但同为 sm_120 + RTX 5060 平台，属**高风险预警**。）
3. **官方 wheel 缺 sm_120，需第三方重建 wheel**：Natfii/onnxruntime-gpu-blackwell —— *"Pre-built onnxruntime-gpu **1.24.1** with **Blackwell sm_120** CUDA kernels (RTX 5090/5080/5070)"* → [github.com/Natfii/onnxruntime-gpu-blackwell](https://github.com/Natfii/onnxruntime-gpu-blackwell)。即：**要用 Blackwell 必须离开官方 pinned 的 1.18.0**。
4. **torch 安装示例只到 CUDA 12.1**（README：cu111 / cu118 / **cu121**），且原文警告 *"On Windows systems, some higher versions of CUDA (such as 12.4, 12.6, etc.) may lead to unknown issues. You may consider downgrading CUDA to version 11.8 for stability."* → 对 **CUDA 12.8/13.x + Blackwell 官方零说明（2026-09 未验证）**。
5. **X-Pose（Animals 模式）需自编译 CUDA 算子**：*"You need to build an OP named `MultiScaleDeformableAttention` first ... which is used by X-Pose"* → sm_120 下需自行 `TORCH_CUDA_ARCH_LIST=12.0` 编译，**Huamns 模式可跳过**（README：*"The step of `Check your CUDA versions` is **optional** if you only want to run Humans mode."*）。
6. **无 flash-attn / triton 依赖**（依赖树中未出现）→ 少一类坑。

### 许可证（重点：可商用的边界）

- 仓库根 `LICENSE` = **MIT**，`Copyright (c) 2024 Kuaishou Visual Generation and Interaction Center`。
- **LICENSE 末尾附有非商用限制条款（原文逐字）**：
  > "The code of InsightFace is released under the MIT License.
  > **The models of InsightFace are for non-commercial research purposes only.**
  > If you want to use the LivePortrait project for commercial purposes, you should remove and replace InsightFace's detection models to fully comply with the MIT license."
- 结论：**LivePortrait 代码本身是 MIT（可商用），但默认人脸检测依赖 InsightFace 的模型，属"仅限非商业研究"**；商用须替换 InsightFace 检测模型。README 亦给出替代方案线索：`ComfyUI-LivePortraitKJ` 使用 **MediaPipe 替代 Insightface**。
- **未查到** LivePortrait 官方有任何独立「for research only」声明（论文/README 均无）。

---

## 2. HumanAIGC-Engineering/OpenAvatarChat

| 项 | 值 |
|---|---|
| Stars | **3,773**（2026-09-22 HTML）|
| 最后提交 | **2026-07-31T00:28:29Z**（commits/main.atom）→ 活跃 |
| 最新版本 | **0.6.0（2026.04）**；上一版 0.5.1（2025.08.19）|

### 支持的 Avatar 后端（作者声明，README「核心亮点」逐字）

> "**多样数字人形象**：支持 **LiteAvatar、LAM、MuseTalk、FlashHead** 等多种数字人技术"

0.6.0 更新原文新增：*"接入 [SoulX-FlashHead](https://github.com/Soul-AILab/SoulX-FlashHead) 数字人，基于扩散模型的实时流式说话头生成"*。
预置配置（README「预置模式」表）：`chat_with_lam.yaml`=**LAM**；`chat_with_qwen_omni.yaml`=**lite-avatar**；`chat_with_openai_compatible_bailian_cosyvoice.yaml`=**lite-avatar**；`..._flashhead.yaml` / `..._flashhead_duplex.yaml` / `..._flashhead_duplex_agent.yaml`=**FlashHead（含双工）**。

### (c) VRAM 要求 —— 官方 README 的显存表（引用位置见下）

**重要**：**当前 main 分支的 README.md（2026-09-22 抓取，7581 字节）中已不含显存表**；显存表出现在**更早的 README 版本**中。第三方代码百科 **DeepWiki** 明确标注其数据源为 `README.md 254-345` / `readme_en.md 243-332`（即带表的那一版），原文表格逐字如下（**【第三方整理/官方旧版 README】**）：

| Configuration File | VRAM Required | Requires API Key | Best For |
|---|---|---|---|
| `chat_with_minicpm.yaml` | **20GB+ (or 10GB with int4)** | No | Full privacy, powerful GPU |
| `chat_with_lam.yaml` | **2-3GB** | Yes (Bailian) | Multi-session, 3D avatar |
| `chat_with_qwen_omni.yaml` | **2-3GB** | Yes (Bailian) | Speech-to-speech E2E |
| `chat_with_openai_compatible.yaml` | **8-10GB** | Yes (OpenAI/Bailian) | Local TTS, cloud LLM |

来源：[deepwiki.com/.../2-getting-started](https://deepwiki.com/HumanAIGC-Engineering/OpenAvatarChat/2-getting-started)

系统要求（同一来源 DeepWiki，标注源自 `pyproject.toml 52-65`）：

> Hardware Requirements — **VRAM: minimum 10GB / recommended 20GB+**；GPU: *"NVIDIA GPU with CUDA support"*，推荐 **RTX 3090/4090 or better**；System RAM 16GB min / **32GB+** rec；CUDA 12.4+；**PyTorch 2.4.1 + CUDA 12.4**；Python ≥3.11.7, <3.12。

各后端资源画像（DeepWiki「Avatar Systems」）：**LiteAvatar** = *"Server-side / 2D facial animation / **Low-Medium (3GB VRAM/session)**"*；**MuseTalk** = *"Server-side / Video-based deep learning / **High (GPU …)**"*。

**16GB 单卡结论（推断）**：`chat_with_lam.yaml` / `lite-avatar`（**2–3GB**）与 `chat_with_openai_compatible.yaml`（**8–10GB**，本地 TTS + 云端 LLM）→ **16GB 单卡可跑，且余量大**；`chat_with_minicpm.yaml` 全本地（**20GB+**，int4 后 10GB）→ **16GB 需 int4 量化才可**。MuseTalk 后端 DeepWiki 仅标 "High"，**未给具体 GB，未查到**。

### (d) 端到端延迟

- **官方 README 唯一明确数字（逐字）**：*"**低延迟优化**：通过 VAD 检测、语音缓冲、帧率控制等机制优化，**平均响应时间仅 2.2 秒**"* → **【作者声明】端到端平均响应 2.2 s**。
- 官方 B 站教程：[BV1sv8QzLEC2](https://www.bilibili.com/video/BV1sv8QzLEC2)（未逐帧核验）。
- 首帧延迟、推理 FPS：**官方未给出（未查到）**；DeepWiki 提到输出 *"RGB video frames at configured FPS (typically **25fps**)"* → 【第三方】典型输出 25fps。

### (e) 流式 / 可打断 —— 本项目最强项

0.6.0 更新原文：*"**所有数字人均支持手动打断和双工打断模式**"* → **全后端支持手动打断 + 双工（barge-in）打断**。README Beta 区另有 Chat Agent（OpenClaw 集成）多轮工具调用模式（Beta，API 可能变）。

### (f) 中文支持 / 半身-全身

- **中文**：ASR 用 **SenseVoice**（阿里，中文强），TTS 用 **CosyVoice**（README 组件表：FunAudioLLM/CosyVoice），LLM 走百炼（阿里云）OpenAI 兼容 API → **中文原生支持，全链路中文友好**。默认模型下载源优先 **ModelScope**（文档：*"默认模式 (--source auto) 会对有 ModelScope 源的模型优先使用 ModelScope"*），国内网络友好。
- **半身/全身**：**LAM 为 3D 数字人**（`aigc3d/LAM_Audio2Expression`，README 予其 HF 模型 `3DAIGC/LAM_audio2exp`）；LiteAvatar 为 **2D 面部动画**；MuseTalk/FlashHead 为**口型驱动（头肩/半身视频）**。**明确的全身（full-body）支持：未查到**（LAM 走 3D 表达参数，理论上可驱动 3D 全身，但 README 无全身声明）。

### (g) 已知坑（sm_120 / Blackwell / 依赖）

1. **官方文档要求驱动支持的 CUDA ≥ 12.8**（快速开始页原文：*"本项目的运行依赖 CUDA，请确保本机 NVIDIA 驱动程序支持的 CUDA 版本 **>= 12.8**"*）→ 对 Blackwell 是**有利项**（12.8 起支持 sm_120）；本机 CUDA 13.2 满足。
2. **flash-attn 自动编译**：快速开始页原文 *"需要编译安装的包（如 **flash-attn**）会自动使用 `--no-build-isolation` 并限制并行编译线程数"* → **sm_120 下 flash-attn 源码编译耗时长/易失败**（官方已试图缓解，但仍属坑）。
3. **PyTorch 版本落后**：DeepWiki 记录 `pyproject.toml` 钉 **PyTorch 2.4.1 + CUDA 12.4** → 该组合**不含 sm_120 kernel**，Blackwell 上须自行升级到 cu128/cu130 轮子，会与 `install.py` 的版本解析产生冲突。
4. Python 版本窗口窄：**≥3.11.7, <3.12**。
5. 依赖用 `uv` + `git lfs` 子模块（文档要求 `git lfs install` 与 `git submodule update --init --recursive`），模型体积大。
6. **未查到** any sm_120 专项 issue（GitHub API 限流，未能做 issue 关键词检索）——此点建议后续用 `is:issue sm_120` 补验。

---

## 3. Kedreamix/Linly-Talker

| 项 | 值 |
|---|---|
| Stars | **3,453**（2026-09-22 HTML）|
| 最后提交 | **2026-02-10T05:17:02Z**（commits/main.atom）→ **截至 2026-09-22 已 7 个多月无提交**，主仓维护**停滞** |
| 分仓活跃 | 新增 **Linly-Talker-Stream**（实时流式版，独立仓库），但主仓自身停更 |

### 维护状态（重点结论）

- 主仓 README 中文版最新更新条目为 **2026.02**：*"🚀 发布 Linly-Talker-Stream：全新的实时流式交互架构版本！基于 WebRTC 实现低延迟音视频传输…"*；此后（2026-02-10 提交后）**无新提交**。
- 实时能力已被**迁移到分仓** `Kedreamix/Linly-Talker-Stream`（README 原文：*"On top of Linly-Talker's multimodal pipeline (ASR / LLM / TTS / Avatar), this project references [LiveTalking] … and performs a **streaming pipeline refactor**. **Continuous optimization is planned.**"*）。
- **判断：主仓 Linly-Talker 2026 年处于「低速/停滞维护」，实时迭代重心在 Linly-Talker-Stream。**

### SadTalker / Wav2Lip 是否仍是默认后端（2026）

- README 功能清单仍在：*"Talker模型多选择：**Wav2Lip / Wav2Lipv2 / SadTalker / ERNeRF / MuseTalk** / Coming Soon"*（中英双语均在）；checkpoints 结构仍为 `SadTalker_V0.0.2_256.safetensors`、`wav2lip.pth`、`wav2lip_gan.pth` → **SadTalker/Wav2Lip 仍是内置后端（未移除）**。
- 但**「默认」已不是 SadTalker**：README 更新原文 *"改进的WebUI在**默认设置下不加载 LLM 模型**，以减少显存使用"*；且 *"加入了 MuseTalk 的方式…**速度基本能够达到实时的要求**，MuseTalk 已加入在 WebUI 中"* → **2026 年 WebUI 里承担"实时对话"的是 MuseTalk**，SadTalker/Wav2Lip 退化为离线/口播生成档。**此判定基于 README 描述（作者声明），未逐行核验代码默认值**。

### (c) VRAM：训练 vs 推理

- **官方 README 未给出任何显存数字（训练或推理均无）→ 官方口径：未查到。**
- **【第三方博客】** CSDN《Linly-Talker对显卡配置的要求及性价比推荐》给出模块级显存表（以 FP16 为例）及其结论，逐字摘录：
  - *"大语言模型（LLM） Llama-3-8B（INT4量化） **~6–8 GB** ｜ 若未量化，FP16 下需约 **16GB**；上下文越长，KV Cache 越大"*
  - *"语音合成（TTS） VITS / YourTTS **~2–4 GB**"*
  - *"语音识别 Whisper-tiny / base **~1–2 GB**"*
  - *"哪怕是最轻量化的组合（INT4量化LLM + TTS + Wav2Lip），总显存需求也轻松突破 **10GB**"*
  - *"因此，**12GB 显存应被视为当前运行 Linly-Talker 的最低推荐门槛**"*
  - 来源：[blog.csdn.net/weixin_42561464/article/details/156119020](https://blog.csdn.net/weixin_42561464/article/details/156119020)
  - ⚠️ **可信度提示**：该 CSDN 文风格接近 AI 生成的长文，无 nvidia-smi 截图，数字为「模块估算求和」而非实测 **→ 标注为【第三方估算】，不可当实测引用**。
- **训练显存**：README 全文**未给出训练 VRAM**（ER-NeRF 段仅说明 *"ER-NeRF是针对单独一个人的视频进行训练的，所以需要替换特定的模型才能进行渲染"*）→ **训练显存：未查到**。
- **上游引用**：README 转录 MuseTalk 官方声明 *"能够以 **30帧每秒以上** 的速度在 **NVIDIA Tesla V100** 显卡上运行"* → 可作 (d) 的参考锚点。

### (d) 端到端延迟 / FPS

- **主仓**：无端到端延迟数字。可引用：MuseTalk 在 **V100 上 >30 FPS**（作者转述上游）；*"速度基本能够达到实时的要求"*（作者声明，无具体 ms）。
- **Linly-Talker-Stream（分仓）**：README 原文 *"⚡ **Low-latency transport**: real-time audio/video transmission via WebRTC"*、*"**WebRTC real-time streaming playback with low latency in browsers**"* → **只给了定性「低延迟」，未给具体 ms 数字（未查到）**。
- **首帧延迟：两个仓库均未给出，未查到。**

### (e) 流式 / 可打断

- **主仓**：Gradio 轮次式；README 自述 *"若考虑实时对话，可能需要换个框架，或者对 Gradio 进行魔改"* → **主仓非流式**。
- **Linly-Talker-Stream**：*"**Barge-in and interruption support**: more natural conversational rhythm"*、*"full-duplex conversation experience"* → **支持打断（barge-in）+ 全双工**（分仓能力）。

### (f) 中文支持 / 半身-全身

- **中文**：**原生中文项目**（中文 README 为一等公民）；ASR 集成阿里 **FunASR**/OmniSenseVoice，TTS 用 **CosyVoice**（README：*"支持中文、英语、日语、粤语和韩语等多种语言的语音合成"*）→ 中文支持**强**。
- **半身/全身**：**无半身/全身支持**。SadTalker/Wav2Lip/ER-NeRF/MuseTalk 均为**头肩/上半身肖像口型驱动**；README 无全身声明 → **全身：未查到/不支持**。

### (g) 已知坑

- **维护停滞（最大风险）**：主仓 7 个月无提交，2026 年的 CUDA/torch 生态演进（sm_120）**基本不会得到官方适配**。
- **依赖版本陈旧**：项目基于 2024–2025 技术栈（SadTalker 2023 / Wav2Lip 2020 / CosyVoice 早期档），README 未声明 CUDA 版本要求 → **sm_120/Blackwell 兼容性：官方零说明，未查到**；实际部署需自行把 torch 升到 cu128/cu130。
- **WebUI 默认不加载 LLM**（作者声明，为省显存）→ 若误以为"默认就是完整对话链路"，会得到"只回文本"的行为。
- **模型分散**：checkpoints 需从 HuggingFace / ModelScope / 百度网盘分别下载（README 提示百度网盘默认命名 `sadtalker` 需重命名为 `checkpoints`），国内下载易中断。

---

## 4. xszyou/Fay

| 项 | 值 |
|---|---|
| Stars | **13,545**（2026-09-22 HTML）|
| 最后提交 | **2026-09-21T08:56:28Z**（commits/main.atom）→ **极活跃（核实前 1 天仍有提交）** |
| 许可证 | **GPL-3.0**（`LICENSE` 首行原文：*"GNU GENERAL PUBLIC LICENSE / Version 3, 29 June 2007"*）|

### 它到底是什么（定位）

README 原文（逐字）：

> "我们致力于思考面向终端的数字人落地应用…**Fay数字人框架，向上适配各种数字人模型技术，向下接入各式大语言模型**，并且便于更换诸如 TTS、ASR 等模型，为单片机、app、网站提供全面的数字人应用接口。"

> "**完全开源，商用免责**"、"**支持全离线使用**"、"**全时流式的支持**"、"自由匹配数字人模型、大语言模型（openai 兼容接口）、ASR、TTS模型"、"支持数字人自动播报模式（虚拟教师、虚拟主播、新闻播报）"、"支持任意终端使用：**单片机、app、网站、大屏、三方业务系统接入**"、"支持多用户多路并发"、"支持唤醒及**打断对话**"、"支持机器人表情输出"、"支持 agent 自主决策工具调用"、"支持 MCP 工具管理（sse、studio）"。

**结论：Fay 是「agent 框架 + 数字人连接器」，不自己渲染画面。** 它把「数字人模型」当作可插拔外设，README 的「使用数字人（非必须）」一节标题本身就写明 **非必须**。

### 数字人连接器（ue5 / metahuman / xuniren）

- README 正文未列出具体连接器名称，只给出飞书文档链接「使用数字人（非必须）」；但功能描述覆盖 **2.5d、3d、移动、pc、网页** 数字人（GitHub 仓库 `<meta description>` 原文：*"fay是一个帮助数字人（**2.5d、3d、移动、pc、网页**）或大语言模型（openai兼容、deepseek）连通业务系统的 agent 框架"*）。
- 生态侧可核实的 UE 通道：`xszyou/fay-ue5` 独立仓库存在（搜索结果含 [raw.githubusercontent.com/xszyou/fay-ue5](https://raw.githubusercontent.com/xszyou/fay-ue5/main/README.md)）。
- **xuniren / metahuman 的官方名称级证据：本次未直接抓到原文，未查到**（README 只给飞书 wiki 跳转，飞书内容未抓取）。

### (c) 实际需要什么 GPU

- **官方 README 全文无 GPU/显存要求**（环境段仅写：*"Python 3.12"*、*"Windows、macos、ubuntu"*、*"注：ubuntu需要先安装gcc及portaudio"*）→ **Fay 本体不需要 GPU**。
- **GPU 取决于你外挂的模型**：ASR/TTS/LLM 若走云端 API（README 快速启动用「公共资源」即云端 key），**0 显存**；若外挂本地 FunASR/CosyVoice/TTS-GPU + 本地 LLM，才占显存。
- 官方镜像（第三方云平台 Compshare）页面可核实信息：镜像名 *"数字人 **Fay数字人-3.1.1**"*、*"Fay数字人3.1.1最小可运行版"*、*"**镜像大小 40 GB**"*、*"当前版本 v1.12"*、*"累计部署 **255** 次"*、*"最近更新 **2025-12-05**"*、暴露端口 *"JupyterLab: 8888 / 自定义开放端口 5000"*，**CUDA 版本栏为空**（页面 "CUDA版本 -"）→ 来源：[compshare.cn/images/compshareImage-1cft3sk9gvta](https://www.compshare.cn/images/compshareImage-1cft3sk9gvta?ytag=GPU_fay)。
- **16GB 单卡结论**：**Fay 本体无 GPU 需求**；搭配 3D 数字人客户端（UE5/MetaHuman 等，在另一台带 GPU 的机器或同机渲染）时，显存取决于该客户端与本地 ASR/TTS/LLM 的组合，**Fay 官方未给任何数字，未查到**。

### (d) 端到端延迟 / FPS

- **官方无任何毫秒/FPS 数字（未查到）**；仅定性声明 *"全时流式的支持"*、*"支持唤醒及打断对话"* → **属流式设计，但无实测指标**。

### (e) 流式 / 可打断

- **支持**：README 明确 *"全时流式的支持"* + *"支持唤醒及**打断**对话"*。这是其相对 LivePortrait / Linly-Talker 主仓的显著优势。

### (f) 中文支持 / 半身-全身

- **中文**：**原生中文项目**（作者中文团队，交流群/公众号「fay数字人」），ASR 集成 **FunASR**（README 致谢：*"FunASR - 提供语音识别（ASR）能力"*）→ 中文强。
- **半身/全身**：**由外挂数字人决定**。README 定位涵盖 **2.5D 与 3D**，3D 侧可通过 UE 连接器实现全身；**Fay 自身不含渲染，半身/全身 = 你所接的数字人模型的能力**（有 3D 通道，但具体全身支持**未在官方原文确认，未查到**）。

### (g) 已知坑

- **GPL-3.0 许可证 = 商用传染性风险（重点）**：README 自称 *"完全开源，**商用免责**"*，但 **`LICENSE` 实为 GPL-3.0**。GPL-3.0 的**传染性（copyleft）**意味着：若你将 Fay 与其代码结合分发（或按其解释提供网络服务），**衍生作品需以 GPL 兼容方式开源**；「商用免责」是作者的口头承诺，**不是许可证授予的额外权利**。商业闭源集成前必须做法律评估，或仅以独立进程/API 方式调用并评估 AGPL/GPL 边界（**GPL-3.0 非 AGPL，SaaS 场景不触发网络条款，这点优于 AGPL；但分发二进制仍受限**）。
- **依赖/环境**：Ubuntu 需 `build-essential` + `portaudio19-dev`；Python 3.12。
- **sm_120/Blackwell**：Fay 本体纯 Python 编排层，**只要外挂组件不编译 CUDA 算子就不受 sm_120 影响** → 相对**风险最低**的一个。
- **配置门槛**：快速启动需从 `system.conf.bak` 生成 `system.conf` 并填 API key；默认公共资源*"速度非常慢"*（作者自述）。

---

## 5. modstart-lib/aigcpanel

| 项 | 值 |
|---|---|
| Stars | **5,574**（2026-09-22 HTML）|
| 最后提交 | **2026-09-18T04:46:10Z**（commits/main.atom）→ 活跃 |
| 许可证 | **Apache-2.0**（`LICENSE` 首行：*"Apache License / Version 2.0, January 2004"*）|
| 技术栈 | README badge 原文：*"Framework-**TS+Vue3+Electron**"* |

### 它到底是什么（重点结论）

**是一个 Electron 桌面客户端 + 模型管理器，它既"调用引擎"也"自己拉本地引擎跑"。** 官方 README 原文（逐字）：

> "AIGCPanel 是一款简单易用的一站式 AI 数字人**桌面应用**，支持 **Windows / macOS / Linux** 三平台。"
> "软件内置**模型市场，支持一键下载启动包**，开箱即用；同时兼容**远程 API 模型**。"
> "**数字人合成**：基于多种开源口型同步模型（**MuseTalk / LatentSync / Wav2Lip / Heygem**），将任意音频与人物视频精准对齐"
> "**AI 模型管理**：本地模型一键导入、启动/停止、日志查看、参数配置；支持远程 API 模型接入；**云端 AI 模型服务（无需本地显卡）（VIP）**"

→ 即：**前端/面板是 Electron 壳，真正推理是外挂的「模型启动包」（本地，含 MuseTalk/LatentSync/Wav2Lip/Heygem 等）或云端 API。** 它**不是自研渲染引擎**，而是**引擎的集成商 + 本地运行时管理器**。

### (c) 是否需要 GPU / 显存要求

**官方文档给出了最清晰的答案**（[aigcpanel.com/zh/document/74](https://aigcpanel.com/zh/document/74)，逐字原文）：

> "**界面软件本身对硬件无特殊要求，普通电脑/笔记本即可运行。AI 模型运行需要依赖 专业显卡 GPU。如果没有 NVIDIA 显卡，可以使用 AI 云模型 服务，无需本地显卡即可使用全部功能（云模型按使用量计费）。**"
> "目前我们提供的模型大部分基于 **NVIDIA CUDA** 框架，如需本地运行，务必准备 NVIDIA 显卡。"

同页还给出「怎么查看电脑是什么显卡」：*"Windows 系统 Ctrl+Shift+Esc 打开任务管理器 → 性能 → GPU，「专用 GPU 内存」即为真实显存。"*

- **面板本体显存需求 = 0**（只需普通电脑）。
- **本地跑模型时**才需要 NVIDIA GPU；**具体 GB 数（各模型逐一显存要求）：官方文档未给出，未查到。**
- **16GB 单卡结论**：16GB 足够（面板本身不吃显存；其集成的 MuseTalk/LatentSync/Wav2Lip/Heygem 档位中，MuseTalk/LatentSync 属较轻量级口型模型，Heygem 较重）；**但"是否一定跑得动"无官方数字支撑 → 未查到，需实机验证。**

### (d) 端到端延迟 / FPS

- **未查到**：aigcpanel 定位为**离线视频合成工具**（"一键生成换口型数字人视频"），README 与文档**均未给出延迟或 FPS 指标**。其"智能直播（VIP）"支持抖音/哔哩哔哩/虎牙/斗鱼/快手弹幕实时监控，但**未声明直播画面的实时数字人渲染延迟**。

### (e) 流式 / 可打断

- **未查到流式/打断能力声明**。核心交互是**任务式（提交→生成→下载）**：README *"任务列表可批量下载"*、*"支持断点续跑、节点级状态追踪、运行历史查看"*（工作流 VIP 功能）。→ 更接近**批处理/半自动**，非双工实时对话。

### (f) 中文支持 / 半身-全身

- **中文**：**原生中文产品**（全中文 UI/文档，备案号 *"陕ICP备20000530号-12"*），TTS/ASR 均含中文模型 → 中文**强**。
- **半身/全身**：口型同步基于**用户上传的人物视频**（README：*"上传形象视频，输入文本或音频，一键生成换口型数字人视频"*）→ **画面范围完全取决于你上传的素材，理论上半身/全身都可以（只要视频是全身）**；**官方无专门"半身/全身"功能声明，未查到**。支持**绿幕视频形象**与形象模板管理。
- 额外：**25+ 音视频工具箱**（文生图/图生图、字幕、变速、压缩、FFmpeg 自定义等）与**内置模型市场**（一键下载启动包）。

### (g) 已知坑

- **sm_120/Blackwell**：官方未声明 CUDA/torch 版本要求（**未查到**）；由于它把引擎打包为"模型启动包"（可能内置预编译的 torch/ONNX），**Blackwell 上是否开箱可用取决于各启动包内的 torch/onnxruntime 是否含 sm_120 kernel → 属于不可控的打包风险**，建议逐个模型包实测。
- **闭源打包**：模型启动包体积大、更新依赖官方分发；本地模型依赖其"模型市场"的版本节奏。
- **「云端 AI 模型服务」是 VIP 付费项**（按使用量计费），免费路径需本地 NVIDIA 显卡。
- 许可证 Apache-2.0（**商用友好**，无 GPL 传染问题）——**但注意：其集成的 MuseTalk/Wav2Lip/LatentSync/Heygem 各自的许可证与商用条款需单独核查**（aigcpanel 的 Apache-2.0 不覆盖第三方模型的权重许可）。

---

## 横评速查（16GB / sm_120 视角）

| 仓库 | 性质 | VRAM 关键数字 | 16GB 单卡 | 延迟/FPS | 流式·打断 | 中文 | sm_120 风险 |
|---|---|---|---|---|---|---|---|
| LivePortrait | 视频驱动肖像动画（**非 lip-sync**）| 权重 ≈0.5GB（官方 speed.md 合计 499.6MB）；第三方称 **6GB VRAM** 起 | ✅ 富余 | **≈67.7 FPS**（4090+torch.compile，单帧 14.77ms）；首帧含 ~1min 编译 | ❌ 官方无（第三方有实时分支）| 语言无关 | 🔴 高（`onnxruntime-gpu==1.18.0` 无 sm_120；ORT #27621 Blackwell 死锁；X-Pose 需自编译 op；torch 示例仅到 cu121）|
| OpenAvatarChat | 全链路实时对话（ASR+LLM+TTS+Avatar）| **LAM 2–3GB / Qwen-Omni 2–3GB / openai_compatible 8–10GB / MiniCPM 20GB+（int4 10GB）**；系统级 **min 10GB / rec 20GB+** | ✅ 除 MiniCPM 全本地外均可 | **平均响应 2.2s**（官方）；输出典型 25fps | ✅✅ 0.6.0 起**全后端手动+双工打断** | ✅ 强（SenseVoice+CosyVoice+百炼）| 🟡 中（文档要求 CUDA≥12.8 利 Blackwell，但钉 torch 2.4.1/cu124、flash-attn 需源码编译）|
| Linly-Talker | 多后端对话数字人（SadTalker/Wav2Lip/MuseTalk）| **官方未给数**；第三方博客估 **≥12GB 为门槛**（LLM int4 6–8GB + TTS 2–4GB + ASR 1–2GB）| ⚠️ 依赖组合，需实测 | MuseTalk **V100 >30FPS**（转述上游）；Stream 版仅定性"低延迟" | ⚠️ 主仓否；**Linly-Talker-Stream 支持 barge-in 全双工** | ✅ 强 | 🔴 高（主仓 **2026-02 后停更**，无 2026 适配）|
| Fay | agent 框架 + 数字人连接器（**不渲染**）| **本体 0 GPU**；显存取决于外挂模型 | ✅ 本体无需求 | **官方无数字（未查到）** | ✅ 全时流式 + 支持打断 | ✅ 原生中文 | 🟢 低（纯编排层）|
| aigcpanel | Electron 桌面面板 + 本地模型启动包/云 API | **面板 0**；本地模型需 NVIDIA GPU，**具体 GB 未公布** | ✅ 面板无需求，模型包需实测 | **未查到**（离线任务式）| ❌ 未查到（任务式批处理）| ✅ 原生中文 | 🟡 未知（打包内 torch/ORT 版本不透明）|

---

## 第二轮核实补充：实测 / 官方量化的显存与 FPS 数字（2026-09-22 补录）

> **抓取通道变更（重要）**：本轮 `raw.githubusercontent.com` 在本机 IP 开始整体超时（`curl exit 28 / code=000`），改用 **jsDelivr 镜像** `https://cdn.jsdelivr.net/gh/<owner>/<repo>@<branch>/<path>` 成功获取全部 README；GitHub REST API 持续限流未使用；星标与许可证经 **shields.io** 复核。

### A1. OpenAvatarChat —— 第三方**实测** 3.1GB / 5.3GB（附实测截图）

来源：53AI 转载《低显存福音！OpenAvatarChat开源！实测仅需4G显存即可畅玩多模态数字人！》（2025-06-16，作者「AI与喵部署日记」，阅读 7846）逐字原文：

- 部署方案：*"本教程将采用硬件需求最低的部署方案：**SenseVoice + LLM API + CosyVoice API 的方式运行 LAM 或 LiteAvatar 数字人**。显存占用最低仅有3G！"*
- 实测环境与方法：*"**在搭载 RTX3060 6G 的笔记本电脑上运行测试** 运行 **LAM数字人，仅占用 3.1G 显存**！对话流畅，性能相当强悍！**实测图如下**："*
- *"运行 **LiteAvatar数字人，也仅需 5.3G 显存**！实测图如下："*
- 系统依赖：*"• **N卡4G以上显存** • N卡支持 **CUDA >= 12.4** • ffmpeg • miniconda 或 Anaconda • 阿里云百炼API KEY( 可白嫖 )"*
- **【第三方实测，带实测截图；版本为 2025-06 的 0.4.x/0.5.x 时代，0.6.0 未复测】**
- ⚠️ **两个口径差异必须写进报告**：① 该实测 LAM = **3.1GB**，与 DeepWiki 旧版 README 表「LAM **2-3GB**」量级一致；② 实测 LiteAvatar = **5.3GB**，**高于** DeepWiki 的 "LiteAvatar **3GB VRAM/session**" → **LiteAvatar 实际比 LAM 更吃显存**（因 LiteAvatar 需额外跑渲染/视频编码链路）。建议报告以「LAM ≈3GB、LiteAvatar ≈5–6GB」表述，并注明口径来源。

### A2. MuseTalk（Linly-Talker 与 aigcpanel 的**共同上游后端**）—— 官方实测推理显存 + 官方训练显存表

来源：MuseTalk 官方 README（`TMElyralab/MuseTalk`）逐字：

- **推理最低配置（官方实测）**：*"For minimum hardware requirements, we tested the system on a Windows environment using an **NVIDIA GeForce RTX 3050 Ti Laptop GPU with 4GB VRAM**. In fp16 mode, generating an **8-second video takes approximately 5 minutes**."* → **推理最低 4GB VRAM**；4GB 笔记本卡上 **8 秒视频 ≈ 5 分钟（RTF ≈ 37.5×，非实时）**。
- **实时档（官方声明）**：*"supports real-time inference with **30fps+ on an NVIDIA Tesla V100**"*；另注 *"we recommend using input videos with **25fps**, which is the same fps used during model training"*。
- fp16 权衡：*"You can remove `--use_float16` for better quality, but it will **increase VRAM usage and inference time**"*。
- **训练显存（官方在「a machine with 8 NVIDIA H20 GPUs」上实测的每卡数字，逐字表格）**：

| 阶段 | Batch Size | 梯度累积 | 每卡显存 | 官方推荐 |
|---|:---:|:---:|:---:|:---:|
| Stage 1 | 8 | 1 | **~32GB** | |
| Stage 1 | 16 | 1 | **~45GB** | |
| Stage 1 | **32** | 1 | **~74GB** | ✓ |
| Stage 2 | 1 | 8 | **~54GB** | |
| Stage 2 | 2 | 2 | **~80GB** | |
| Stage 2 | **2** | **8** | **~85GB** | ✓ |

→ **结论（回答 Linly-Talker 的「训练 vs 推理显存」）**：**MuseTalk 微调在 16GB 单卡上完全不可行**（最低档 Stage1 bs=8 也要 **~32GB/卡**）；**16GB 只能跑 fp16 推理**。这条官方数字可**代答** Linly-Talker 与 aigcpanel 的 MuseTalk 后端显存问题。

### A3. LivePortrait —— 实时化分支的真实数字（TensorRT）

来源：`warmshao/FasterLivePortrait` README 逐字：

> *"Achieved **real-time running of LivePortrait on RTX 3090 GPU** using TensorRT, reaching speeds of **30+ FPS**. This is the speed for rendering a single frame, **including pre- and post-processing**, not just the model inference speed."*

→ 与官方 `speed.md`（RTX 4090 + torch.compile，纯推理 **≈67.7 FPS / 14.77ms**）形成互补：**官方原生路径在 4090 上单帧推理更快，而 3090 + TensorRT 已能做到含前后处理的 30+ FPS 全流程实时**。该分支还支持相机实时输入（`--realtime`、`camera.bat`）→ **LivePortrait 生态具备实时能力，但来自社区改造，非官方**。

**该分支暴露的 LivePortrait 依赖地狱（对 sm_120 极关键，逐字）**：
- *"Install **TensorRT 8.x (versions >=10.x are not compatible)**"* → **TensorRT ≥10 不兼容**；
- *"Install the **grid_sample TensorRT plugin**, as the model uses grid sample that requires **5D input**, which is not supported by the native grid_sample operator"* → 须自编译 TRT 插件；
- *"The latest **onnxruntime-gpu still doesn't support grid_sample cuda**, but I found a branch that supports it"* → 须从 `microsoft/onnxruntime` 的 `liqun/ImageDecoder-cuda` 分支**源码编译**出 `onnxruntime_gpu-1.17.0-cp310-cp310-linux_x86_64.whl`。
→ **结论**：LivePortrait 在 CUDA 13.2 / 驱动 610 / sm_120 上**几乎必然踩坑**（ORT 1.17/1.18 无 sm_120 kernel + TRT 必须 8.x 而 610 驱动时代主流是 TRT 10.x + 需自定义 CUDA 插件与 ORT 源码编译）。

### A4. aigcpanel —— 官方「模型市场」逐包 GPU 门槛（本轮最硬证据，直接回答问题）

来源：aigcpanel 官方模型市场页（`?tag=视频换口型`，页面自述「共 12 个资源」）。每个模型一键运行包**逐字标注了 GPU / 内存门槛**：

| 模型一键运行包 | 价格 | GPU 要求 | 内存 | 50 系(Blackwell)标注 | 备注（页面原文/日期） |
|---|---|---|---|---|---|
| **Wav2Lip** | 免费 | **GPU 4G+** | 8G+ | — | 2026-08-24，Win-x86 / OSX-ARM64 / Linux-x86 |
| **SadTalker** | 免费 | **GPU 4G+** | 8G+ | — | *"GPU 4G+ 即可运行"*；暂未发布 |
| **MuseTalk** | 免费 | **GPU 6G+** | 16G+ | ✅ **支持50显卡** | 2026-09-16 v1.3.0；*"V100 上 30fps+ 实时推理，支持多语言"* |
| **Wav2Lip384（优化版）** | VIP/SVIP | **GPU 8G+** | 16G+ | — | 2026-08-22 |
| **Heygem-v2（优化版）** | VIP | **GPU 8G+** | 16G+ | ✅ | 2026-08-22；硅基智能 v2 |
| **LatentSync** | 免费 | **GPU 8G+** | 16G+ | — | 2026-07-27 v1.1.1 |
| **LatentSync15（ComfyUI 工作流）** | 免费 | **GPU 8G+** | 16G+ | ✅ | *"纯 PyTorch，支持 CUDA / MPS / CPU"*؛ 暂未发布 |
| **SoulX-FlashHead Lite（1.3B）** | 免费 | **GPU 8G+** | 16G+ | ✅ | *"**消费级 GPU 可达 96 FPS 实时推理**"*；暂未发布 |
| **LivePortrait** | 免费 | **GPU 8G+** | 16G+ | ✅ | *"输入人像图片和驱动视频…支持视频/图片双驱动模式"*；暂未发布 |
| **LatentSync 数字人对口型（ComfyUI 一键运行包）** | 免费 | **GPU 16G+** | 16G+ | — | 2026-09-02 |
| **Heygem（优化版）** | VIP/SVIP | **GPU 16G+** | 16G+ | — | 2026-07-28 |
| **FlashTalk（SoulX-FlashTalk-14B）** | 免费 | **GPU 24G+** | 32G+ | ✅ | *"支持无限长流式生成"*；暂未发布 |

- 另一条官方数字：LatentSync 介绍文案 *"大幅降低**训练显存至 20GB**，消费级显卡即可实现音频驱动视频精准对口型"*。
- **对 RTX 5060 Ti 16GB 的直接结论**：12 个口型包中 **11 个官方门槛 ≤16GB**（4G×2、6G×1、8G×6、16G×2），**唯一超限的是 FlashTalk 14B（24G+ / 内存 32G+）**；且 **6 个包明确标注「支持50显卡」= Blackwell 可用**（MuseTalk / LatentSync15 / SoulX-FlashHead Lite / LivePortrait / Heygem-v2 / FlashTalk）。
- **关键澄清**：这印证了官方文档口径——**aigcpanel 面板本体不需要 GPU（0 显存）**，GPU 需求**完全由所选模型启动包决定**；它确实**本地跑引擎**（一键运行包），不只是"调用别的引擎"。
- **延迟口径**：官方页面对 FPS 的唯一数字是 **SoulX-FlashHead Lite「96 FPS 实时推理」**（且该包"暂未发布"）；其余包**均未标延迟** → aigcpanel 层面**仍无端到端延迟实测，未查到**。

### A5. 仍未查到的项（诚实标注，未编造）

- **Linly-Talker 官方/实测显存**：仍只有 CSDN 第三方「模块估算」文章（AI 生成风格、无实测截图）。可用 **A2 的官方 MuseTalk 数字代答**其 MuseTalk 后端：**推理 fp16 最低 4GB；训练 ~32–85GB/卡**。主仓帧率/端到端延迟：**未查到**。
- **Fay 的显存实测**：**未查到**。Fay 本体不渲染、官方无 GPU 要求，其显存 100% 取决于外挂的 ASR/TTS/LLM 与数字人客户端，社区无统一口径实测。
- **LivePortrait 官方 nvidia-smi 实测**：**未查到**。可用证据三条（口径不同）：官方权重 **≈499.6MB**（`speed.md`）／aigcpanel 官方包标 **GPU 8G+**／第三方 pinokio 标 **6GB VRAM** → **报告建议取 8GB 作为保守门槛**。
- **HeyGem 显存**：仅有 CSDN 上大量 AI 生成的 SEO 文章（如《NVIDIA GPU显存至少需要多少才能流畅运行HeyGem？》，**该文明说是"经验性结论/估算"而非实测**，并给出 720p 单任务 ≥6GB/推荐 ≥8GB、1080p ≥8GB/推荐 ≥12GB、720p 批量 ≥10GB/推荐 ≥16GB）→ **【第三方估算，可信度低】**，仅建议与 aigcpanel 官方标称的 **Heygem-v2 GPU 8G+ / Heygem GPU 16G+** 交叉印证（两者量级一致）。

### B. 许可证 / 星标 / 最后提交复核（shields.io + commits atom，2026-09-22）

| 仓库 | shields.io license | shields.io stars | 最后提交（`<updated>` 首个） |
|---|---|---|---|
| KlingAIResearch/LivePortrait | **not identifiable by github** | 19k | 2026-06-01T17:24:54Z |
| HumanAIGC-Engineering/OpenAvatarChat | **Apache-2.0** | 3.8k | 2026-07-31T00:28:29Z |
| Kedreamix/Linly-Talker | **MIT** ✅（与父 agent 结论一致）| 3.5k | 2026-02-10T05:17:02Z |
| xszyou/Fay | **GPL-3.0** | 14k | 2026-09-21T08:56:28Z |
| modstart-lib/aigcpanel | **Apache-2.0** | 5.6k | 2026-09-18T04:46:10Z |

> 注：LivePortrait 的 shields 显示 **"not identifiable by github"** 本身就是「MIT 主体 + InsightFace 模型非商用附注」这一**混合许可证**的机器可读证据（GitHub 无法归类为纯 MIT）。

### C. 横评表修订（据本轮实测证据）

| 仓库 | 原判 | **本轮修订** |
|---|---|---|
| OpenAvatarChat | LAM 2–3GB（旧 README）| **LAM 实测 3.1GB；LiteAvatar 实测 5.3GB**（RTX 3060 6G 笔记本，第三方实测带图）→ 16GB 单卡余量充足 |
| LivePortrait | 显存未知 | **保守门槛 8GB**（aigcpanel 官方标称）；实时档 **RTX 3090 + TensorRT 30+ FPS**（第三方实测声明）；官方 4090 纯推理 67.7 FPS |
| Linly-Talker | 显存未知 | **MuseTalk 后端官方实测：推理 fp16 最低 4GB、训练 32–85GB/卡**；主仓自身仍无数字 |
| aigcpanel | 面板 0 显存、模型 GB 未公布 | **官方逐包门槛已公布（4G/6G/8G/16G/24G）**；11/12 个包 ≤16GB；6 个包标「支持50显卡」；SoulX-FlashHead Lite 标称 **96 FPS** |
| Fay | 本体 0 显存 | 维持不变；**实测数字仍缺失（未查到）** |

---

## 来源清单

**官方来源（作者声明）**
1. LivePortrait LICENSE（MIT + InsightFace 非商用附注）— https://raw.githubusercontent.com/KlingAIResearch/LivePortrait/main/LICENSE
2. LivePortrait readme.md（小写文件名）— https://raw.githubusercontent.com/KlingAIResearch/LivePortrait/main/readme.md
3. LivePortrait 官方速度基准 speed.md — https://cdn.jsdelivr.net/gh/KlingAIResearch/LivePortrait@main/assets/docs/speed.md （仓库路径 https://github.com/KlingAIResearch/LivePortrait/blob/main/assets/docs/speed.md）
4. LivePortrait 提交历史（最后提交 2026-06-01）— https://github.com/KlingAIResearch/LivePortrait/commits/main.atom
5. LivePortrait 依赖清单（`onnxruntime-gpu==1.18.0`）— https://raw.githubusercontent.com/KlingAIResearch/LivePortrait/main/requirements.txt
6. LivePortrait 仓库页（19,084 stars，重定向自 KwaiVGI）— https://github.com/KlingAIResearch/LivePortrait
7. OpenAvatarChat README — https://raw.githubusercontent.com/HumanAIGC-Engineering/OpenAvatarChat/main/README.md
8. OpenAvatarChat 快速开始（CUDA ≥12.8 / flash-attn 编译）— https://humanaigc-engineering.github.io/OpenAvatarChat/getting-started/
9. OpenAvatarChat 提交历史（最后提交 2026-07-31）— https://github.com/HumanAIGC-Engineering/OpenAvatarChat/commits/main.atom
10. OpenAvatarChat 仓库页（3,773 stars）— https://github.com/HumanAIGC-Engineering/OpenAvatarChat
11. Linly-Talker README（中/英）— https://raw.githubusercontent.com/Kedreamix/Linly-Talker/main/README.md ｜ https://raw.githubusercontent.com/Kedreamix/Linly-Talker/main/README_zh.md
12. Linly-Talker 提交历史（最后提交 2026-02-10）— https://github.com/Kedreamix/Linly-Talker/commits/main.atom
13. Linly-Talker 仓库页（3,453 stars）— https://github.com/Kedreamix/Linly-Talker
14. Linly-Talker-Stream README（WebRTC / barge-in）— https://raw.githubusercontent.com/Kedreamix/Linly-Talker-Stream/main/README.md
15. Fay README — https://raw.githubusercontent.com/xszyou/Fay/master/README.md
16. Fay LICENSE（GPL-3.0）— https://raw.githubusercontent.com/xszyou/Fay/master/LICENSE
17. Fay 提交历史（最后提交 2026-09-21）— https://github.com/xszyou/Fay/commits/main.atom
18. Fay 仓库页（13,545 stars）— https://github.com/xszyou/Fay
19. fay-ue5（UE 数字人通道）— https://raw.githubusercontent.com/xszyou/fay-ue5/main/README.md
20. aigcpanel README — https://raw.githubusercontent.com/modstart-lib/aigcpanel/main/README.md
21. aigcpanel LICENSE（Apache-2.0）— https://raw.githubusercontent.com/modstart-lib/aigcpanel/main/LICENSE
22. aigcpanel 提交历史（最后提交 2026-09-18）— https://github.com/modstart-lib/aigcpanel/commits/main.atom
23. aigcpanel 官方文档《使用前需要了解的基础知识》（界面软件无硬件要求 / AI 模型需专业显卡 / 云模型无需本地显卡）— https://aigcpanel.com/zh/document/74
24. aigcpanel 仓库页（5,574 stars）— https://github.com/modstart-lib/aigcpanel

**第三方（实测/整理，非官方）**
25. DeepWiki「OpenAvatarChat / Getting Started」——显存表（minicpm 20GB+/int4 10GB、LAM 2-3GB、Qwen-Omni 2-3GB、openai_compatible 8-10GB）与系统要求（VRAM min 10GB / rec 20GB+、RAM 32GB+、CUDA 12.4+、torch 2.4.1）— https://deepwiki.com/HumanAIGC-Engineering/OpenAvatarChat/2-getting-started
26. DeepWiki「OpenAvatarChat / System Requirements」— https://deepwiki.com/HumanAIGC-Engineering/OpenAvatarChat/2.1-system-requirements
27. DeepWiki「OpenAvatarChat / Avatar Systems」——LiteAvatar "Low-Medium (3GB VRAM/session)"、MuseTalk "High"、输出典型 25fps — https://deepwiki.com/HumanAIGC-Engineering/OpenAvatarChat/6-avatar-systems
28. DeepWiki「OpenAvatarChat / Configuration Examples」— https://deepwiki.com/HumanAIGC-Engineering/OpenAvatarChat/4.2-configuration-examples
29. CSDN《Linly-Talker对显卡配置的要求及性价比推荐》——模块显存估表 + "12GB 为最低推荐门槛"（AI 生成风格，无实测截图）— https://blog.csdn.net/weixin_42561464/article/details/156119020
30. Compshare 镜像页《Fay数字人-3.1.1》——镜像 40GB、累计部署 255、最近更新 2025-12-05、CUDA 版本栏为空 — https://www.compshare.cn/images/compshareImage-1cft3sk9gvta
31. Lytanshade/LivePortrait-pinokio——"6GB VRAM ~8GB install"（第三方封装声明）— https://github.com/Lytanshade/LivePortrait-pinokio
32. microsoft/onnxruntime issue #27621——"[CUDA EP] Silent deadlock ... on Blackwell GPU (RTX 5060, sm_120)" — https://github.com/microsoft/onnxruntime/issues/27621
33. Natfii/onnxruntime-gpu-blackwell——"onnxruntime-gpu 1.24.1 with Blackwell sm_120 CUDA kernels" — https://github.com/Natfii/onnxruntime-gpu-blackwell
34. OpenAvatarChat 官方 B 站教程（未逐帧核验）— https://www.bilibili.com/video/BV1sv8QzLEC2

**第二轮新增来源（实测/官方量化数字）**

35. 53AI 转载《低显存福音！OpenAvatarChat开源！实测仅需4G显存即可畅玩多模态数字人！》—— RTX3060 6G 笔记本实测：**LAM 3.1G / LiteAvatar 5.3G**、N卡4G以上、CUDA≥12.4 — https://www.53ai.com/news/OpenSourceLLM/2025061631429
36. MuseTalk 官方 README —— 推理实测最低 **RTX 3050 Ti Laptop 4GB VRAM / fp16 下 8 秒视频约 5 分钟**、**V100 30fps+**、训练每卡显存表（Stage1 32/45/74GB，Stage2 54/80/85GB，8×H20）— https://cdn.jsdelivr.net/gh/TMElyralab/MuseTalk@main/README.md
37. FasterLivePortrait（warmshao）README —— **RTX 3090 + TensorRT 实时 30+ FPS（含前后处理）**；TensorRT **8.x（≥10 不兼容）**、需 grid_sample TRT 插件、需自编译 `liqun/ImageDecoder-cuda` 分支的 onnxruntime_gpu-1.17.0 — https://cdn.jsdelivr.net/gh/warmshao/FasterLivePortrait@master/README.md
38. aigcpanel 官方模型市场（视频换口型，12 个资源）—— 逐包 GPU/内存门槛：Wav2Lip 4G+/8G+、SadTalker 4G+/8G+、MuseTalk **6G+**/16G+（支持50显卡）、Wav2Lip384 8G+、Heygem-v2 8G+、LatentSync 8G+、LatentSync15 8G+、SoulX-FlashHead Lite 8G+（*96 FPS 实时推理*）、LivePortrait 8G+、LatentSync ComfyUI 16G+、Heygem 16G+、FlashTalk 24G+/32G+ — https://aigcpanel.com/zh/asset?tag=%E8%A7%86%E9%A2%91%E6%8D%A2%E5%8F%A3%E5%9E%8B
39. shields.io 许可证/星标复核（LivePortrait `not identifiable by github`、OAC Apache-2.0、Linly-Talker MIT、Fay GPL-3.0、aigcpanel Apache-2.0）— https://img.shields.io/github/license/&lt;owner&gt;/&lt;repo&gt;
40. CSDN《NVIDIA GPU显存至少需要多少才能流畅运行HeyGem？》—— 720p 单任务 ≥6GB/推荐 ≥8GB、1080p ≥8GB/≥12GB、720p 批量 ≥10GB/≥16GB（**作者自称"经验性结论"估算，非实测**，AI 生成风格，可信度低）— https://blog.csdn.net/weixin_35903223/article/details/156559902
41. CSDN《Linly-Talker支持哪些GPU型号？显存要求说明》— https://blog.csdn.net/weixin_42584507/article/details/156108152
42. CSDN《Linly-Talker深度测评：开源数字人系统的性能边界在哪？》— https://blog.csdn.net/weixin_33239721/article/details/156104378
43. CSDN《lite-avatar形象库部署教程：GPU显存仅需4GB即可运行的轻量级2D数字人方案》— https://blog.csdn.net/weixin_31860973/article/details/158077639
44. gitcode《30分钟上手Fay数字人框架：从安装到部署全指南》— https://blog.gitcode.com/fc7c5060556b75882fdbc62e2d1a1902.html
45. LivePortrait issue #76（直播/摄像头实时输入可行性讨论）— https://github.com/KlingAIResearch/LivePortrait/issues/76
46. Lytanshade/LivePortrait-pinokio（第三方封装声明 "6GB VRAM ~8GB install"）— https://github.com/Lytanshade/LivePortrait-pinokio

**第二轮方法学备注**：`raw.githubusercontent.com` 在本机 IP 本轮整体超时（curl exit 28），全部 README 改由 **jsDelivr 镜像**（`https://cdn.jsdelivr.net/gh/<owner>/<repo>@<branch>/<path>`）获取；GitHub REST API 全程限流未使用；最后提交时间取自 `https://github.com/<owner>/<repo>/commits/main.atom`。若需复现，请优先使用这两条不消耗 API 配额的通道。

**无法核实项（未查到，未编造）**：LivePortrait 官方显存要求与首帧延迟（仅有 499.6MB 权重 + 第三方 6GB/8GB 门槛）；OpenAvatarChat 首帧延迟（有 2.2s 平均响应，无首帧数字）与 MuseTalk 后端的 OAC 内实测 GB；Linly-Talker 自身官方训练/推理显存与帧率（其 MuseTalk 后端可用官方 4GB 推理 / 32–85GB 训练代答）；Fay 官方任何延迟/FPS 与显存数字、xuniren/metahuman 连接器名称级原文；aigcpanel 端到端延迟（唯一 FPS 数字来自未发布的 SoulX-FlashHead Lite 包标称 96 FPS）。GitHub REST API 因限流（core remaining=0）未能执行 issue 关键词检索（sm_120/Blackwell/OOM/16GB），上述 sm_120 结论部分依赖依赖清单、官方文档与搜索结果推断，**建议后续用带 token 的 API 补做 issue 检索验证**。
