C3 组核实结果:实时数字人(Talking Head)开源项目 × RTX 5060 Ti 16GB (sm_120)
核实日期:2026-09-22。目标硬件:RTX 5060 Ti 16GB / sm_120 Blackwell / 32GB RAM / Ubuntu / 驱动 610.43.02 / CUDA 13.2。 标注约定:【作者声明】= 官方 README/文档原文;【第三方实测】= 他人博客/镜像页/wik 实测或整理;【估算】= 依据官方数据推算;未查到 = 无法核实,未编造。
抓取方法说明:GitHub REST API 在本次会话已被限流(API rate limit exceeded,core remaining=0),故星标/日期改用 GitHub 仓库 HTML("stargazerCount")与 commits Atom feed(/commits/<br>.atom)核对,均为 2026-09-22 当日抓取。
1. KwaiVGI/LivePortrait(已改名 KlingAIResearch/LivePortrait)
| 项 | 值 |
| 仓库现状 | 已从 KwaiVGI/LivePortrait 重定向为 KlingAIResearch/LivePortrait(GitHub HTML <meta description>:"Contribute to KlingAIResearch/LivePortrait development") |
| Stars | 19,084(2026-09-22 抓取 HTML "stargazerCount":19084) |
| 最后提交 | 2026-06-01T17:24:54Z(/commits/main.atom)→ 约 3.7 个月无提交,处于「稳定/低维护」状态 |
| 默认分支 | main;说明文件是小写 readme.md(README.md 返回 404,抓取时注意) |
(c) VRAM 与 16GB 单卡可行性
- 官方未给出推理显存数字(README 全文无 VRAM/显存要求段落)→ 显存要求:官方未声明。
- 官方权重规模(可推算显存下限)——
assets/docs/speed.md 原文表格:
| Model | Parameters(M) | Model Size(MB) | Inference(ms) |
| Appearance Feature Extractor | 0.84 | 3.3 | 0.82 |
| Motion Extractor | 28.12 | 108 | 0.84 |
| Spade Generator | 55.37 | 212 | 7.59 |
| Warping Module | 45.53 | 174 | 5.21 |
| Stitching and Retargeting Modules | 0.23 | 2.3 | 0.31 |
原文小注:"The values for the Stitching and Retargeting Modules represent the combined parameter counts and total inference time of three sequential MLP networks." 合计 ≈130.1M 参数 / ≈499.6 MB 权重(作者在表头口径为 RTX 4090 + 原生 PyTorch + torch.compile,单帧)。 → 【估算】fp16 权重 ≈ 0.25–0.5 GB;整流程(特征提取 + 3D 关键点 + SPADE 生成器 + warping + 拼接)在 1024px 级分辨率下的激活显存,官方未给数;保守估计峰值远低于 8GB,16GB 单卡余量充足(此项为估算,非实测)。
- 【第三方声明】显存下限 6GB:第三方打包项目 Lytanshade/LivePortrait-pinokio 仓库标题原文 "LivePortrait [Nvidia and MacOS silicon supported]: Bring a portrait to life using a Video source -> 6GB VRAM ~8GB install" → github.com/Lytanshade/LivePortrait-pinokio。属第三方封装声明,未见 nvidia-smi 截图实测。
- 正面对比:表头的 RTX 4090 24GB 是作者唯一给出的参考卡,说明官方定位的参考硬件远高于 6GB。
(d) 端到端延迟 / FPS
- 单帧推理(RTX 4090 + torch.compile,官方
speed.md):0.82+0.84+7.59+5.21+0.31 = 14.77 ms/帧 → 【估算】≈ 67.7 FPS。
torch.compile 收益(作者声明):"The first-time inference triggers an optimization process (about one minute), making subsequent inferences 20-30% faster. Performance gains may vary with different CUDA versions." → 首次编译约 1 分钟(属于首帧延迟开销)。
- 注意:LivePortrait 是「视频/模板驱动」的肖像动画,不是音频驱动 lip-sync。 因此「首帧延迟」「ASR→TTS→口型」这类链路指标在官方语境中不存在,未查到。
- 相对锚点(作者声明):macOS Apple Silicon 走 MPS "this maybe 20x slower than RTX 4090"。
(e) 流式 / 可打断
- 官方无流式/双工声明。
app.py 为 Gradio 交互式推理,inference.py 为离线视频生成 → 属于逐段/离线推理,非流式。
- 社区生态有实时化分支(README 收录):
FasterLivePortrait(TensorRT 实时版)、FacePoke("A real-time head transformation app, controlled by your mouse!")、ComfyUI-AdvancedLivePortrait("A faster ComfyUI node with real-time preview")→ 实时能力来自第三方改造,非官方。
- 可打断/对话打断:无(无 ASR/LLM/TTS 环节)。
(f) 中文支持 / 半身-全身
- 中文:与语言无关(不涉及 ASR/TTS);驱动信号是视频/模板 pkl,无中文语义层。
- 半身/全身:官方定位 portrait(人像/头肩);支持 humans、cats and dogs 三种模式(README "efficient portrait-animation (humans, cats and dogs) solution")。无半身/全身声明,未查到全身支持。
(g) 已知坑(sm_120 / Blackwell / 依赖)
onnxruntime-gpu==1.18.0 硬钉版本 —— liveportrait requirements.txt 原文:
-r requirements_base.txt
onnxruntime-gpu==1.18.0
transformers==4.38.0
1.18.0 为 2024 年构建,不含 sm_120 (Blackwell) CUDA kernel。
- sm_120 上 onnxruntime CUDA EP 存在已知 Blackwell 缺陷:microsoft/onnxruntime issue #27621 标题原文 "[CUDA EP] Silent deadlock when calling
InferenceSession.run() from Python thread on Blackwell GPU (RTX 5060, sm_120, Windows)" → issue #27621。(该 issue 为 Windows 复现,Linux 未确认,但同为 sm_120 + RTX 5060 平台,属高风险预警。)
- 官方 wheel 缺 sm_120,需第三方重建 wheel:Natfii/onnxruntime-gpu-blackwell —— "Pre-built onnxruntime-gpu 1.24.1 with Blackwell sm_120 CUDA kernels (RTX 5090/5080/5070)" → github.com/Natfii/onnxruntime-gpu-blackwell。即:要用 Blackwell 必须离开官方 pinned 的 1.18.0。
- torch 安装示例只到 CUDA 12.1(README:cu111 / cu118 / cu121),且原文警告 "On Windows systems, some higher versions of CUDA (such as 12.4, 12.6, etc.) may lead to unknown issues. You may consider downgrading CUDA to version 11.8 for stability." → 对 CUDA 12.8/13.x + Blackwell 官方零说明(2026-09 未验证)。
- X-Pose(Animals 模式)需自编译 CUDA 算子:"You need to build an OP named
MultiScaleDeformableAttention first ... which is used by X-Pose" → sm_120 下需自行 TORCH_CUDA_ARCH_LIST=12.0 编译,Huamns 模式可跳过(README:"The step of Check your CUDA versions is optional if you only want to run Humans mode.")。
- 无 flash-attn / triton 依赖(依赖树中未出现)→ 少一类坑。
许可证(重点:可商用的边界)
- 仓库根
LICENSE = MIT,Copyright (c) 2024 Kuaishou Visual Generation and Interaction Center。
- LICENSE 末尾附有非商用限制条款(原文逐字):
"The code of InsightFace is released under the MIT License. The models of InsightFace are for non-commercial research purposes only. If you want to use the LivePortrait project for commercial purposes, you should remove and replace InsightFace's detection models to fully comply with the MIT license."
- 结论:LivePortrait 代码本身是 MIT(可商用),但默认人脸检测依赖 InsightFace 的模型,属"仅限非商业研究";商用须替换 InsightFace 检测模型。README 亦给出替代方案线索:
ComfyUI-LivePortraitKJ 使用 MediaPipe 替代 Insightface。
- 未查到 LivePortrait 官方有任何独立「for research only」声明(论文/README 均无)。
2. HumanAIGC-Engineering/OpenAvatarChat
| 项 | 值 |
| Stars | 3,773(2026-09-22 HTML) |
| 最后提交 | 2026-07-31T00:28:29Z(commits/main.atom)→ 活跃 |
| 最新版本 | 0.6.0(2026.04);上一版 0.5.1(2025.08.19) |
支持的 Avatar 后端(作者声明,README「核心亮点」逐字)
"多样数字人形象:支持 LiteAvatar、LAM、MuseTalk、FlashHead 等多种数字人技术"
0.6.0 更新原文新增:"接入 SoulX-FlashHead 数字人,基于扩散模型的实时流式说话头生成"。 预置配置(README「预置模式」表):chat_with_lam.yaml=LAM;chat_with_qwen_omni.yaml=lite-avatar;chat_with_openai_compatible_bailian_cosyvoice.yaml=lite-avatar;..._flashhead.yaml / ..._flashhead_duplex.yaml / ..._flashhead_duplex_agent.yaml=FlashHead(含双工)。
(c) VRAM 要求 —— 官方 README 的显存表(引用位置见下)
重要:当前 main 分支的 README.md(2026-09-22 抓取,7581 字节)中已不含显存表;显存表出现在更早的 README 版本中。第三方代码百科 DeepWiki 明确标注其数据源为 README.md 254-345 / readme_en.md 243-332(即带表的那一版),原文表格逐字如下(【第三方整理/官方旧版 README】):
| Configuration File | VRAM Required | Requires API Key | Best For |
chat_with_minicpm.yaml | 20GB+ (or 10GB with int4) | No | Full privacy, powerful GPU |
chat_with_lam.yaml | 2-3GB | Yes (Bailian) | Multi-session, 3D avatar |
chat_with_qwen_omni.yaml | 2-3GB | Yes (Bailian) | Speech-to-speech E2E |
chat_with_openai_compatible.yaml | 8-10GB | Yes (OpenAI/Bailian) | Local TTS, cloud LLM |
来源:deepwiki.com/.../2-getting-started
系统要求(同一来源 DeepWiki,标注源自 pyproject.toml 52-65):
Hardware Requirements — VRAM: minimum 10GB / recommended 20GB+;GPU: "NVIDIA GPU with CUDA support",推荐 RTX 3090/4090 or better;System RAM 16GB min / 32GB+ rec;CUDA 12.4+;PyTorch 2.4.1 + CUDA 12.4;Python ≥3.11.7, <3.12。
各后端资源画像(DeepWiki「Avatar Systems」):LiteAvatar = "Server-side / 2D facial animation / Low-Medium (3GB VRAM/session)";MuseTalk = "Server-side / Video-based deep learning / High (GPU …)"。
16GB 单卡结论(推断):chat_with_lam.yaml / lite-avatar(2–3GB)与 chat_with_openai_compatible.yaml(8–10GB,本地 TTS + 云端 LLM)→ 16GB 单卡可跑,且余量大;chat_with_minicpm.yaml 全本地(20GB+,int4 后 10GB)→ 16GB 需 int4 量化才可。MuseTalk 后端 DeepWiki 仅标 "High",未给具体 GB,未查到。
(d) 端到端延迟
- 官方 README 唯一明确数字(逐字):"低延迟优化:通过 VAD 检测、语音缓冲、帧率控制等机制优化,平均响应时间仅 2.2 秒" → 【作者声明】端到端平均响应 2.2 s。
- 官方 B 站教程:BV1sv8QzLEC2(未逐帧核验)。
- 首帧延迟、推理 FPS:官方未给出(未查到);DeepWiki 提到输出 "RGB video frames at configured FPS (typically 25fps)" → 【第三方】典型输出 25fps。
(e) 流式 / 可打断 —— 本项目最强项
0.6.0 更新原文:"所有数字人均支持手动打断和双工打断模式" → 全后端支持手动打断 + 双工(barge-in)打断。README Beta 区另有 Chat Agent(OpenClaw 集成)多轮工具调用模式(Beta,API 可能变)。
(f) 中文支持 / 半身-全身
- 中文:ASR 用 SenseVoice(阿里,中文强),TTS 用 CosyVoice(README 组件表:FunAudioLLM/CosyVoice),LLM 走百炼(阿里云)OpenAI 兼容 API → 中文原生支持,全链路中文友好。默认模型下载源优先 ModelScope(文档:"默认模式 (--source auto) 会对有 ModelScope 源的模型优先使用 ModelScope"),国内网络友好。
- 半身/全身:LAM 为 3D 数字人(
aigc3d/LAM_Audio2Expression,README 予其 HF 模型 3DAIGC/LAM_audio2exp);LiteAvatar 为 2D 面部动画;MuseTalk/FlashHead 为口型驱动(头肩/半身视频)。明确的全身(full-body)支持:未查到(LAM 走 3D 表达参数,理论上可驱动 3D 全身,但 README 无全身声明)。
(g) 已知坑(sm_120 / Blackwell / 依赖)
- 官方文档要求驱动支持的 CUDA ≥ 12.8(快速开始页原文:"本项目的运行依赖 CUDA,请确保本机 NVIDIA 驱动程序支持的 CUDA 版本 >= 12.8")→ 对 Blackwell 是有利项(12.8 起支持 sm_120);本机 CUDA 13.2 满足。
- flash-attn 自动编译:快速开始页原文 "需要编译安装的包(如 flash-attn)会自动使用
--no-build-isolation 并限制并行编译线程数" → sm_120 下 flash-attn 源码编译耗时长/易失败(官方已试图缓解,但仍属坑)。
- PyTorch 版本落后:DeepWiki 记录
pyproject.toml 钉 PyTorch 2.4.1 + CUDA 12.4 → 该组合不含 sm_120 kernel,Blackwell 上须自行升级到 cu128/cu130 轮子,会与 install.py 的版本解析产生冲突。
- Python 版本窗口窄:≥3.11.7, <3.12。
- 依赖用
uv + git lfs 子模块(文档要求 git lfs install 与 git submodule update --init --recursive),模型体积大。
- 未查到 any sm_120 专项 issue(GitHub API 限流,未能做 issue 关键词检索)——此点建议后续用
is:issue sm_120 补验。
3. Kedreamix/Linly-Talker
| 项 | 值 |
| Stars | 3,453(2026-09-22 HTML) |
| 最后提交 | 2026-02-10T05:17:02Z(commits/main.atom)→ 截至 2026-09-22 已 7 个多月无提交,主仓维护停滞 |
| 分仓活跃 | 新增 Linly-Talker-Stream(实时流式版,独立仓库),但主仓自身停更 |
维护状态(重点结论)
- 主仓 README 中文版最新更新条目为 2026.02:"🚀 发布 Linly-Talker-Stream:全新的实时流式交互架构版本!基于 WebRTC 实现低延迟音视频传输…";此后(2026-02-10 提交后)无新提交。
- 实时能力已被迁移到分仓
Kedreamix/Linly-Talker-Stream(README 原文:"On top of Linly-Talker's multimodal pipeline (ASR / LLM / TTS / Avatar), this project references [LiveTalking] … and performs a streaming pipeline refactor. Continuous optimization is planned.")。
- 判断:主仓 Linly-Talker 2026 年处于「低速/停滞维护」,实时迭代重心在 Linly-Talker-Stream。
SadTalker / Wav2Lip 是否仍是默认后端(2026)
- README 功能清单仍在:"Talker模型多选择:Wav2Lip / Wav2Lipv2 / SadTalker / ERNeRF / MuseTalk / Coming Soon"(中英双语均在);checkpoints 结构仍为
SadTalker_V0.0.2_256.safetensors、wav2lip.pth、wav2lip_gan.pth → SadTalker/Wav2Lip 仍是内置后端(未移除)。
- 但「默认」已不是 SadTalker:README 更新原文 "改进的WebUI在默认设置下不加载 LLM 模型,以减少显存使用";且 "加入了 MuseTalk 的方式…速度基本能够达到实时的要求,MuseTalk 已加入在 WebUI 中" → 2026 年 WebUI 里承担"实时对话"的是 MuseTalk,SadTalker/Wav2Lip 退化为离线/口播生成档。此判定基于 README 描述(作者声明),未逐行核验代码默认值。
(c) VRAM:训练 vs 推理
- 官方 README 未给出任何显存数字(训练或推理均无)→ 官方口径:未查到。
- 【第三方博客】 CSDN《Linly-Talker对显卡配置的要求及性价比推荐》给出模块级显存表(以 FP16 为例)及其结论,逐字摘录:
- "大语言模型(LLM) Llama-3-8B(INT4量化) ~6–8 GB | 若未量化,FP16 下需约 16GB;上下文越长,KV Cache 越大"
- "语音合成(TTS) VITS / YourTTS ~2–4 GB"
- "语音识别 Whisper-tiny / base ~1–2 GB"
- "哪怕是最轻量化的组合(INT4量化LLM + TTS + Wav2Lip),总显存需求也轻松突破 10GB"
- "因此,12GB 显存应被视为当前运行 Linly-Talker 的最低推荐门槛"
- 来源:blog.csdn.net/weixin_42561464/article/details/156119020
- ⚠️ 可信度提示:该 CSDN 文风格接近 AI 生成的长文,无 nvidia-smi 截图,数字为「模块估算求和」而非实测 → 标注为【第三方估算】,不可当实测引用。
- 训练显存:README 全文未给出训练 VRAM(ER-NeRF 段仅说明 "ER-NeRF是针对单独一个人的视频进行训练的,所以需要替换特定的模型才能进行渲染")→ 训练显存:未查到。
- 上游引用:README 转录 MuseTalk 官方声明 "能够以 30帧每秒以上 的速度在 NVIDIA Tesla V100 显卡上运行" → 可作 (d) 的参考锚点。
(d) 端到端延迟 / FPS
- 主仓:无端到端延迟数字。可引用:MuseTalk 在 V100 上 >30 FPS(作者转述上游);"速度基本能够达到实时的要求"(作者声明,无具体 ms)。
- Linly-Talker-Stream(分仓):README 原文 "⚡ Low-latency transport: real-time audio/video transmission via WebRTC"、"WebRTC real-time streaming playback with low latency in browsers" → 只给了定性「低延迟」,未给具体 ms 数字(未查到)。
- 首帧延迟:两个仓库均未给出,未查到。
(e) 流式 / 可打断
- 主仓:Gradio 轮次式;README 自述 "若考虑实时对话,可能需要换个框架,或者对 Gradio 进行魔改" → 主仓非流式。
- Linly-Talker-Stream:"Barge-in and interruption support: more natural conversational rhythm"、"full-duplex conversation experience" → 支持打断(barge-in)+ 全双工(分仓能力)。
(f) 中文支持 / 半身-全身
- 中文:原生中文项目(中文 README 为一等公民);ASR 集成阿里 FunASR/OmniSenseVoice,TTS 用 CosyVoice(README:"支持中文、英语、日语、粤语和韩语等多种语言的语音合成")→ 中文支持强。
- 半身/全身:无半身/全身支持。SadTalker/Wav2Lip/ER-NeRF/MuseTalk 均为头肩/上半身肖像口型驱动;README 无全身声明 → 全身:未查到/不支持。
(g) 已知坑
- 维护停滞(最大风险):主仓 7 个月无提交,2026 年的 CUDA/torch 生态演进(sm_120)基本不会得到官方适配。
- 依赖版本陈旧:项目基于 2024–2025 技术栈(SadTalker 2023 / Wav2Lip 2020 / CosyVoice 早期档),README 未声明 CUDA 版本要求 → sm_120/Blackwell 兼容性:官方零说明,未查到;实际部署需自行把 torch 升到 cu128/cu130。
- WebUI 默认不加载 LLM(作者声明,为省显存)→ 若误以为"默认就是完整对话链路",会得到"只回文本"的行为。
- 模型分散:checkpoints 需从 HuggingFace / ModelScope / 百度网盘分别下载(README 提示百度网盘默认命名
sadtalker 需重命名为 checkpoints),国内下载易中断。
4. xszyou/Fay
| 项 | 值 |
| Stars | 13,545(2026-09-22 HTML) |
| 最后提交 | 2026-09-21T08:56:28Z(commits/main.atom)→ 极活跃(核实前 1 天仍有提交) |
| 许可证 | GPL-3.0(LICENSE 首行原文:"GNU GENERAL PUBLIC LICENSE / Version 3, 29 June 2007") |
它到底是什么(定位)
README 原文(逐字):
"我们致力于思考面向终端的数字人落地应用…Fay数字人框架,向上适配各种数字人模型技术,向下接入各式大语言模型,并且便于更换诸如 TTS、ASR 等模型,为单片机、app、网站提供全面的数字人应用接口。"
"完全开源,商用免责"、"支持全离线使用"、"全时流式的支持"、"自由匹配数字人模型、大语言模型(openai 兼容接口)、ASR、TTS模型"、"支持数字人自动播报模式(虚拟教师、虚拟主播、新闻播报)"、"支持任意终端使用:单片机、app、网站、大屏、三方业务系统接入"、"支持多用户多路并发"、"支持唤醒及打断对话"、"支持机器人表情输出"、"支持 agent 自主决策工具调用"、"支持 MCP 工具管理(sse、studio)"。
结论:Fay 是「agent 框架 + 数字人连接器」,不自己渲染画面。 它把「数字人模型」当作可插拔外设,README 的「使用数字人(非必须)」一节标题本身就写明 非必须。
数字人连接器(ue5 / metahuman / xuniren)
- README 正文未列出具体连接器名称,只给出飞书文档链接「使用数字人(非必须)」;但功能描述覆盖 2.5d、3d、移动、pc、网页 数字人(GitHub 仓库
<meta description> 原文:"fay是一个帮助数字人(2.5d、3d、移动、pc、网页)或大语言模型(openai兼容、deepseek)连通业务系统的 agent 框架")。
- 生态侧可核实的 UE 通道:
xszyou/fay-ue5 独立仓库存在(搜索结果含 raw.githubusercontent.com/xszyou/fay-ue5)。
- xuniren / metahuman 的官方名称级证据:本次未直接抓到原文,未查到(README 只给飞书 wiki 跳转,飞书内容未抓取)。
(c) 实际需要什么 GPU
- 官方 README 全文无 GPU/显存要求(环境段仅写:"Python 3.12"、"Windows、macos、ubuntu"、"注:ubuntu需要先安装gcc及portaudio")→ Fay 本体不需要 GPU。
- GPU 取决于你外挂的模型:ASR/TTS/LLM 若走云端 API(README 快速启动用「公共资源」即云端 key),0 显存;若外挂本地 FunASR/CosyVoice/TTS-GPU + 本地 LLM,才占显存。
- 官方镜像(第三方云平台 Compshare)页面可核实信息:镜像名 "数字人 Fay数字人-3.1.1"、"Fay数字人3.1.1最小可运行版"、"镜像大小 40 GB"、"当前版本 v1.12"、"累计部署 255 次"、"最近更新 2025-12-05"、暴露端口 "JupyterLab: 8888 / 自定义开放端口 5000",CUDA 版本栏为空(页面 "CUDA版本 -")→ 来源:compshare.cn/images/compshareImage-1cft3sk9gvta。
- 16GB 单卡结论:Fay 本体无 GPU 需求;搭配 3D 数字人客户端(UE5/MetaHuman 等,在另一台带 GPU 的机器或同机渲染)时,显存取决于该客户端与本地 ASR/TTS/LLM 的组合,Fay 官方未给任何数字,未查到。
(d) 端到端延迟 / FPS
- 官方无任何毫秒/FPS 数字(未查到);仅定性声明 "全时流式的支持"、"支持唤醒及打断对话" → 属流式设计,但无实测指标。
(e) 流式 / 可打断
- 支持:README 明确 "全时流式的支持" + "支持唤醒及打断对话"。这是其相对 LivePortrait / Linly-Talker 主仓的显著优势。
(f) 中文支持 / 半身-全身
- 中文:原生中文项目(作者中文团队,交流群/公众号「fay数字人」),ASR 集成 FunASR(README 致谢:"FunASR - 提供语音识别(ASR)能力")→ 中文强。
- 半身/全身:由外挂数字人决定。README 定位涵盖 2.5D 与 3D,3D 侧可通过 UE 连接器实现全身;Fay 自身不含渲染,半身/全身 = 你所接的数字人模型的能力(有 3D 通道,但具体全身支持未在官方原文确认,未查到)。
(g) 已知坑
- GPL-3.0 许可证 = 商用传染性风险(重点):README 自称 "完全开源,商用免责",但
LICENSE 实为 GPL-3.0。GPL-3.0 的传染性(copyleft)意味着:若你将 Fay 与其代码结合分发(或按其解释提供网络服务),衍生作品需以 GPL 兼容方式开源;「商用免责」是作者的口头承诺,不是许可证授予的额外权利。商业闭源集成前必须做法律评估,或仅以独立进程/API 方式调用并评估 AGPL/GPL 边界(GPL-3.0 非 AGPL,SaaS 场景不触发网络条款,这点优于 AGPL;但分发二进制仍受限)。
- 依赖/环境:Ubuntu 需
build-essential + portaudio19-dev;Python 3.12。
- sm_120/Blackwell:Fay 本体纯 Python 编排层,只要外挂组件不编译 CUDA 算子就不受 sm_120 影响 → 相对风险最低的一个。
- 配置门槛:快速启动需从
system.conf.bak 生成 system.conf 并填 API key;默认公共资源"速度非常慢"(作者自述)。
5. modstart-lib/aigcpanel
| 项 | 值 |
| Stars | 5,574(2026-09-22 HTML) |
| 最后提交 | 2026-09-18T04:46:10Z(commits/main.atom)→ 活跃 |
| 许可证 | Apache-2.0(LICENSE 首行:"Apache License / Version 2.0, January 2004") |
| 技术栈 | README badge 原文:"Framework-TS+Vue3+Electron" |
它到底是什么(重点结论)
是一个 Electron 桌面客户端 + 模型管理器,它既"调用引擎"也"自己拉本地引擎跑"。 官方 README 原文(逐字):
"AIGCPanel 是一款简单易用的一站式 AI 数字人桌面应用,支持 Windows / macOS / Linux 三平台。" "软件内置模型市场,支持一键下载启动包,开箱即用;同时兼容远程 API 模型。" "数字人合成:基于多种开源口型同步模型(MuseTalk / LatentSync / Wav2Lip / Heygem),将任意音频与人物视频精准对齐" "AI 模型管理:本地模型一键导入、启动/停止、日志查看、参数配置;支持远程 API 模型接入;云端 AI 模型服务(无需本地显卡)(VIP)"
→ 即:前端/面板是 Electron 壳,真正推理是外挂的「模型启动包」(本地,含 MuseTalk/LatentSync/Wav2Lip/Heygem 等)或云端 API。 它不是自研渲染引擎,而是引擎的集成商 + 本地运行时管理器。
(c) 是否需要 GPU / 显存要求
官方文档给出了最清晰的答案(aigcpanel.com/zh/document/74,逐字原文):
"界面软件本身对硬件无特殊要求,普通电脑/笔记本即可运行。AI 模型运行需要依赖 专业显卡 GPU。如果没有 NVIDIA 显卡,可以使用 AI 云模型 服务,无需本地显卡即可使用全部功能(云模型按使用量计费)。" "目前我们提供的模型大部分基于 NVIDIA CUDA 框架,如需本地运行,务必准备 NVIDIA 显卡。"
同页还给出「怎么查看电脑是什么显卡」:"Windows 系统 Ctrl+Shift+Esc 打开任务管理器 → 性能 → GPU,「专用 GPU 内存」即为真实显存。"
- 面板本体显存需求 = 0(只需普通电脑)。
- 本地跑模型时才需要 NVIDIA GPU;具体 GB 数(各模型逐一显存要求):官方文档未给出,未查到。
- 16GB 单卡结论:16GB 足够(面板本身不吃显存;其集成的 MuseTalk/LatentSync/Wav2Lip/Heygem 档位中,MuseTalk/LatentSync 属较轻量级口型模型,Heygem 较重);但"是否一定跑得动"无官方数字支撑 → 未查到,需实机验证。
(d) 端到端延迟 / FPS
- 未查到:aigcpanel 定位为离线视频合成工具("一键生成换口型数字人视频"),README 与文档均未给出延迟或 FPS 指标。其"智能直播(VIP)"支持抖音/哔哩哔哩/虎牙/斗鱼/快手弹幕实时监控,但未声明直播画面的实时数字人渲染延迟。
(e) 流式 / 可打断
- 未查到流式/打断能力声明。核心交互是任务式(提交→生成→下载):README "任务列表可批量下载"、"支持断点续跑、节点级状态追踪、运行历史查看"(工作流 VIP 功能)。→ 更接近批处理/半自动,非双工实时对话。
(f) 中文支持 / 半身-全身
- 中文:原生中文产品(全中文 UI/文档,备案号 "陕ICP备20000530号-12"),TTS/ASR 均含中文模型 → 中文强。
- 半身/全身:口型同步基于用户上传的人物视频(README:"上传形象视频,输入文本或音频,一键生成换口型数字人视频")→ 画面范围完全取决于你上传的素材,理论上半身/全身都可以(只要视频是全身);官方无专门"半身/全身"功能声明,未查到。支持绿幕视频形象与形象模板管理。
- 额外:25+ 音视频工具箱(文生图/图生图、字幕、变速、压缩、FFmpeg 自定义等)与内置模型市场(一键下载启动包)。
(g) 已知坑
- sm_120/Blackwell:官方未声明 CUDA/torch 版本要求(未查到);由于它把引擎打包为"模型启动包"(可能内置预编译的 torch/ONNX),Blackwell 上是否开箱可用取决于各启动包内的 torch/onnxruntime 是否含 sm_120 kernel → 属于不可控的打包风险,建议逐个模型包实测。
- 闭源打包:模型启动包体积大、更新依赖官方分发;本地模型依赖其"模型市场"的版本节奏。
- 「云端 AI 模型服务」是 VIP 付费项(按使用量计费),免费路径需本地 NVIDIA 显卡。
- 许可证 Apache-2.0(商用友好,无 GPL 传染问题)——但注意:其集成的 MuseTalk/Wav2Lip/LatentSync/Heygem 各自的许可证与商用条款需单独核查(aigcpanel 的 Apache-2.0 不覆盖第三方模型的权重许可)。
横评速查(16GB / sm_120 视角)
| 仓库 | 性质 | VRAM 关键数字 | 16GB 单卡 | 延迟/FPS | 流式·打断 | 中文 | sm_120 风险 |
| LivePortrait | 视频驱动肖像动画(非 lip-sync) | 权重 ≈0.5GB(官方 speed.md 合计 499.6MB);第三方称 6GB VRAM 起 | ✅ 富余 | ≈67.7 FPS(4090+torch.compile,单帧 14.77ms);首帧含 ~1min 编译 | ❌ 官方无(第三方有实时分支) | 语言无关 | 🔴 高(onnxruntime-gpu==1.18.0 无 sm_120;ORT #27621 Blackwell 死锁;X-Pose 需自编译 op;torch 示例仅到 cu121) |
| OpenAvatarChat | 全链路实时对话(ASR+LLM+TTS+Avatar) | LAM 2–3GB / Qwen-Omni 2–3GB / openai_compatible 8–10GB / MiniCPM 20GB+(int4 10GB);系统级 min 10GB / rec 20GB+ | ✅ 除 MiniCPM 全本地外均可 | 平均响应 2.2s(官方);输出典型 25fps | ✅✅ 0.6.0 起全后端手动+双工打断 | ✅ 强(SenseVoice+CosyVoice+百炼) | 🟡 中(文档要求 CUDA≥12.8 利 Blackwell,但钉 torch 2.4.1/cu124、flash-attn 需源码编译) |
| Linly-Talker | 多后端对话数字人(SadTalker/Wav2Lip/MuseTalk) | 官方未给数;第三方博客估 ≥12GB 为门槛(LLM int4 6–8GB + TTS 2–4GB + ASR 1–2GB) | ⚠️ 依赖组合,需实测 | MuseTalk V100 >30FPS(转述上游);Stream 版仅定性"低延迟" | ⚠️ 主仓否;Linly-Talker-Stream 支持 barge-in 全双工 | ✅ 强 | 🔴 高(主仓 2026-02 后停更,无 2026 适配) |
| Fay | agent 框架 + 数字人连接器(不渲染) | 本体 0 GPU;显存取决于外挂模型 | ✅ 本体无需求 | 官方无数字(未查到) | ✅ 全时流式 + 支持打断 | ✅ 原生中文 | 🟢 低(纯编排层) |
| aigcpanel | Electron 桌面面板 + 本地模型启动包/云 API | 面板 0;本地模型需 NVIDIA GPU,具体 GB 未公布 | ✅ 面板无需求,模型包需实测 | 未查到(离线任务式) | ❌ 未查到(任务式批处理) | ✅ 原生中文 | 🟡 未知(打包内 torch/ORT 版本不透明) |
第二轮核实补充:实测 / 官方量化的显存与 FPS 数字(2026-09-22 补录)
抓取通道变更(重要):本轮 raw.githubusercontent.com 在本机 IP 开始整体超时(curl exit 28 / code=000),改用 jsDelivr 镜像 https://cdn.jsdelivr.net/gh/<owner>/<repo>@<branch>/<path> 成功获取全部 README;GitHub REST API 持续限流未使用;星标与许可证经 shields.io 复核。
A1. OpenAvatarChat —— 第三方实测 3.1GB / 5.3GB(附实测截图)
来源:53AI 转载《低显存福音!OpenAvatarChat开源!实测仅需4G显存即可畅玩多模态数字人!》(2025-06-16,作者「AI与喵部署日记」,阅读 7846)逐字原文:
- 部署方案:"本教程将采用硬件需求最低的部署方案:SenseVoice + LLM API + CosyVoice API 的方式运行 LAM 或 LiteAvatar 数字人。显存占用最低仅有3G!"
- 实测环境与方法:"在搭载 RTX3060 6G 的笔记本电脑上运行测试 运行 LAM数字人,仅占用 3.1G 显存!对话流畅,性能相当强悍!实测图如下:"
- "运行 LiteAvatar数字人,也仅需 5.3G 显存!实测图如下:"
- 系统依赖:"• N卡4G以上显存 • N卡支持 CUDA >= 12.4 • ffmpeg • miniconda 或 Anaconda • 阿里云百炼API KEY( 可白嫖 )"
- 【第三方实测,带实测截图;版本为 2025-06 的 0.4.x/0.5.x 时代,0.6.0 未复测】
- ⚠️ 两个口径差异必须写进报告:① 该实测 LAM = 3.1GB,与 DeepWiki 旧版 README 表「LAM 2-3GB」量级一致;② 实测 LiteAvatar = 5.3GB,高于 DeepWiki 的 "LiteAvatar 3GB VRAM/session" → LiteAvatar 实际比 LAM 更吃显存(因 LiteAvatar 需额外跑渲染/视频编码链路)。建议报告以「LAM ≈3GB、LiteAvatar ≈5–6GB」表述,并注明口径来源。
A2. MuseTalk(Linly-Talker 与 aigcpanel 的共同上游后端)—— 官方实测推理显存 + 官方训练显存表
来源:MuseTalk 官方 README(TMElyralab/MuseTalk)逐字:
- 推理最低配置(官方实测):"For minimum hardware requirements, we tested the system on a Windows environment using an NVIDIA GeForce RTX 3050 Ti Laptop GPU with 4GB VRAM. In fp16 mode, generating an 8-second video takes approximately 5 minutes." → 推理最低 4GB VRAM;4GB 笔记本卡上 8 秒视频 ≈ 5 分钟(RTF ≈ 37.5×,非实时)。
- 实时档(官方声明):"supports real-time inference with 30fps+ on an NVIDIA Tesla V100";另注 "we recommend using input videos with 25fps, which is the same fps used during model training"。
- fp16 权衡:"You can remove
--use_float16 for better quality, but it will increase VRAM usage and inference time"。
- 训练显存(官方在「a machine with 8 NVIDIA H20 GPUs」上实测的每卡数字,逐字表格):
| 阶段 | Batch Size | 梯度累积 | 每卡显存 | 官方推荐 |
| Stage 1 | 8 | 1 | ~32GB | |
| Stage 1 | 16 | 1 | ~45GB | |
| Stage 1 | 32 | 1 | ~74GB | ✓ |
| Stage 2 | 1 | 8 | ~54GB | |
| Stage 2 | 2 | 2 | ~80GB | |
| Stage 2 | 2 | 8 | ~85GB | ✓ |
→ 结论(回答 Linly-Talker 的「训练 vs 推理显存」):MuseTalk 微调在 16GB 单卡上完全不可行(最低档 Stage1 bs=8 也要 ~32GB/卡);16GB 只能跑 fp16 推理。这条官方数字可代答 Linly-Talker 与 aigcpanel 的 MuseTalk 后端显存问题。
A3. LivePortrait —— 实时化分支的真实数字(TensorRT)
来源:warmshao/FasterLivePortrait README 逐字:
"Achieved real-time running of LivePortrait on RTX 3090 GPU using TensorRT, reaching speeds of 30+ FPS. This is the speed for rendering a single frame, including pre- and post-processing, not just the model inference speed."
→ 与官方 speed.md(RTX 4090 + torch.compile,纯推理 ≈67.7 FPS / 14.77ms)形成互补:官方原生路径在 4090 上单帧推理更快,而 3090 + TensorRT 已能做到含前后处理的 30+ FPS 全流程实时。该分支还支持相机实时输入(--realtime、camera.bat)→ LivePortrait 生态具备实时能力,但来自社区改造,非官方。
该分支暴露的 LivePortrait 依赖地狱(对 sm_120 极关键,逐字):
- "Install TensorRT 8.x (versions >=10.x are not compatible)" → TensorRT ≥10 不兼容;
- "Install the grid_sample TensorRT plugin, as the model uses grid sample that requires 5D input, which is not supported by the native grid_sample operator" → 须自编译 TRT 插件;
- "The latest onnxruntime-gpu still doesn't support grid_sample cuda, but I found a branch that supports it" → 须从
microsoft/onnxruntime 的 liqun/ImageDecoder-cuda 分支源码编译出 onnxruntime_gpu-1.17.0-cp310-cp310-linux_x86_64.whl。 → 结论:LivePortrait 在 CUDA 13.2 / 驱动 610 / sm_120 上几乎必然踩坑(ORT 1.17/1.18 无 sm_120 kernel + TRT 必须 8.x 而 610 驱动时代主流是 TRT 10.x + 需自定义 CUDA 插件与 ORT 源码编译)。
A4. aigcpanel —— 官方「模型市场」逐包 GPU 门槛(本轮最硬证据,直接回答问题)
来源:aigcpanel 官方模型市场页(?tag=视频换口型,页面自述「共 12 个资源」)。每个模型一键运行包逐字标注了 GPU / 内存门槛:
| 模型一键运行包 | 价格 | GPU 要求 | 内存 | 50 系(Blackwell)标注 | 备注(页面原文/日期) |
| Wav2Lip | 免费 | GPU 4G+ | 8G+ | — | 2026-08-24,Win-x86 / OSX-ARM64 / Linux-x86 |
| SadTalker | 免费 | GPU 4G+ | 8G+ | — | "GPU 4G+ 即可运行";暂未发布 |
| MuseTalk | 免费 | GPU 6G+ | 16G+ | ✅ 支持50显卡 | 2026-09-16 v1.3.0;"V100 上 30fps+ 实时推理,支持多语言" |
| Wav2Lip384(优化版) | VIP/SVIP | GPU 8G+ | 16G+ | — | 2026-08-22 |
| Heygem-v2(优化版) | VIP | GPU 8G+ | 16G+ | ✅ | 2026-08-22;硅基智能 v2 |
| LatentSync | 免费 | GPU 8G+ | 16G+ | — | 2026-07-27 v1.1.1 |
| LatentSync15(ComfyUI 工作流) | 免费 | GPU 8G+ | 16G+ | ✅ | "纯 PyTorch,支持 CUDA / MPS / CPU"؛ 暂未发布 |
| SoulX-FlashHead Lite(1.3B) | 免费 | GPU 8G+ | 16G+ | ✅ | "消费级 GPU 可达 96 FPS 实时推理";暂未发布 |
| LivePortrait | 免费 | GPU 8G+ | 16G+ | ✅ | "输入人像图片和驱动视频…支持视频/图片双驱动模式";暂未发布 |
| LatentSync 数字人对口型(ComfyUI 一键运行包) | 免费 | GPU 16G+ | 16G+ | — | 2026-09-02 |
| Heygem(优化版) | VIP/SVIP | GPU 16G+ | 16G+ | — | 2026-07-28 |
| FlashTalk(SoulX-FlashTalk-14B) | 免费 | GPU 24G+ | 32G+ | ✅ | "支持无限长流式生成";暂未发布 |
- 另一条官方数字:LatentSync 介绍文案 "大幅降低训练显存至 20GB,消费级显卡即可实现音频驱动视频精准对口型"。
- 对 RTX 5060 Ti 16GB 的直接结论:12 个口型包中 11 个官方门槛 ≤16GB(4G×2、6G×1、8G×6、16G×2),唯一超限的是 FlashTalk 14B(24G+ / 内存 32G+);且 6 个包明确标注「支持50显卡」= Blackwell 可用(MuseTalk / LatentSync15 / SoulX-FlashHead Lite / LivePortrait / Heygem-v2 / FlashTalk)。
- 关键澄清:这印证了官方文档口径——aigcpanel 面板本体不需要 GPU(0 显存),GPU 需求完全由所选模型启动包决定;它确实本地跑引擎(一键运行包),不只是"调用别的引擎"。
- 延迟口径:官方页面对 FPS 的唯一数字是 SoulX-FlashHead Lite「96 FPS 实时推理」(且该包"暂未发布");其余包均未标延迟 → aigcpanel 层面仍无端到端延迟实测,未查到。
A5. 仍未查到的项(诚实标注,未编造)
- Linly-Talker 官方/实测显存:仍只有 CSDN 第三方「模块估算」文章(AI 生成风格、无实测截图)。可用 A2 的官方 MuseTalk 数字代答其 MuseTalk 后端:推理 fp16 最低 4GB;训练 ~32–85GB/卡。主仓帧率/端到端延迟:未查到。
- Fay 的显存实测:未查到。Fay 本体不渲染、官方无 GPU 要求,其显存 100% 取决于外挂的 ASR/TTS/LLM 与数字人客户端,社区无统一口径实测。
- LivePortrait 官方 nvidia-smi 实测:未查到。可用证据三条(口径不同):官方权重 ≈499.6MB(
speed.md)/aigcpanel 官方包标 GPU 8G+/第三方 pinokio 标 6GB VRAM → 报告建议取 8GB 作为保守门槛。
- HeyGem 显存:仅有 CSDN 上大量 AI 生成的 SEO 文章(如《NVIDIA GPU显存至少需要多少才能流畅运行HeyGem?》,该文明说是"经验性结论/估算"而非实测,并给出 720p 单任务 ≥6GB/推荐 ≥8GB、1080p ≥8GB/推荐 ≥12GB、720p 批量 ≥10GB/推荐 ≥16GB)→ 【第三方估算,可信度低】,仅建议与 aigcpanel 官方标称的 Heygem-v2 GPU 8G+ / Heygem GPU 16G+ 交叉印证(两者量级一致)。
B. 许可证 / 星标 / 最后提交复核(shields.io + commits atom,2026-09-22)
| 仓库 | shields.io license | shields.io stars | 最后提交(<updated> 首个) |
| KlingAIResearch/LivePortrait | not identifiable by github | 19k | 2026-06-01T17:24:54Z |
| HumanAIGC-Engineering/OpenAvatarChat | Apache-2.0 | 3.8k | 2026-07-31T00:28:29Z |
| Kedreamix/Linly-Talker | MIT ✅(与父 agent 结论一致) | 3.5k | 2026-02-10T05:17:02Z |
| xszyou/Fay | GPL-3.0 | 14k | 2026-09-21T08:56:28Z |
| modstart-lib/aigcpanel | Apache-2.0 | 5.6k | 2026-09-18T04:46:10Z |
注:LivePortrait 的 shields 显示 "not identifiable by github" 本身就是「MIT 主体 + InsightFace 模型非商用附注」这一混合许可证的机器可读证据(GitHub 无法归类为纯 MIT)。
C. 横评表修订(据本轮实测证据)
| 仓库 | 原判 | 本轮修订 |
| OpenAvatarChat | LAM 2–3GB(旧 README) | LAM 实测 3.1GB;LiteAvatar 实测 5.3GB(RTX 3060 6G 笔记本,第三方实测带图)→ 16GB 单卡余量充足 |
| LivePortrait | 显存未知 | 保守门槛 8GB(aigcpanel 官方标称);实时档 RTX 3090 + TensorRT 30+ FPS(第三方实测声明);官方 4090 纯推理 67.7 FPS |
| Linly-Talker | 显存未知 | MuseTalk 后端官方实测:推理 fp16 最低 4GB、训练 32–85GB/卡;主仓自身仍无数字 |
| aigcpanel | 面板 0 显存、模型 GB 未公布 | 官方逐包门槛已公布(4G/6G/8G/16G/24G);11/12 个包 ≤16GB;6 个包标「支持50显卡」;SoulX-FlashHead Lite 标称 96 FPS |
| Fay | 本体 0 显存 | 维持不变;实测数字仍缺失(未查到) |
来源清单
官方来源(作者声明)
- LivePortrait LICENSE(MIT + InsightFace 非商用附注)— https://raw.githubusercontent.com/KlingAIResearch/LivePortrait/main/LICENSE
- LivePortrait readme.md(小写文件名)— https://raw.githubusercontent.com/KlingAIResearch/LivePortrait/main/readme.md
- LivePortrait 官方速度基准 speed.md — https://cdn.jsdelivr.net/gh/KlingAIResearch/LivePortrait@main/assets/docs/speed.md (仓库路径 https://github.com/KlingAIResearch/LivePortrait/blob/main/assets/docs/speed.md)
- LivePortrait 提交历史(最后提交 2026-06-01)— https://github.com/KlingAIResearch/LivePortrait/commits/main.atom
- LivePortrait 依赖清单(
onnxruntime-gpu==1.18.0)— https://raw.githubusercontent.com/KlingAIResearch/LivePortrait/main/requirements.txt
- LivePortrait 仓库页(19,084 stars,重定向自 KwaiVGI)— https://github.com/KlingAIResearch/LivePortrait
- OpenAvatarChat README — https://raw.githubusercontent.com/HumanAIGC-Engineering/OpenAvatarChat/main/README.md
- OpenAvatarChat 快速开始(CUDA ≥12.8 / flash-attn 编译)— https://humanaigc-engineering.github.io/OpenAvatarChat/getting-started/
- OpenAvatarChat 提交历史(最后提交 2026-07-31)— https://github.com/HumanAIGC-Engineering/OpenAvatarChat/commits/main.atom
- OpenAvatarChat 仓库页(3,773 stars)— https://github.com/HumanAIGC-Engineering/OpenAvatarChat
- Linly-Talker README(中/英)— https://raw.githubusercontent.com/Kedreamix/Linly-Talker/main/README.md | https://raw.githubusercontent.com/Kedreamix/Linly-Talker/main/README_zh.md
- Linly-Talker 提交历史(最后提交 2026-02-10)— https://github.com/Kedreamix/Linly-Talker/commits/main.atom
- Linly-Talker 仓库页(3,453 stars)— https://github.com/Kedreamix/Linly-Talker
- Linly-Talker-Stream README(WebRTC / barge-in)— https://raw.githubusercontent.com/Kedreamix/Linly-Talker-Stream/main/README.md
- Fay README — https://raw.githubusercontent.com/xszyou/Fay/master/README.md
- Fay LICENSE(GPL-3.0)— https://raw.githubusercontent.com/xszyou/Fay/master/LICENSE
- Fay 提交历史(最后提交 2026-09-21)— https://github.com/xszyou/Fay/commits/main.atom
- Fay 仓库页(13,545 stars)— https://github.com/xszyou/Fay
- fay-ue5(UE 数字人通道)— https://raw.githubusercontent.com/xszyou/fay-ue5/main/README.md
- aigcpanel README — https://raw.githubusercontent.com/modstart-lib/aigcpanel/main/README.md
- aigcpanel LICENSE(Apache-2.0)— https://raw.githubusercontent.com/modstart-lib/aigcpanel/main/LICENSE
- aigcpanel 提交历史(最后提交 2026-09-18)— https://github.com/modstart-lib/aigcpanel/commits/main.atom
- aigcpanel 官方文档《使用前需要了解的基础知识》(界面软件无硬件要求 / AI 模型需专业显卡 / 云模型无需本地显卡)— https://aigcpanel.com/zh/document/74
- aigcpanel 仓库页(5,574 stars)— https://github.com/modstart-lib/aigcpanel
第三方(实测/整理,非官方)
- DeepWiki「OpenAvatarChat / Getting Started」——显存表(minicpm 20GB+/int4 10GB、LAM 2-3GB、Qwen-Omni 2-3GB、openai_compatible 8-10GB)与系统要求(VRAM min 10GB / rec 20GB+、RAM 32GB+、CUDA 12.4+、torch 2.4.1)— https://deepwiki.com/HumanAIGC-Engineering/OpenAvatarChat/2-getting-started
- DeepWiki「OpenAvatarChat / System Requirements」— https://deepwiki.com/HumanAIGC-Engineering/OpenAvatarChat/2.1-system-requirements
- DeepWiki「OpenAvatarChat / Avatar Systems」——LiteAvatar "Low-Medium (3GB VRAM/session)"、MuseTalk "High"、输出典型 25fps — https://deepwiki.com/HumanAIGC-Engineering/OpenAvatarChat/6-avatar-systems
- DeepWiki「OpenAvatarChat / Configuration Examples」— https://deepwiki.com/HumanAIGC-Engineering/OpenAvatarChat/4.2-configuration-examples
- CSDN《Linly-Talker对显卡配置的要求及性价比推荐》——模块显存估表 + "12GB 为最低推荐门槛"(AI 生成风格,无实测截图)— https://blog.csdn.net/weixin_42561464/article/details/156119020
- Compshare 镜像页《Fay数字人-3.1.1》——镜像 40GB、累计部署 255、最近更新 2025-12-05、CUDA 版本栏为空 — https://www.compshare.cn/images/compshareImage-1cft3sk9gvta
- Lytanshade/LivePortrait-pinokio——"6GB VRAM ~8GB install"(第三方封装声明)— https://github.com/Lytanshade/LivePortrait-pinokio
- microsoft/onnxruntime issue #27621——"[CUDA EP] Silent deadlock ... on Blackwell GPU (RTX 5060, sm_120)" — https://github.com/microsoft/onnxruntime/issues/27621
- Natfii/onnxruntime-gpu-blackwell——"onnxruntime-gpu 1.24.1 with Blackwell sm_120 CUDA kernels" — https://github.com/Natfii/onnxruntime-gpu-blackwell
- OpenAvatarChat 官方 B 站教程(未逐帧核验)— https://www.bilibili.com/video/BV1sv8QzLEC2
第二轮新增来源(实测/官方量化数字)
- 53AI 转载《低显存福音!OpenAvatarChat开源!实测仅需4G显存即可畅玩多模态数字人!》—— RTX3060 6G 笔记本实测:LAM 3.1G / LiteAvatar 5.3G、N卡4G以上、CUDA≥12.4 — https://www.53ai.com/news/OpenSourceLLM/2025061631429
- MuseTalk 官方 README —— 推理实测最低 RTX 3050 Ti Laptop 4GB VRAM / fp16 下 8 秒视频约 5 分钟、V100 30fps+、训练每卡显存表(Stage1 32/45/74GB,Stage2 54/80/85GB,8×H20)— https://cdn.jsdelivr.net/gh/TMElyralab/MuseTalk@main/README.md
- FasterLivePortrait(warmshao)README —— RTX 3090 + TensorRT 实时 30+ FPS(含前后处理);TensorRT 8.x(≥10 不兼容)、需 grid_sample TRT 插件、需自编译
liqun/ImageDecoder-cuda 分支的 onnxruntime_gpu-1.17.0 — https://cdn.jsdelivr.net/gh/warmshao/FasterLivePortrait@master/README.md
- aigcpanel 官方模型市场(视频换口型,12 个资源)—— 逐包 GPU/内存门槛:Wav2Lip 4G+/8G+、SadTalker 4G+/8G+、MuseTalk 6G+/16G+(支持50显卡)、Wav2Lip384 8G+、Heygem-v2 8G+、LatentSync 8G+、LatentSync15 8G+、SoulX-FlashHead Lite 8G+(96 FPS 实时推理)、LivePortrait 8G+、LatentSync ComfyUI 16G+、Heygem 16G+、FlashTalk 24G+/32G+ — https://aigcpanel.com/zh/asset?tag=%E8%A7%86%E9%A2%91%E6%8D%A2%E5%8F%A3%E5%9E%8B
- shields.io 许可证/星标复核(LivePortrait
not identifiable by github、OAC Apache-2.0、Linly-Talker MIT、Fay GPL-3.0、aigcpanel Apache-2.0)— https://img.shields.io/github/license/<owner>/<repo>
- CSDN《NVIDIA GPU显存至少需要多少才能流畅运行HeyGem?》—— 720p 单任务 ≥6GB/推荐 ≥8GB、1080p ≥8GB/≥12GB、720p 批量 ≥10GB/≥16GB(作者自称"经验性结论"估算,非实测,AI 生成风格,可信度低)— https://blog.csdn.net/weixin_35903223/article/details/156559902
- CSDN《Linly-Talker支持哪些GPU型号?显存要求说明》— https://blog.csdn.net/weixin_42584507/article/details/156108152
- CSDN《Linly-Talker深度测评:开源数字人系统的性能边界在哪?》— https://blog.csdn.net/weixin_33239721/article/details/156104378
- CSDN《lite-avatar形象库部署教程:GPU显存仅需4GB即可运行的轻量级2D数字人方案》— https://blog.csdn.net/weixin_31860973/article/details/158077639
- gitcode《30分钟上手Fay数字人框架:从安装到部署全指南》— https://blog.gitcode.com/fc7c5060556b75882fdbc62e2d1a1902.html
- LivePortrait issue #76(直播/摄像头实时输入可行性讨论)— https://github.com/KlingAIResearch/LivePortrait/issues/76
- Lytanshade/LivePortrait-pinokio(第三方封装声明 "6GB VRAM ~8GB install")— https://github.com/Lytanshade/LivePortrait-pinokio
第二轮方法学备注:raw.githubusercontent.com 在本机 IP 本轮整体超时(curl exit 28),全部 README 改由 jsDelivr 镜像(https://cdn.jsdelivr.net/gh/<owner>/<repo>@<branch>/<path>)获取;GitHub REST API 全程限流未使用;最后提交时间取自 https://github.com/<owner>/<repo>/commits/main.atom。若需复现,请优先使用这两条不消耗 API 配额的通道。
无法核实项(未查到,未编造):LivePortrait 官方显存要求与首帧延迟(仅有 499.6MB 权重 + 第三方 6GB/8GB 门槛);OpenAvatarChat 首帧延迟(有 2.2s 平均响应,无首帧数字)与 MuseTalk 后端的 OAC 内实测 GB;Linly-Talker 自身官方训练/推理显存与帧率(其 MuseTalk 后端可用官方 4GB 推理 / 32–85GB 训练代答);Fay 官方任何延迟/FPS 与显存数字、xuniren/metahuman 连接器名称级原文;aigcpanel 端到端延迟(唯一 FPS 数字来自未发布的 SoulX-FlashHead Lite 包标称 96 FPS)。GitHub REST API 因限流(core remaining=0)未能执行 issue 关键词检索(sm_120/Blackwell/OOM/16GB),上述 sm_120 结论部分依赖依赖清单、官方文档与搜索结果推断,建议后续用带 token 的 API 补做 issue 检索验证。