3D数字人_一体化平台_授权风险.md

3D / 3DGS 数字人路线 + 一体化开源数字人平台 + 商用授权风险

调研时点:2026-09-22 目标用户画像:个人开发者,单张 RTX 5060 Ti 16GB(Blackwell sm_120)、32GB 内存、Ubuntu 调研方法:web_search 多轮 + web_fetch 打开 GitHub raw.githubusercontent.com LICENSE/README 原文、HuggingFace 模型卡 license 字段(经 hf-mirror.com,本机 HF 官方域名不可达)、HF/HF-mirror API 仓库时间线、CVF 开放获取论文页、中国政府/法院/地方监管原文。


0. 结论先行(TL;DR)

问题结论
个人开发者现在该不该走 3D/3DGS 数字人路线?不该当主线。 3DGS「说话头」开源工作几乎全数非商用许可(且叠加 FLAME/BFM 等本身非商用的基础模型),工程上又普遍锁 torch 1.12/1.13 + CUDA 11.x,在 sm_120 上等于重写。3D 只能作为「资产生产」与「单图零训练头像」两个单点使用。
3D 侧真正值得用的东西LAM(阿里通义,Apache-2.0,单图秒级生成可驱动 3DGS 头像,无神经网络驱动、WebGL 跨平台);TripoSG / TripoSR / TRELLIS v1(MIT,16GB 可跑,做 3D 资产)。
最推荐的 2 个一体化平台做口播视频 → AigcPanel(Apache-2.0,桌面 App + 模型市场一键包,中文一等公民);做实时对话 → OpenAvatarChat(Apache-2.0,全链路无「禁止商用」组件,LiteAvatar 路线仅需 4GB 显存,CUDA≥12.8 明确支持 Blackwell)。
许可证最需要注意的 3 条红线① Wav2Lip 权重严禁商用,而它被默认打包进 Linly-Talker / SadTalker / AigcPanel 的流程里——用默认配置就等于踩线;② Duix.Avatar(原 HeyGem)的 «DUIX.COM Community License» 是自定义协议,LICENSE 写 MAU>1000 即须商业授权(README 却写 10 万,二者冲突);③ 腾讯混元 3D/视频系「社区许可」排除欧盟/英国/韩国,且禁止用其输出改进其他模型。另有高优陷阱:LivePortrait 的 InsightFace 检测模型非商用、MiniMax M2.7 自称 "Modified-MIT" 实则 Non-Commercial。
⚠️ 2026 年新增风险趋势中国大厂许可证正在系统性收紧:Qwen3.8-Max 不再是 Apache-2.0(5000 万美元收入门槛)、MiniMax M2.7 从 MIT 转向非商用、Kimi K3 年收入 2000 万美元触发分成。必须把模型许可当作「版本化依赖」管理。

1. 硬件前提:RTX 5060 Ti 16GB / sm_120 是全篇最大的隐性成本

Blackwell 消费卡(sm_120)需要 CUDA ≥ 12.8 + PyTorch cu128 轮子。这直接影响所有 2024–2025 年的老仓库:

参考:graphdeco-inria/gaussian-splatting issue #1295「Is Blackwell (RTX 50 Series) Supported」、#1215(RTX 5090 + CUDA 12.8 安装记录)、microsoft/TRELLIS issue #243 / #343(5060 Ti 专用)、Dao-AILab/flash-attention issue #2168(无 sm_120 内核)。


2. 第一块:可驱动 3D 数字人 / 3DGS 头像

2.0 先纠错(用户清单里若干项与事实不符)

用户清单中的说法实际情况
GaussianHeadTalk(WACV 2026)论文确实存在(arXiv 2512.10939,WACV 2026,CVF 开放获取页),但 arXiv 页无 Code 链接,未检索到官方仓库 → 只能读论文,不能跑。
GaussianTalker 是 WACV实为 ACM MM 2024(arXiv 2404.16012),仓库 cvlab-kaist/GaussianTalker。
Mani-GS 是数字人gaoxiangjun/Mani-GS 是 CVPR 2025「Gaussian Splatting Manipulation with Triangular Mesh」——网格操控,与说话头无关。YuelangX/Mani-GS 不存在(404)。
Deformable-GS 是说话头ingra14m/Deformable-3D-Gaussians 是 CVPR 2024 动态场景重建,非说话头。说话头专用的是 AAAI 2025 "Hierarchically Controlled Deformable 3D Gaussians" 与 GSTalker(arXiv 2404.19040,无代码)。
HeadGaS 开源ECCV 2024 论文(arXiv 2312.02902)存在,但未找到官方开源仓库 → 判定「疑似未开源」。
Rodin 开源版不存在。Rodin / Hyper3D(Deemos)是闭源商业 API。
InstaINSTA(CVPR 2023,Zielon)是 instant-ngp 体积头像,不是 3DGS;520 star,push 2025-08-03;README 建议 RTX 3090 24GB + 32GB RAM,训练至少 1000 帧。
Splat-SLAM 类google-research/Splat-SLAM 确实开源(Apache-2.0),但 README 硬要求 CUDA 11.7 + pytorch 1.12 + cudatoolkit-dev,且自述 "not an officially endorsed Google product" → sm_120 不可行。

2.1 音频驱动 3DGS 说话头:对比表

项目年份/会议Star(2026-09-22)最近 push代码许可权重许可16GB 可行性素材需求实时中文资料
GaussianTalkerACM MM 20244172025-10-12仓库无 LICENSE 文件(Other)未确认;底层依赖 INRIA 3DGS显存够,但 torch==1.13.1+mmcv==1.6.0+TF2.8+py3.7 → sm_120 冲突3~5 分钟静态视频论文称实时有中文解读
TalkingGaussianECCV 20243872025-03-15无 LICENSE,README 写明 research only同需把数据 preload 进 RAM(每 5k 帧约 32GB RAM)→ 32GB 内存吃紧512²/25fps,1~5 分钟否有
Gaussian-Head-AvatarCVPR 20248712024-07-12清华非商用许可,明确禁止任何商业用途、禁止用于训练商用模型(最严)同24GB 级多视角/单目视频否有
GaussianAvatarsCVPR 2024 Highlight10612026-02-11CC-BY-NC-SA-4.0 + Toyota 禁止商用同24GB 级;需 VHAP FLAME 跟踪数据需配准网格否有(百度/CSDN)
SplattingAvatarCVPR 20245642026-07-15CC-BY-NC-SA 4.0(仅非商用)同3090 24GB;可 max_n_gauss 降显存单目视频 + FLAME/SMPL 注册渲染 >300FPS(3090)/30FPS(iPhone13)少
3DGS-AvatarCVPR 20244412024-09-10未确认未确认24GB 级单目否少
InsTaGCVPR 20251742025-07-15research only有预训练权重(含中文 trial 权重)CUDA11.3/11.7+torch1.12/1.13+TF2.10 → sm_120 冲突10 秒视频 few-shot否有
EmoTaGCVPR 202627(2026-03 建仓)2026-07-21research only有 checkpointCUDA 12.1,5 秒/125 帧适配,显存友好5s 适配 + HDTF/MEAD否少
SyncTalkCVPR 202416272025-09-18无严格 OSI 许可(含免责声明)有torch1.12.1+cu113+TF2.8.1 → sm_120 冲突4~5 分钟 25fps 512²否好:Windows 整合包 + 网盘 + Colab
NanoAvatar2026-09(极新)~152026-09-16MITCC BY-NC 4.0(权重禁商用)torch 2.10+cu128,Blackwell 友好,仅 700~834 MiB10 秒视频手机 39~41FPS,首帧 103ms,流式起播 ~0.3s有中文 README
INSTACVPR 20235202025-08-03instant-ngp 衍生(非商用)同README 建议 RTX 3090 24GB + 32GB RAM,训练至少 1000 帧视频序列snapshot 可在 8GB 笔记本渲染有
EmoZone-TalkerarXiv 2606.15848(2026)——arXiv only(无代码信息)未确认未确认未确认是无
EmbedTalkarXiv 2603.07604(2026)——arXiv CC BY 4.0(论文)未确认未确认未确认是无
FA-LAMarXiv 2607.20922(2026)——未确认(未见官方仓库)未确认未确认单图 one-shot是无
FlexAvatarCVPR 2026——未确认(未见官方仓库)未确认未确认单图/稀疏图,无需相机位姿与表情标签;10 秒微调实时形变无
GaussianHeadTalkWACV 2026无仓库—未确认未确认未确认单目视频 + 音频是无

2026 新论文来源:FlexAvatar (CVPR 2026) · Multi-view Consistent 3D Gaussian Head Avatars without Multi-view Generation (CVPR 2026)

一句话总结这一栏:能做 16GB 实时的是 NanoAvatar(权重禁商用)与 LAM(Apache-2.0,见下节);其余要么许可禁止商用,要么在 sm_120 上跑不起来,要么根本没有代码。

2.2 3D 资产 / 头像生成:对比表

项目Star最近 push许可16GB 可行性结论
LAM(阿里通义,SIGGRAPH 2025)—活跃(MeshLAM/CVPR 2026 续作)Apache-2.0 ✅单图推理,秒级,极低;驱动与渲染无神经网络,WebGL,手机 120FPS★ 本块唯一「许可干净 + 16GB 随便跑 + 真 3DGS」的组合
LAM-Audio2Expression—2025-05Apache-2.0 ✅实时音频→ARKit blendshape与 LAM + OpenAvatarChat 已打通端到端
LHM(阿里通义,ICCV 2025)—2026-03(LHM++ 开源)Apache-2.0 ✅LHM++ 8 视角输入仅需 8GB单图→可动人体,非头部专用
TripoSG17982025-04-18MIT(代码 + HF 权重均 MIT)✅README:最低 8GB VRAM → 16GB 轻松(只出形状,无纹理)★ 资产首选
TripoSR69682026-06-04MIT ✅低轻量单图→网格
TRELLIS v1136912026-06-26MIT ✅README 要求 ≥16GB(A100/A6000 验证)→ 正好卡下限;需 Blackwell 重建路径可跑但折腾
TRELLIS.2(microsoft/TRELLIS.2-4B)113102026-07-10MIT(代码 + 权重)✅ · HF 卡 license: mit官方要求 ≥24GB,仅验证 A100/H100 → 16GB 官方不支持(repo,arXiv 2512.14692)与 16GB 卡无缘(官方口径)
Step1X-3D8892025-09-08Apache-2.0 ✅README 表格:几何+纹理 27~29GB → 不可行16GB 不可行
Hunyuan3D 2.0149362025-10-28Tencent Hunyuan 3D 2.0 Community License(排 EU/UK/KR;>100 万 MAU 须申请;禁止用输出改进其他模型)README:形状 6GB / 形状+纹理合计 16GB卡边缘可跑
Hunyuan3D 2.140532025-10-17同族 2.1 版(同样排 EU/UK/KR)README:形状 10GB / 纹理 21GB / 合计 29GB;--low_vram_mode 只降到 21GB → 16GB 只能出白模,纹理阶段必 OOM半可用
Hunyuan3D-Omni—2025-09-23Tencent Hunyuan 社区许可(排 EU/UK/KR)HF 卡:10GB可跑
Hunyuan3D 2.5——从未开源权重,仅 arXiv 2506.16504 技术报告;腾讯云 API 提供且2026-09-22 停止新购、2026-10-20 全量下线(迁移至 HY-3D-3.1)—不可用
Hunyuan3D 3.0 / 3.1——闭源商业。3.0 于 2026-02-13 以 ComfyUI Partner Nodes(云 API) 上线;3.1 在腾讯云 TokenHub—不可用
Rodin / Hyper3D(Deemos)——闭源商业 API—无开放权重
RodinHD(微软+中科大 ECCV24)2142025-01-15未确认;训练数据因组织政策不公开V100 训练头像向,但闭数据
Pixal3D(SIGGRAPH 2026, TencentARC+清华)—2026未确认基于 TRELLIS.2 backbone → 24GB 级与 16GB 无缘
SAM 3D Objects74392026-06-02SAM License(允许使用/分发/衍生,未禁商用,但受出口管制/军事用途限制,非 OSI 标准)2026-06-01 放出 encoder 权重;可直接导出 gaussian splat可用但非标准开源
SAM 3D Body35472026-02-19SAM License单图人体网格可用于人体重建
MeshGPT 类————未检索到 2026 新开源进展 → 未确认

关键许可原文:Hunyuan3D-2.0 LICENSE · Hunyuan3D-2.1 LICENSE · HF 镜像同文:tencent/Hunyuan3D-2 · tencent/Hunyuan3D-2.1 · Hunyuan3D 3.0 上线 ComfyUI Partner Nodes:blog.comfy.org · Hunyuan3D 2.1 显存口径:Tencent Cloud techpedia · TripoSG README · TRELLIS README · LAM README · LAM LICENSE (Apache-2.0) · LHM README

「权重开放但禁商用」清单(3D 侧):Gaussian-Head-Avatar(清华,最严)、GaussianAvatars(Toyota, CC-BY-NC-SA)、SplattingAvatar(CC BY-NC-SA)、INSTA、TalkingGaussian / InsTaG / EmoTaG(research only)、NanoAvatar 权重(CC BY-NC 4.0)。外加所有 FLAME / BFM / SMPL 基础模型——它们本身就是非商用研究许可,是整条 3D 头像链的「上游污染源」。

真·可商用开源(3D 侧):LAM / LHM(Apache-2.0)、TripoSG、TripoSR、TRELLIS v1/v2(MIT)、Step1X-3D(Apache-2.0)、SAM 3D(SAM License,非 OSI)。 受限可商用:Hunyuan3D 2.x(排除 EU/UK/韩国 + 100 万 MAU 门槛 + 禁止用输出改进其他模型)。

2.3 3DGS 重建 / SLAM

项目Star最近 push许可16GB / sm_120
graphdeco-inria/gaussian-splatting(原版 3DGS)23940活跃INRIA 自定义(非商用)sm_120 有社区成功记录(issue #1215),但原版许可非商用
MonoGS(Gaussian Splatting SLAM, CVPR24 Highlight)21642024-08-07未确认RTX 4090 测试;dev.speedup 支达 10fps
Photo-SLAM(CVPR 2024)7682024-06-12未确认C++/CUDA,需 LibTorch ≤2.1.2 + 自行编译 OpenCV(with CUDA/contrib) → 构建门槛高
Splat-SLAM(google-research)3642025-01-05Apache-2.0 ✅硬要求 CUDA 11.7 + pytorch 1.12 → sm_120 不可行

手机视频 → 人物 3DGS 的实用流水线:① FLAME/SMPL-X 跟踪配准(VHAP / metrical-tracker,都要学术注册)→ ② 抠像(RobustVideoMatting / EasyPortrait)→ ③ 相机位姿预处理(IMavatar 式)→ ④ 训练 mesh-embedded 3DGS(GaussianAvatars / SplattingAvatar)。注意第 ① 步的 FLAME/BFM 许可即已堵死商用,第 ④ 步的仓库许可也基本全非商用。 移动端方向可参考 HoloMobile(单目视频→紧凑动态高斯)。

2.4 素材与训练量级(实测/仓库口径)

路线素材需求训练量级
Person-specific 3DGS 说话头(GaussianTalker / SyncTalk / TalkingGaussian)1~5 分钟 512²/25fps 单目视频GaussianTalker 10k 迭代;SyncTalk 60k + 100k finetune(各仓库统一小时数未确认)
Few-shot(InsTaG / EmoTaG)10 秒 / 5 秒(125 帧) 适配EmoTaG 适配 20k 迭代
单图 one-shot(LAM / FlexAvatar)1 张图(FlexAvatar 另有 10 秒精修)LAM 无需训练(前向一次);FlexAvatar 10 秒微调
中文综述口径「这类方法需要目标人物数分钟的音视频数据进行专属拟合优化」—

来源:《音频驱动的数字人技术进展》,《中国图象图形学报》2026 年第 31 卷第 7 期,PDF(原文:特定人优化模型「需要目标人物数分钟的音视频数据进行专属拟合优化」;3DGS 路线「核心挑战仍集中在动态一致性与可编辑性……容易出现高斯漂移、密度分布不稳定或局部撕裂」)

2.5 与实时驱动的结合点

3D 侧目前没有现成的「LLM + TTS + 3DGS 音频驱动」端到端开源方案——需要自己把音频驱动渲染接到流式 TTS 后面。

唯一的例外是阿里 LAM 生态,它已经打通:

  1. LAM(Apache-2.0)单图 → 可驱动 3D 高斯头像;
  2. LAM_Audio2Expression(Apache-2.0)音频 → ARKit blendshape 实时驱动;
  3. LAM_WebRender WebGL 跨平台渲染;
  4. 官方提供 Avatar Export 工具,直接导出成 OpenAvatarChat 可用的格式;
  5. OpenAvatarChat 内已有 WebGL Interactive Chatting Avatar SDK(LLM + ASR + TTS + Avatar 全链路)。

来源:LAM README 的 News 区块、LAM_Audio2Expression README、OpenAvatarChat

这是 2026 年唯一「个人开发者用 16GB 卡 + Apache-2.0 + 真 3DGS + 实时对话」能走通的路径。 其余 2D 路线(见第二块)开箱即用度更高。

2.6 明确判断:个人开发者现在该不该走 3D 路线?

答:不该当主线;只做两个单点。

不该当主线的 4 个理由:

  1. 许可证是硬墙(最致命)。3DGS 说话头几乎全数非商用(清华 Gaussian-Head-Avatar / GaussianAvatars / SplattingAvatar / TalkingGaussian / InsTaG / EmoTaG / INSTA),且都叠了 FLAME/BFM 这类同样非商用的基础模型。这意味着你就算把技术跑通,也不能商用——技术投入没有商业出口。
  2. 工程成本极高。sm_120 需要 cu128 + torch≥2.7 重建所有 CUDA 子模块,而这些说话头仓库普遍锁 torch 1.12/1.13 + TF 2.8 + CUDA 11.x + python 3.7 → 等于重写。数据链还要编译 OpenFace、申请 FLAME/BFM/SMPL、跑 VHAP/EasyPortrait。
  3. 2D 路线性价比碾压。EchoMimicV3(Apache-2.0,AAAI 2026)Flash 档 12GB 显存 / 8 步 / 768×768,16GB 完全可用,且有中文 wav2vec2 + 中文 FAQ + B站教程;OpenAvatarChat / AigcPanel / MuseTalk(MIT)/ LiveTalking 已把 LLM+TTS+口型打通。
  4. 3DGS 的固有缺陷:动态一致性差,易高斯漂移、局部撕裂;复杂表情(大幅度张口、牙齿与口腔内部显露)难稳定表达;极端光照或稀疏视角下细节缺失。

该做的两个单点(都是 Apache-2.0/MIT,都能在 16GB 上跑):

决策口诀:想出片/变现 → 走 2D(第二块);想做技术储备/差异化的 3D 形象 → 用 LAM + TripoSG;不要把时间投入到 person-specific 3DGS 说话头训练上。


3. 第二块:一体化开源数字人平台(拿来即用)

3.1 重要前置事实

HeyGem.ai = Duix.Avatar,是同一个仓库的新旧名。 github.com/GuijiAI/HeyGem.ai 现 301 跳转到 github.com/duixcom/Duix-Avatar(同一 repo id 907627874)。中文互联网上大量「HeyGem vs Duix」的对比文章都已过时。 核查方式:GuijiAI/HeyGem.ai 的 raw LICENSE 与 duixcom/Duix-Avatar LICENSE 内容一致,均为 «DUIX.COM COMMUNITY LICENSE AGREEMENT»。

3.2 对比总表

项目Star最近更新许可证可商用显存(16GB 卡)部署难度功能(口播/直播/实时对话/唇形/声克隆)中文资料推荐度
Duix.Avatar(原 HeyGem.ai)155472026-04-21(趋缓)DUIX.COM Community License(自定义,GitHub 标 NOASSERTION)⚠️ 有条件:LICENSE 写 MAU>1000 须商业授权;README 却写 10 万用户/1000 万美元营收 → 自相矛盾,以 LICENSE 为准官方推荐 RTX 4070 12GB;社区称 8GB 可用;镜像约 70GB + 磁盘 100GB★★☆☆☆ Docker Compose 一键(有 5090 专用 compose)✅✅ / ❌ / ❌ / ✅✅ / ✅✅极丰富⭐⭐⭐⭐
Duix Mobile(duix.ai)——DUIX.COM Community License⚠️ 有条件(MAU>1000)端侧(手机),不占 PC 显存★★☆☆☆ SDK 集成❌ / ❌ / ✅✅ / ✅ / ⚪中⭐⭐(仅移动端/车机)
Linly-Talker34532026-02-10MIT(但组件传染)⚠️ 代码可,权重不可(默认打包非商用 Wav2Lip)未确认(分模型)★★★★☆ 需编译 NeRF + pytorch3d✅ / ❌ / ✅ / ✅ / ✅极丰富⭐⭐⭐
Linly-Talker-Stream—2026-02Apache-2.0⚠️ 同上(仍用 Wav2Lip)未确认★★★☆☆ 一键 setup-env.sh❌ / ⚪ / ✅✅ / ✅ / ✅中⭐⭐⭐
Fay135452026-09-21(最活跃)GPL-3.0✅ 可(但传染性强)自身不占,由外接模型决定★★☆☆☆ pip 安装❌ / ✅✅ / ✅✅ / ⚪ / ⚪极丰富⭐⭐⭐⭐
OpenAvatarChat37732026-07-31Apache-2.0✅ 明确可(依赖 LiteAvatar=MIT、MuseTalk=MIT、FlashHead=Apache-2.0、CosyVoice=Apache-2.0)LiteAvatar 社区实测仅 4GB;MuseTalk ≥12GB★★☆☆☆ uv run install.py 一站式❌ / ⚪ / ✅✅✅(2.2s)/ ✅ / ✅很好⭐⭐⭐⭐⭐
AigcPanel55742026-09-18Apache-2.0(Pro/VIP 功能收费)✅ 软件可(所挂模型各自许可,含非商用 Wav2Lip)由所挂模型决定(Heygem 一键包 8GB)★☆☆☆☆ 桌面 App + 模型市场一键包✅✅ / ✅(VIP) / ❌ / ✅✅ / ✅✅极丰富⭐⭐⭐⭐⭐
SadTalker140982024-06-26(停更 2 年+)Apache-2.0 except 第三方(清单未列出,法律文本不完整)⚠️ 代码可;权重含非商用 Wav2Lip + s3fd未确认(偏低)★★★☆☆ 锁 Py3.8 + cu113,sm_120 不友好✅ / ❌ / ❌ / ✅ / ❌中上⭐⭐
EchoMimic V143002026-04-07Apache-2.0✅ 可V100 16G 可跑★★★☆☆✅ / ❌ / ❌ / ✅ / ❌好⭐⭐⭐
EchoMimic V246572026-02-23Apache-2.0✅ 可4090D 24G / V100 16G★★★☆☆✅ / ❌ / ❌ / ✅✅ / ❌好⭐⭐⭐⭐
EchoMimic V3 / Flash10612026-03-18Apache-2.0(README 声明;根目录无 LICENSE 文件)✅ 可("We claim no rights over your generated contents")preview 12GB / Flash 12GB、768×768 ✅★★★☆☆ Linux 脚本 / Windows 网盘一键包✅✅ / ❌ / ❌ / ✅✅✅ / ❌好⭐⭐⭐⭐⭐
MuseTalk66042025-09-26MIT(代码 + 权重)✅ 明确可(README:model "available for any purpose, even commercially")4GB 可跑 ✅✅★★★☆☆ 需 mmcv/mmpose + ffmpeg⚪ / ❌ / ✅(30fps+) / ✅✅ / ❌好⭐⭐⭐⭐
LatentSync60902025-06-20Apache-2.0✅(SD 系权重需另查)偏高,官方未给单卡数值 → 未确认★★★☆☆⚪ / ❌ / ❌ / ✅✅✅ / ❌中⭐⭐⭐
Wav2Lip—老项目自定义(无标准协议)❌ 明确禁止商用(README 双重声明,LRS2 训练)极低★★☆☆☆⚪ / ❌ / ❌ / ✅ / ❌多⭐(仅研究)
LivePortrait190842026-06-01MIT 但带保留⚠️ 必须替换 InsightFace 检测模型才可商用很低(1–2GB)✅★★☆☆☆⚪ / ❌ / ❌ / ⚪ / ❌多⭐⭐⭐
Sonic32742026-01-08CC-BY-NC-SA 4.0❌ 禁止商用中★★★☆☆✅ / ❌ / ❌ / ✅ / ❌少⭐
Hallo / Hallo2——MIT✅中★★★☆☆✅ / ❌ / ❌ / ✅ / ❌中⭐⭐⭐
OpenTalking(2026 新)30562026-09-04(2026-04 建仓)Apache-2.0✅quicktalk 在 3090 实测 ~3.8 GiB、~35fps ✅✅★★★☆☆ uv + Docker Compose❌ / ⚪ / ✅✅ / ✅ / ✅好(中文优先)⭐⭐⭐⭐⭐
SoulX-FlashHead(2026 新)10782026-05-28Apache-2.0✅Lite 单 4090 实时(96FPS/3 路) ✅;Pro 需双 5090 → 16GB 跑不动★★★☆☆ 需编译 flash-attn❌ / ⚪ / ✅✅ / ✅ / ❌中⭐⭐⭐⭐
LongCat-Video-Avatar 1.5(2026 新,美团)~46342026-05(1.5 版)MIT(repos LICENSE,Copyright (c) 2025 Meituan)✅ 可商用❌ 最低 2×A100 80G;INT8 量化仍需 ~40GB★★★★★✅✅ / ❌ / ❌ / ✅✅ / ❌中⭐⭐(16GB 不可行)
LiveTalking~9600活跃Apache-2.0 + 水印附加条款⚠️ 可,但声明发布视频须带 LiveTalking 水印和标识wav2lip256 @3060=60fps★★☆☆☆⚪ / ✅✅ / ✅✅ / ✅ / ✅多⭐⭐⭐⭐
LingCast(灵播)—2026未确认未确认低(CPU 亦可,Wav2Lip ONNX 35fps+)★★★★☆ 三微服务 + Docker✅ / ✅✅ / ✅ / ✅ / ❌中⭐⭐⭐(直播架构参考)
OmniHuman-1 / 1.5(字节)❌ 未开源—仅论文(ICCV 2025)❌————❌ 不可用
HeiXia2077/live-avatar—2026-08未确认未确认全本地中文语音对话数字人—✅ / ❌ / ✅ / ✅ / ⚪中文⭐⭐⭐(可抄作业)

3.3 逐项关键要点

Duix.Avatar(原 HeyGem.ai)— 许可最需要读原文的一个 LICENSE 第 2 条原文(来源):

"Additional Commercial Terms. If ... either (a) the Monthly Active Users of the products or services made available by or for Licensee ... is greater than 1 thousand in the preceding calendar month, or (b) your product incorporating DUIX.COM Materials has greater than 1 thousand Monthly Active Users, you must request a commercial license from DUIX.COM..."

但同一仓库 README_zh 写「支持全球免费商用(用户量超过 10 万或年营收达 1000 万美元以上的企业需签署商业许可协议)」→ LICENSE vs README 阈值冲突(1000 vs 10 万)。LICENSE 是法律文件,保守按 1,000 MAU 评估。

其他常被忽略的附加义务:

功能边界:Duix.Avatar 的官方 README 明确写「数字人实现的是克隆和非实时视频合成,如需交互请访问 duix.com」→ 它不做实时对话,只做离线口播视频。

Duix Mobile(duix.ai):是实时交互 SDK(Android/iOS/车机/大屏,端侧 <120ms),但仓库只提供 4 个公共形象(Leo/Oliver/Sofia/Lily),自定义形象需邮件 support@duix.com 付费定制(官方口径:提供 15 秒~2 分钟视频通常足够)。所以它是「开源 SDK + 商业定制形象」,不是拿来即用。

Linly-Talker:自身 MIT,但 README 明确警告 "In addition to adhering to the MIT License, ensure that you comply with all license agreements for any referenced models and components." 而它默认打包了 Wav2Lip 权重(明确禁止商用) 与 SadTalker 依赖链的 s3fd 等 → 默认配置下整体不可商用,必须替换权重。

Fay:不是视频生成器,而是数字人「大脑+总线」的 agent 框架(向上适配数字人模型、向下接 LLM)。GPL-3.0 允许商用,但传染性强——若你分发修改后的 Fay 或衍生作品,必须以 GPL-3.0 开源。自用/内部部署无此约束。

OpenAvatarChat:主项目 Apache-2.0,依赖链(LiteAvatar=MIT、MuseTalk=MIT、SoulX-FlashHead=Apache-2.0、CosyVoice=Apache-2.0、SenseVoice=Apache-2.0、silero-vad=MIT、wav2vec2=MIT)全链路无一处「禁止商用」,这在开源数字人里非常罕见。但默认预置配置用阿里云百炼 API 做 LLM+TTS(需 DASHSCOPE_API_KEY),不是全离线;想零 API 费用需自己换本地 LLM + 本地 CosyVoice。0.6.0(2026-04)重构为前后端分离,全数字人支持双工打断。

AigcPanel:软件本体 Apache-2.0,但 Pro/VIP 功能(可视化工作流、智能直播、云端模型服务)收费 → 「开源核心 + 闭源增值」。集成的视频模型为 MuseTalk / LatentSync / Wav2Lip / Heygem → 商用须避开 Wav2Lip 与 Heygem,固定选 MuseTalk 或 LatentSync。

SadTalker:README Highlights 首条写 "The license has been updated to Apache 2.0, and we've removed the non-commercial restriction";但它的 checkpoint 包捆了 wav2lip.pth,且 LICENSE 只说 "except for the third-party components listed below" 却没有实际列出清单(法律文本不完整)。代码许可 ≠ 可用。

EchoMimic 全家桶(重要澄清):不是 CC-BY-NC,也不是「仅限研究」。V1/V2 有 LICENSE 文件原文为 Apache-2.0;V3 根目录无 LICENSE 文件但 README 的「📜 License」章节明确写 "The models in this repository are licensed under the Apache 2.0 License. We claim no rights over your generated contents"。三个 README 都保留 "intended for academic research" 的 Disclaimer(免责声明,用户自担责任)——这是免责声明,不是授权限制,Apache-2.0 授权优先。这是中文社区误传最多的一条。

LivePortrait(最容易踩的坑):19k star,很多人以为 MIT 就直接商用。但 LICENSE 原文明确:

"The code of InsightFace is released under the MIT License. The models of InsightFace are for non-commercial research purposes only. If you want to use the LivePortrait project for commercial purposes, you should remove and replace InsightFace's detection models to fully comply with the MIT license."

3.4 最终推荐:个人开发者最推荐的 2 个一体化平台

🏆 做口播视频 → AigcPanel(modstart-lib/aigcpanel)

  1. 部署难度全场最低:Electron 桌面应用(Windows .exe / macOS .dmg / Linux .AppImage + .deb),打开软件 → 模型市场下载一键启动包 → 直接用。零 Docker、零编译,Ubuntu 直接用 AppImage。还带 CLI(aigcpanel serverCall)便于脚本集成。
  2. 许可证最省心:软件本体 Apache-2.0(LICENSE 与 GitHub API 一致),不像 HeyGem 那样 LICENSE 与 README 自相矛盾。
  3. 一个界面把口播全链路都包了:数字人视频合成(MuseTalk / LatentSync / Wav2Lip / Heygem 四选一换口型)+ 7 个 TTS/声音克隆模型(CosyVoice-300M/Instruct/CosyVoice2、FishSpeech、IndexTTS、SparkTTS、GPT-SoVITS)+ ASR 字幕 + 25 个音视频工具箱。
  4. 极活跃:5574 star,push 2026-09-18(本次清单里最新),open issue 仅 5 个。
  5. 中文一等公民:简中/英双语界面、官网 aigcpanel.com、微信群 + QQ 群、Gitee 镜像。
  6. 16GB 卡充分:挂 MuseTalk(4GB 起)或 Heygem 驱动(社区一键包 8GB)都在余量内。

必须操作:商用场景在 AigcPanel 里固定选 MuseTalk 或 LatentSync 作为口型引擎,不要用 Wav2Lip / Heygem。智能直播、可视化工作流、云端模型服务属 VIP 付费功能。

备选(更看重最终画质、且能接受读许可原文):Duix.Avatar(原 HeyGem)。口型效果公认第一梯队,Docker Compose 一键、有 5090 专用 compose、中文教程铺天盖地。但请按 LICENSE 的 1,000 MAU 阈值(而非 README 的 10 万)评估商用风险,并准备履行 "Built with DUIX.COM" 署名义务。

🏆 做实时对话数字人 → OpenAvatarChat(HumanAIGC-Engineering/OpenAvatarChat)

  1. 许可证组合最干净的实时方案:主项目 Apache-2.0 + LiteAvatar(MIT) + MuseTalk(MIT) + SoulX-FlashHead(Apache-2.0) + CosyVoice(Apache-2.0)。全链路无一处「禁止商用」。
  2. 显存极度友好:LiteAvatar 2D 路线社区实测仅需 4GB 显存。16GB 卡不仅够,还能同时跑本地 LLM/TTS(全离线很关键)。
  3. 延迟达标:官方标称平均响应 2.2 秒;0.6.0(2026-04)起支持手动打断 + 双工打断。
  4. 部署真·一键:uv run install.py --config xxx.yaml 自动解析依赖、合并版本冲突、给 flash-attn 加 --no-build-isolation;uv run scripts/download_models.py 统一下模型(国内自动走 ModelScope + hf-mirror)。
  5. sm_120 明确支持:文档写明「确保本机 NVIDIA 驱动程序支持的 CUDA 版本 >= 12.8」——正好对上 Blackwell。这一点远胜 SadTalker/EchoMimic v1/v2 那些锁 cu113/cu118 的老项目。
  6. 中文一手资料:中文 README 为默认、中文文档站、官方 B 站教程、微信群。

必须注意:默认配置用阿里云百炼 API(需 DASHSCOPE_API_KEY),不是全离线;MuseTalk 路线要 ≥12GB、FlashHead Pro 要双 5090 → 16GB 卡上 LiteAvatar 是唯一稳妥选择;LAM_Audio2Expression 已核实为 Apache-2.0 ✅。

并列备选:OpenTalking(3056 star,2026-04 新项目,Apache-2.0,quicktalk 在 3090 上 ~3.8GiB / ~35fps,带完整 WebRTC 前后端 + 形象库上传 UI,中文优先)。

直播推流场景:编排层选 Fay(GPL-3.0,13.5k star,日更),画面驱动选 LiveTalking(Apache-2.0,wav2lip256 在 3060 上 60fps,原生 WebRTC/RTMP/虚拟摄像头)或参考 LingCast 架构。注意 LiveTalking 的水印附加条款与 Fay 的 GPL-3.0 传染性。

LAM 3D 路线:OpenAvatarChat 内已有 LAM WebGL Interactive Chatting Avatar SDK + Avatar Export 工具,是「真 3DGS 实时对话」的落点。


4. 第三块:商用授权与合规风险

4.1 许可证体系:先分清 5 类

类别典型许可证商用义务
宽松开源Apache-2.0 / MIT / BSD✅ 自由商用保留版权与许可声明;Apache-2.0 另含专利授权与 NOTICE 要求
署名/传染型 CCCC-BY-4.0 / CC-BY-SA-4.0✅(BY-SA 有传染)必须署名;SA 要求衍生同许可
非商业 CCCC-BY-NC-4.0 / CC-BY-NC-SA-4.0❌ 禁止商用定义:"NonCommercial means not primarily intended for or directed towards commercial advantage or monetary compensation"
自定义社区许可Tencent Hunyuan Community License / DUIX.COM Community License / Llama 系 / OpenRAIL-M⚠️ 有条件常见条款:地域排除(EU/UK/韩国)、MAU 门槛(1000 / 100 万)、强制署名("Powered by…" / "Built with…")、禁止用输出改进其他模型、AUP 附加限制
CopyleftGPL-3.0 / AGPL-3.0✅ 但传染分发衍生作品须同许可开源;AGPL 还覆盖网络服务
无许可证仓库无 LICENSE 文件❌ 默认保留所有权利法律上不可用(不是「开源」)

⚠️ 关于「无 LICENSE 文件」:本次调研中,大量 3DGS 研究仓库根本没有 LICENSE 文件(GaussianTalker、HeadGaS、TensorialGaussianAvatar、gaussian-head 等均 404)。按伯尔尼公约,无许可 = 保留所有权利 = 不能合法使用,这是「看着开源」的终极形态。

4.2 主流模型许可证速查表(逐条核实)

模型 / 项目许可证可商用判断关键约束(原文要点)
Wav2Lip自定义(无标准协议)❌ 禁止商用"should only be used for research/academic/personal purposes only ... any form of commercial use is strictly prohibited";"can only be used for personal/research/non-commercial purposes"
SonicCC-BY-NC-SA 4.0❌ 禁止商用LICENSE 原文 为完整 CC BY-NC-SA 4.0 文本
LivePortraitMIT(代码)+ InsightFace 模型非商用⚠️ 须替换 InsightFace 检测模型"The models of InsightFace are for non-commercial research purposes only. If you want to use the LivePortrait project for commercial purposes, you should remove and replace InsightFace's detection models"
InsightFace代码 MIT / 模型非商用⚠️ 模型禁止商用官方站点明确模型许可与代码许可分离
SadTalkerApache-2.0 except 第三方(清单缺失)⚠️ 代码可,权重含非商用 Wav2Lip + s3fdREADME:"removed the non-commercial restriction";但 checkpoint 含 wav2lip.pth
MuseTalkMIT(代码 + 权重)✅ 明确可商用"code: MIT, no limitation for both academic and commercial usage; model: available for any purpose, even commercially";注意 S3FD/face-alignment 等第三方检测器需各自遵守
LatentSyncApache-2.0✅(SD 系权重需另查)—
EchoMimic V1 / V2 / V3Apache-2.0(V3 为 README 声明)✅ 可商用V3 README:"The models in this repository are licensed under the Apache 2.0 License. We claim no rights over your generated contents";V1/V2 有 LICENSE 文件原文
Hallo / Hallo2MIT✅ 可商用—
VideoReTalkingApache-2.0✅(组件需查)—
Linly-TalkerMIT(代码)⚠️ 代码可,默认打包非商用权重README:须同时遵守所有引用模型的许可协议
FayGPL-3.0✅ 可(传染)闭源分发有风险
Duix.Avatar / HeyGem.aiDUIX.COM Community License⚠️ 有条件(MAU>1000 须商业授权)另需 "Built with DUIX.COM" 署名、Notice 文件、模型名以 DUIX.COM 开头、§5(c) 授予 DUIX 对你案例的永久免费使用权
OpenAvatarChatApache-2.0✅ 可商用依赖链全干净(LiteAvatar MIT / MuseTalk MIT / FlashHead Apache-2.0 / CosyVoice Apache-2.0)
AigcPanelApache-2.0✅ 软件可(Pro/VIP 收费)集成的 Wav2Lip/Heygem 各自受限
LAM / LHM / LAM_Audio2ExpressionApache-2.0✅ 可商用—
TripoSG / TripoSRMIT✅ 可商用—
TRELLIS / TRELLIS.2MIT(代码 + 权重)✅ 可商用HF 卡 license: mit
Step1X-3DApache-2.0✅ 可商用—
Splat-SLAMApache-2.0✅(但 sm_120 不可行)—
SAM 3DSAM License⚠️ 未禁商用但非 OSI 标准开源受出口管制、军事用途等限制
Gaussian-Head-Avatar清华非商用许可❌ 禁止任何商业用途明确禁止用于训练商用模型
GaussianAvatars / SplattingAvatarCC-BY-NC-SA-4.0❌ 禁止商用GaussianAvatars 另有 Toyota 限制
TalkingGaussian / InsTaG / EmoTaGresearch only❌ 禁止商用—
NanoAvatar代码 MIT / 权重 CC BY-NC 4.0⚠️ 代码可,权重禁止商用典型的「代码许可与权重许可分离」
FLAME / BFM / SMPL(-X)各自研究许可❌ 非商用3D 人脸/人体链的上游污染源——几乎所有 3DGS 说话头都依赖它
INRIA 3DGS 原版自定义❌ 非商用GaussianTalker 等依赖它
MiniMax M2 / M2.5MIT✅ 可商用2025-10 / 2026-02 发布
MiniMax M2.7(2026-04)NON-COMMERCIAL LICENSE(自称 "Modified-MIT")❌ 商用须事先书面授权商业用途须显著标注 "Built with MiniMax M2.7";自托管编程豁免
Qwen3.8-27B(2026-08)Apache-2.0✅ 可商用实测 HF LICENSE 为标准 Apache-2.0 全文
Qwen3.8-Max / 2.4T-A95B(2026-08)自定义 Qwen3.8-Max License⚠️ 有条件MaaS/AI Work Assistant 业务累计 12 个月收入 > 5000 万美元须另行授权;MAU>1 亿或月收入>2000 万美元须 UI 署名;内部使用豁免
Qwen3.8-Flash-Next(2026-08-24)Qwen Community License 1.0⚠️ 有条件(更严)MaaS 或 AI Work Assistant 业务,无收入门槛,商用前即须取得 Qwen 单独许可;署名门槛 MAU>1 亿或月收入>2000 万美元
Kimi K3(月之暗面)自定义⚠️ 有条件年收入 > 2000 万美元即触发商业合同,报道称收入分成最高 30%

4.3 中国大厂开源条款:用 Wan / 混元 / LongCat / 阿里做商业数字人的注意点

腾讯混元系列:「社区许可」≠ 自由商用,有 3 个硬约束

以 Hunyuan3D 2.0 / 2.1 Community License 原文(2.0、2.1)为例:

① 地域排除(最需要注意) "THIS LICENSE AGREEMENT DOES NOT APPLY IN THE EUROPEAN UNION, UNITED KINGDOM AND SOUTH KOREA AND IS EXPRESSLY LIMITED TO THE TERRITORY, AS DEFINED BELOW." §1.l "Territory" shall mean the worldwide territory, excluding the territory of the European Union, United Kingdom and South Korea." §5.c "You must not use, reproduce, modify, distribute, or display the … Works, Output or results … outside the Territory. Any such use outside the Territory is unlicensed and unauthorized."

② MAU 门槛 §4 "If … the monthly active users of all products or services made available by or for Licensee is greater than 1 million monthly active users in the preceding calendar month, You must request a license from Tencent … and You are not authorized to exercise any of the rights under this Agreement unless or until Tencent otherwise expressly grants You such rights."

③ 禁止用其输出改进其他模型 §5.b "You must not use the … Works or any Output or results of the … Works to improve any other AI model (other than Tencent Hunyuan … or Model Derivatives thereof)."

其他义务:§3.a 须向第三方提供本协议副本;§3.b 修改文件须显著标注;§3.c 鼓励(非强制)发布博客并标注 "Powered by Tencent Hunyuan";§3.d 分发须附 Notice 文本文件;§3.e 若向第三方提供服务,须清晰准确披露实际提供方的法定全名,并声明腾讯未关联/未背书;§6.b 不授予商标许可;§6.a 腾讯不主张你对输出(Outputs)的权利(这一点对创作者友好)。

适用范围:Hunyuan3D 2.0 / 2.1 / Omni / Part、HunyuanVideo-Avatar(LICENSE,同族条款,Release Date 2025-05-28)、HunyuanWorld-1.0(LICENSE,2025-07-27)、HunyuanWorld 2.0 / HY-World-2.0 等。

结论:用混元做面向中国大陆的商业数字人通常可行(个人开发者远低于 100 万 MAU);但产品要出海到欧盟/英国/韩国就违反许可;且不能拿混元的输出(如 3D 模型、视频)去训练你自己的模型。做商业数字人时还要在界面上披露你自己是服务提供方。

阿里 Wan 系列:分水岭在 2.2

版本权重状态许可
Wan 2.1 / 2.2(含 TI2V-5B、T2V-A14B、I2V-A14B、Animate-2-14B)开放权重Apache-2.0(Wan2.1 LICENSE.txt 原文为标准 Apache-2.0 全文)
Wan 2.5无公开权重API-only(阿里云百炼 / fal / Replicate)
Wan 3.0无公开权重API-only(2026-08 上线 fal / Replicate / 8frame)

核查方法(可自行复现,来自 8frame 2026-08-28 的核查文章):

curl "https://huggingface.co/api/models?author=Wan-AI&sort=createdAt&direction=-1"

实测最新仓库依次为 Wan2.2-Animate-2-14B-Distilled-Diffusers、Wan2.2-Animate-2-14B-Diffusers(2026-08-06)、Wan2.2-Animate-2-14B(2026-07-14)、Wan-Dancer-14B(2026-07-10),其后是 2025 年的 Wan 2.2 / 2.1。没有 2.5,也没有 3.0。

本次调研独立复核(经 hf-mirror API)结果一致:Wan-AI 组织下最新仓库为 2026-08-06 的 Wan2.2-Animate-2-14B-Diffusers / Wan2.2-Animate-2-14B-Distilled-Diffusers,无 2.5/3.0 权重仓库。

注意:Wan 官方模型卡另有可接受使用政策(禁止违法、色情、名人换脸等),Apache-2.0 是代码/权重的版权许可,不豁免 AUP 与本地法律(如中国的深度合成标识义务)。做商业数字人换脸尤其要看这一层。

美团 LongCat 系列:相对干净

模型许可核查
LongCat-Flash-ChatMIT(Copyright (c) 2025 Meituan)HF LICENSE 原文
LongCat-Video-Avatar-1.5(2026-05,13.6B DiT 音频驱动数字人)MITHF repo、鲸智社区模型页 标注「开源许可证:mit」
LongCat-2.0 / Flash-Lite / Image / AudioDiT 等以各自模型卡为准多数为 MIT

但:LongCat-Video-Avatar-1.5 虽许可最宽松(MIT),算力门槛却是全场最高——最低 2×A100 80G,INT8 量化仍需约 40GB,单张 5060 Ti 16GB 完全不可行。这是「开源省的是授权费,不是算力费」的最好例证。

其他中国大厂(本次核查状态)

系列状态
字节 OmniHuman-1 / 1.5❌ 未开源——仅论文(arXiv 2508.19209 / ICCV 2025),只能通过即梦等商业产品使用。注意 julia-cherry/OmniHuman 是同名但无关的 ECCV 2026 数据集项目。
字节 LatentSync✅ Apache-2.0(已开源)
快手 LivePortrait⚠️ MIT + InsightFace 模型非商用(见上)
快手可灵 Kling❌ 闭源商业 API
字节 Seedream / Seedance❌ 闭源商业(即梦 CLI 可调用,非开源权重)
智谱 CogVideoX / GLM以各自仓库许可为准(本次未逐条复核 → 未确认)
上海 AI Lab(InternVL 等)以各自仓库许可为准(未确认)

⚠️ 2026 年最重要的新趋势:中国大厂许可证正在系统性收紧

这是本次调研中最值得写进决策文档的一条动向——「中国开源权重 = 永久宽松」的假设在 2026 年已经失效。

① 阿里 Qwen 系列:从 Apache-2.0 转向自定义「收入门槛」许可

署名触发条件:商业产品/服务若 MAU > 1 亿 或 月收入 > 2000 万美元 → 必须在用户界面上显著展示模型名称。

独立商业许可触发条件:若被许可方或其关联方从事 Model as a Service 或 AI Work Assistant 业务,且被许可方及关联方在任意连续 12 个月内累计收入超过 5,000 万美元 → 须事先从 Qwen 获得单独许可才能将本软件或其衍生作品用于任何商业目的。

内部使用豁免:上述要求不适用于内部使用,前提是该使用不使本软件、其输出或其底层模型能力对任何第三方可用。

「Model as a Service」定义为「让第三方访问语言模型推理或微调(如通过 API 或托管端点),使第三方能对输入、参数或训练数据行使有意义的控制」;「AI Work Assistant」定义为「主要设计用于 AI 辅助编程或办公效率的独立 AI 产品(如 Qoder、QwenWork)」,并明确排除单用途工具与域外助手。

⚠️ 关键理解:门槛画在公司总收入上,不是该模型的收入。一家任何业务年收入超 5000 万美元的公司,只要把基于 Qwen3.8-Max 的助手推到客户面前,就落入门槛。 同一家公司用它起草内部备忘录则豁免。

第 2 条:"If the licensee or any of its affiliates conducts a Model as a Service or AI Work Assistant business, the licensee shall obtain a separate license from Qwen before Using the Software … for any commercial purpose."

注意:这一条没有收入门槛。 只要你是 MaaS 或 AI Work Assistant 业务,无论收入多少,商用前都必须先拿到 Qwen 的单独许可(内部使用仍豁免,前提是不让第三方接触软件、输出或底层模型能力)。

第 1 条(署名):商业产品/服务 MAU > 1 亿 或 月收入 > 2000 万美元 → 须在 UI 显著展示模型名。

因此 Qwen 家族目前并存 3 种许可:Apache-2.0(Qwen3.8-27B 等)、Qwen3.8-Max License(带 5000 万美元收入门槛)、Qwen Community License 1.0(MaaS/AI Work Assistant 无门槛即须授权)。下载前必须逐仓库看 LICENSE 文件,不能凭「Qwen 都是 Apache-2.0」的印象。

来源:AI in Asia 分析(2026-08-14)、SCMP:Alibaba adds commercial restrictions to open-weight Qwen3.8-Max、Forkast:Open Weights, Closed Revenue Ceiling

② MiniMax:M2.7 把「MIT」改成了「Non-Commercial」——本次最典型的「看着开源禁止商用」案例

MiniMax 于 2026-04-14 前后变更 M2.7 授权。其 HF LICENSE 原文标题直接就是 NON-COMMERCIAL LICENSE(HF LICENSE 原文,本次实测):

"Non-commercial use permitted based on MIT-style terms; commercial use requires prior written authorization."

第 2 条:If the Software … is used for any Commercial Use, you shall prominently display "Built with MiniMax M2.7" … 第 3 条:Any Commercial Use … is prohibited without obtaining a separate, prior written authorization from MiniMax. 第 5 条 Permitted Free Uses:personal use(含自托管编程)、非营利/学术研究、为上述目的而修改。

背景与争议:MiniMax 于 2025-10 以 MIT 开源 M2、2026-02 以 MIT 发布 M2.5,M2.7 是首次打破完全开源惯例。争议点在于他们把该协议标注为 "Modified-MIT",而 MIT 本身明确允许商用——社区在 Hacker News 与 HF 讨论区批评这是「欺骗性开源」。MiniMax 开发者关系负责人 Ryan Lee 回应称「模型依然是开放的,你依旧可以下载权重、本地运行、微调、二次开发、开展研究、发布非商业项目」,调整的只有商业使用条款;并补充「自托管的 M2.7 用于代码编写是绝对允许且免费的,并且不需要显示 'Built with MiniMax-M2.7'」。

来源:36氪/光通信Pro:MiniMax 修改开源授权被骂疯了、InfoQ 报道、MiniMax-M2.7 HF LICENSE

③ 同类先例

对个人开发者的含义:

4.4 2026 年中国法规与司法:数字人合规的现行红线

① 《人工智能生成合成内容标识办法》——2025-09-01 起施行

依据《互联网信息服务深度合成管理规定》,要求 AI 生成合成内容加显式标识(可被用户感知的文字/图形标记)与隐式标识(元数据中嵌入生成合成信息)。配套强制性国标《网络安全技术 人工智能生成合成内容标识方法》同步实施。

来源:司法部智慧普法平台·一图速览、央广网报道

对数字人的影响:你用开源模型生成的数字人口播视频,对外发布时须依法加标识,不能去掉元数据标识。

② 最高人民法院《关于依法审理涉人工智能纠纷案件的意见》——2026-09-07 发布(最新、最重要)

发布会答记者问逐条披露了《意见》核心内容(最高法官网原文):

第 4 条(数字人创业者必读): "未经同意利用人工智能处理自然人的姓名、肖像等,生成可识别该自然人的虚拟数字形象并使用、公开的,构成对姓名权、肖像权等人格权益的侵害; 未经同意使用自然人声音作为训练语料,模仿其音色、语调和发音风格生成可识别的合成人声的,构成对声音权益的侵害; 操控虚拟形象、合成声音实施不当行为或者发表不实言论、降低他人社会评价的,构成对名誉权的侵害。"

训练数据的合规边界(利好开源训练,但对个人数字人 Clone 更严): "为人工智能模型训练,在合理范围内处理已合法公开的个人信息,且个人未明确拒绝的,一般不认定为侵权。但是,对个人权益有重大影响的,应当依照法律规定取得个人同意。"

仿冒名人带货:"利用人工智能'仿冒名人带货'且构成欺诈,消费者主张惩罚性赔偿的,人民法院依法予以支持。"

避风港规则的参照适用:生成式 AI 自动生成内容侵害人格权益,经权利人通知,服务提供者未及时采取停止生成等必要措施的,应承担侵权责任;用户恶意诱导生成的,用户承担侵权责任。

归责原则:除法律明确规定无过错责任或过错推定责任外,适用过错责任原则。严格将"人工智能产品"限定为以实物为载体的产品(如智能机器人、自动驾驶汽车),将没有实物载体的人工智能服务排除在产品责任之外。

对个人开发者的直接含义:

③ 成都市《AI 生成广告合规指引》——2026-09-18 发布(地方监管前沿)

成都市市场监督管理局发布,明确 AI 生成广告的七项负面清单:

  1. 不得生成涉及时事政治、公共政策、社会民生等方面的谣言或不实信息用于广告营销;
  2. 不得生成淫秽、色情、赌博、迷信、恐怖、暴力、低俗内容用于广告营销;
  3. 未经同意,不得利用 AI 生成合成可识别特定自然人的虚拟数字形象用于广告营销。不得利用 AI 换脸等技术仿冒名人、明星或他人通过直播带货、短视频等开展广告活动。
  4. 不得使用可识别特定自然人的虚拟数字形象对医疗、药品、医疗器械、保健食品等不允许广告代言的商品、服务作推荐、证明。不得在广告中声称 AI 虚拟人对商品或服务的使用体验。
  5. 不得生成侵犯他人著作权、商标权等知识产权的内容用于广告营销;
  6. 不得在「探店」「种草」、达人分享及测评等营销中,利用 AI 生成虚假的体验内容做广告;
  7. 不得生成其他含有虚假或引人误解的内容。

标识要求:AI 生成广告在依法显著标明「广告」的基础上,还应显著清晰标注「本广告使用 AI 技术辅助优化」「广告画面经 AI 处理」「本广告含 AI 虚拟场景」「本广告由 AI 技术生成」「本广告使用 AI 虚拟人」「本广告使用真人虚拟数字形象」等标识。

④ 其他相关依据

4.5 训练数据与肖像权风险提示(实操清单)

风险场景风险等级建议做法
用自己的照片/视频训练数字人分身低自用/商用均可;建议保留书面自同意声明备档
用公司员工/签约模特形象中必须签肖像权 + 声音权双重授权,明确授权范围(期限、地域、用途、是否可用于 AI 训练、可否转授权)
用网络公开照片/视频(含网红、素人)高依最高法《意见》,「可识别特定自然人的虚拟数字形象」未经同意即侵权——「公开可得」不等于「可授权」
用明星/名人形象极高一刀切禁止。构成欺诈的可主张惩罚性赔偿(最高法《意见》)
用他人声音做 TTS 声音克隆高最高法《意见》已明确声音权益受保护,须取得同意
用逝者形象做「AI 复活」高最高法《意见》专门规定依法保护死者的人格利益
用LRS2 等数据集训练的权重(如 Wav2Lip)高该数据集本身有伦理与授权限制,Wav2Lip 因此明确禁止商用
上传用户照片做数字人(SaaS)高PIPL 敏感个人信息需单独同意;需明确告知存储期限、是否用于训练;涉及境外用户须做数据出境合规
生成内容未加标识对外发布中违反《标识办法》,须加显式 + 隐式标识
在欧盟/英国/韩国部署混元系模型高属于许可明确排除的地域,使用即未经授权

5. 许可证红线清单(24 条)

按「绝对不能用 → 必须署名 → 必须申请授权」排序。

🚫 A 类:绝对不能用(禁止商用,无补救)

#红线来源
1Wav2Lip 权重严禁任何形式商用。它被广泛打包进 Linly-Talker、SadTalker、AigcPanel 的默认流程里——用了这些平台的默认配置就等于踩线。Wav2Lip README("any form of commercial use is strictly prohibited")
2Sonic 是 CC-BY-NC-SA 4.0,禁止商用。LICENSE 原文
3GaussianAvatars / SplattingAvatar 是 CC-BY-NC-SA-4.0,且 GaussianAvatars 另有 Toyota 限制。仓库 LICENSE
4Gaussian-Head-Avatar(清华)明确禁止任何商业用途,且禁止用于训练商用模型。仓库许可
5FLAME / BFM / SMPL(-X) 基础模型本身即非商用研究许可——它是整条 3D 头像链的上游污染源。只要你的 3DGS 头像依赖它,商用就被堵死。各基础模型官方许可
6仓库没有 LICENSE 文件 ≠ 开源。GaussianTalker、HeadGaS、TensorialGaussianAvatar、gaussian-head 等均无 LICENSE(404)→ 默认保留所有权利,不能合法使用。各仓库根目录核查
7INRIA 原版 3DGS 是非商用许可——GaussianTalker 等一批说话头都建在它之上。graphdeco-inria/gaussian-splitting LICENSE
8InsightFace 的模型只允许非商业研究用途。LivePortrait 是 MIT 代码,但不替换 InsightFace 检测模型就不能商用——这是 19k star 项目里被绝大多数教程忽略的一条。LivePortrait LICENSE
9不能在欧盟 / 英国 / 韩国使用腾讯混元系模型(含 Hunyuan3D 2.x、HunyuanVideo-Avatar、HunyuanWorld)。协议原文:这些地域完全不适用,境外使用「unlicensed and unauthorized」。Hunyuan3D-2 LICENSE §1.l / §5.c
10不得使用混元系模型的输出(Output)去改进任何其他 AI 模型(蒸馏、合成数据训练等均被禁止)。同上 §5.b

⚠️ B 类:必须署名 / 必须披露

#红线来源
11Duix.Avatar(原 HeyGem.ai)分发时必须显著展示 "Built with DUIX.COM",须附 Notice 文件,用其材料训练的模型名字要以 "DUIX.COM" 开头;且 §5(c) 授予 DUIX 对你使用案例的永久免费使用权。LICENSE 原文
12混元系若向第三方提供服务,须清晰披露实际服务提供方的法定全名,并声明腾讯未关联/未背书;分发须附协议副本与 Notice。Hunyuan LICENSE §3.a / §3.d / §3.e
13发布数字人视频须依法加 AI 标识(显式 + 隐式),尤其广告场景须标注「本广告使用 AI 虚拟人」等。去掉元数据标识属违规。《人工智能生成合成内容标识办法》、《成都市 AI 生成广告合规指引》七项负面清单
14LiveTalking 有附加条款:基于它开发并发布在 B站/视频号/抖音等平台的视频须带 LiveTalking 水印和标识——这不是标准 Apache-2.0 条款。LiveTalking README

🔒 C 类:必须申请授权 / 门槛触发

#红线来源
15Duix.Avatar(原 HeyGem.ai)的 MAU > 1,000 即须向 DUIX.COM 申请商业许可。⚠️ 注意 LICENSE 写 1,000,README 写 10 万,二者冲突——按 LICENSE(法律文本)保守评估。LICENSE §2
16混元系 MAU > 100 万须向腾讯申请许可(个人开发者通常不触发,但 SaaS 规模化后会)。Hunyuan LICENSE §4
17Fay 是 GPL-3.0,闭源分发衍生作品即违约;若你的产品需要闭源,不能直接用 Fay。LICENSE
18AigcPanel 的 Pro/VIP 功能(可视化工作流、智能直播、云端模型服务)不在开源范围。AigcPanel README
19「代码许可」与「权重许可」分离是常态:NanoAvatar(代码 MIT / 权重 CC BY-NC 4.0)、LivePortrait(代码 MIT / InsightFace 模型非商用)、SadTalker(Apache-2.0 / 权重含 Wav2Lip)——必须分别核查,不能只看代码 LICENSE。各仓库
20「看着开源其实禁商用」的终极形态:无 LICENSE 文件。判断一个仓库能否用,第一步永远是 curl -sI .../LICENSE 看是不是 404。方法论
21MiniMax M2.7 是「Non-Commercial License」却标注为 "Modified-MIT"——商业使用须事先取得 MiniMax 书面授权(api@minimax.io),商业用途还须显著标注 "Built with MiniMax M2.7"。⚠️ 同系列的 M2(2025-10)与 M2.5(2026-02)是 MIT,相邻版本许可完全不同。HF LICENSE 原文
22Qwen3.8-Max(2026-08)不再是 Apache-2.0,改为自定义许可:从事 MaaS 或 AI Work Assistant 业务且累计 12 个月收入 > 5000 万美元须另行取得商业许可;MAU > 1 亿或月收入 > 2000 万美元须在 UI 显著展示模型名。(对比:Qwen3.8-27B 仍是 Apache-2.0——同一家、同一周发布、许可完全不同。)HF LICENSE 原文
23把模型许可当作「版本化依赖」管理。中国大厂许可证在 2026 年系统性收紧(阿里 Qwen 3.5/3.6 开源→3.7 闭源→3.8 开源带条件;MiniMax M2/M2.5 MIT→M2.7 非商用;Kimi K3 年收入 2000 万美元触发分成)。衍生模型继承原条款,必须记录「哪个权重进了哪个产品」。AI in Asia
24「Qwen 都是 Apache-2.0」是过时印象。同一周发布的三份 Qwen 许可完全不同:Qwen3.8-27B = Apache-2.0;Qwen3.8-Max = 自定义(5000 万美元收入门槛);Qwen3.8-Flash-Next = Qwen Community License 1.0(做 MaaS/AI Work Assistant 业务无收入门槛即须先取得单独许可)。商用前必须逐仓库读 LICENSE 文件。Qwen3.8-Flash-Next LICENSE 原文

6. 面向 16GB / RTX 5060 Ti 的落地建议

6.1 立刻可做(本周就能跑起来)

目标首选备选显存
批量口播视频AigcPanel(AppImage + 模型市场)+ MuseTalk 口型引擎EchoMimicV3(12GB/8步/768²)4–12GB
实时语音对话数字人OpenAvatarChat(LiteAvatar 路线)OpenTalking(quicktalk 3.8GiB)4–8GB
出片画质优先Duix.Avatar(读清 LICENSE 再用)EchoMimicV38–12GB
直播推流Fay(编排)+ LiveTalking(驱动,注意水印条款)LingCast 架构8–12GB
3D 资产(道具/角色三视图)TripoSG(MIT,≥8GB)TRELLIS v1(MIT,16GB 下限)8–16GB
真 3DGS 数字人形象LAM + LAM_Audio2Expression + OpenAvatarChat(全链 Apache-2.0)—低(单图推理)

6.2 明确不建议(个人开发者)

6.3 商用自查 5 步法

  1. curl -sI https://raw.githubusercontent.com/<owner>/<repo>/main/LICENSE → 404 就直接放弃。
  2. 读 LICENSE 原文(不是 README)→ 抓关键词:NonCommercial / commercial / Monthly Active Users / Territory / Attribution / Built with / Powered by。
  3. 单独核查权重许可(HuggingFace 模型卡的 license: 字段、LICENSE 文件)——代码许可 ≠ 权重许可。
  4. 逐层查依赖传染:用了 Wav2Lip?InsightFace?FLAME/BFM?3DGS 原版?→ 有一个就整体不可商用。
  5. 确认落地地域与输出标识义务(中国:《标识办法》+ 最高法《意见》第 4 条;广告另加地方指引)。

7. 本次未能确认的事项(如实标注,未编造)


8. 参考来源汇总(关键 URL)

许可证原文

华为/大厂条款与版本状态

法规与司法

论文

sm_120(Blackwell)适配证据链

平台与仓库

下载此文件