调研时点:2026-09-22 目标用户画像:个人开发者,单张 RTX 5060 Ti 16GB(Blackwell sm_120)、32GB 内存、Ubuntu 调研方法:web_search 多轮 + web_fetch 打开 GitHub raw.githubusercontent.com LICENSE/README 原文、HuggingFace 模型卡 license 字段(经 hf-mirror.com,本机 HF 官方域名不可达)、HF/HF-mirror API 仓库时间线、CVF 开放获取论文页、中国政府/法院/地方监管原文。
| 问题 | 结论 |
|---|---|
| 个人开发者现在该不该走 3D/3DGS 数字人路线? | 不该当主线。 3DGS「说话头」开源工作几乎全数非商用许可(且叠加 FLAME/BFM 等本身非商用的基础模型),工程上又普遍锁 torch 1.12/1.13 + CUDA 11.x,在 sm_120 上等于重写。3D 只能作为「资产生产」与「单图零训练头像」两个单点使用。 |
| 3D 侧真正值得用的东西 | LAM(阿里通义,Apache-2.0,单图秒级生成可驱动 3DGS 头像,无神经网络驱动、WebGL 跨平台);TripoSG / TripoSR / TRELLIS v1(MIT,16GB 可跑,做 3D 资产)。 |
| 最推荐的 2 个一体化平台 | 做口播视频 → AigcPanel(Apache-2.0,桌面 App + 模型市场一键包,中文一等公民);做实时对话 → OpenAvatarChat(Apache-2.0,全链路无「禁止商用」组件,LiteAvatar 路线仅需 4GB 显存,CUDA≥12.8 明确支持 Blackwell)。 |
| 许可证最需要注意的 3 条红线 | ① Wav2Lip 权重严禁商用,而它被默认打包进 Linly-Talker / SadTalker / AigcPanel 的流程里——用默认配置就等于踩线;② Duix.Avatar(原 HeyGem)的 «DUIX.COM Community License» 是自定义协议,LICENSE 写 MAU>1000 即须商业授权(README 却写 10 万,二者冲突);③ 腾讯混元 3D/视频系「社区许可」排除欧盟/英国/韩国,且禁止用其输出改进其他模型。另有高优陷阱:LivePortrait 的 InsightFace 检测模型非商用、MiniMax M2.7 自称 "Modified-MIT" 实则 Non-Commercial。 |
| ⚠️ 2026 年新增风险趋势 | 中国大厂许可证正在系统性收紧:Qwen3.8-Max 不再是 Apache-2.0(5000 万美元收入门槛)、MiniMax M2.7 从 MIT 转向非商用、Kimi K3 年收入 2000 万美元触发分成。必须把模型许可当作「版本化依赖」管理。 |
Blackwell 消费卡(sm_120)需要 CUDA ≥ 12.8 + PyTorch cu128 轮子。这直接影响所有 2024–2025 年的老仓库:
torch==1.12/1.13(cu113/cu116)+ tensorflow-gpu==2.8 + python 3.7,在 5060 Ti 上不是「装完即用」,而是移植工程。xformers / diffoctreerast / kaolin(≥0.18);kaolin 重建是硬门槛。docker-compose-5090.yml)、NanoAvatar(torch 2.10+cu128)。参考:graphdeco-inria/gaussian-splatting issue #1295「Is Blackwell (RTX 50 Series) Supported」、#1215(RTX 5090 + CUDA 12.8 安装记录)、microsoft/TRELLIS issue #243 / #343(5060 Ti 专用)、Dao-AILab/flash-attention issue #2168(无 sm_120 内核)。
| 用户清单中的说法 | 实际情况 |
|---|---|
| GaussianHeadTalk(WACV 2026) | 论文确实存在(arXiv 2512.10939,WACV 2026,CVF 开放获取页),但 arXiv 页无 Code 链接,未检索到官方仓库 → 只能读论文,不能跑。 |
| GaussianTalker 是 WACV | 实为 ACM MM 2024(arXiv 2404.16012),仓库 cvlab-kaist/GaussianTalker。 |
| Mani-GS 是数字人 | gaoxiangjun/Mani-GS 是 CVPR 2025「Gaussian Splatting Manipulation with Triangular Mesh」——网格操控,与说话头无关。YuelangX/Mani-GS 不存在(404)。 |
| Deformable-GS 是说话头 | ingra14m/Deformable-3D-Gaussians 是 CVPR 2024 动态场景重建,非说话头。说话头专用的是 AAAI 2025 "Hierarchically Controlled Deformable 3D Gaussians" 与 GSTalker(arXiv 2404.19040,无代码)。 |
| HeadGaS 开源 | ECCV 2024 论文(arXiv 2312.02902)存在,但未找到官方开源仓库 → 判定「疑似未开源」。 |
| Rodin 开源版 | 不存在。Rodin / Hyper3D(Deemos)是闭源商业 API。 |
| Insta | INSTA(CVPR 2023,Zielon)是 instant-ngp 体积头像,不是 3DGS;520 star,push 2025-08-03;README 建议 RTX 3090 24GB + 32GB RAM,训练至少 1000 帧。 |
| Splat-SLAM 类 | google-research/Splat-SLAM 确实开源(Apache-2.0),但 README 硬要求 CUDA 11.7 + pytorch 1.12 + cudatoolkit-dev,且自述 "not an officially endorsed Google product" → sm_120 不可行。 |
| 项目 | 年份/会议 | Star(2026-09-22) | 最近 push | 代码许可 | 权重许可 | 16GB 可行性 | 素材需求 | 实时 | 中文资料 |
|---|---|---|---|---|---|---|---|---|---|
| GaussianTalker | ACM MM 2024 | 417 | 2025-10-12 | 仓库无 LICENSE 文件(Other) | 未确认;底层依赖 INRIA 3DGS | 显存够,但 torch==1.13.1+mmcv==1.6.0+TF2.8+py3.7 → sm_120 冲突 | 3~5 分钟静态视频 | 论文称实时 | 有中文解读 |
| TalkingGaussian | ECCV 2024 | 387 | 2025-03-15 | 无 LICENSE,README 写明 research only | 同 | 需把数据 preload 进 RAM(每 5k 帧约 32GB RAM)→ 32GB 内存吃紧 | 512²/25fps,1~5 分钟 | 否 | 有 |
| Gaussian-Head-Avatar | CVPR 2024 | 871 | 2024-07-12 | 清华非商用许可,明确禁止任何商业用途、禁止用于训练商用模型(最严) | 同 | 24GB 级 | 多视角/单目视频 | 否 | 有 |
| GaussianAvatars | CVPR 2024 Highlight | 1061 | 2026-02-11 | CC-BY-NC-SA-4.0 + Toyota 禁止商用 | 同 | 24GB 级;需 VHAP FLAME 跟踪数据 | 需配准网格 | 否 | 有(百度/CSDN) |
| SplattingAvatar | CVPR 2024 | 564 | 2026-07-15 | CC-BY-NC-SA 4.0(仅非商用) | 同 | 3090 24GB;可 max_n_gauss 降显存 | 单目视频 + FLAME/SMPL 注册 | 渲染 >300FPS(3090)/30FPS(iPhone13) | 少 |
| 3DGS-Avatar | CVPR 2024 | 441 | 2024-09-10 | 未确认 | 未确认 | 24GB 级 | 单目 | 否 | 少 |
| InsTaG | CVPR 2025 | 174 | 2025-07-15 | research only | 有预训练权重(含中文 trial 权重) | CUDA11.3/11.7+torch1.12/1.13+TF2.10 → sm_120 冲突 | 10 秒视频 few-shot | 否 | 有 |
| EmoTaG | CVPR 2026 | 27(2026-03 建仓) | 2026-07-21 | research only | 有 checkpoint | CUDA 12.1,5 秒/125 帧适配,显存友好 | 5s 适配 + HDTF/MEAD | 否 | 少 |
| SyncTalk | CVPR 2024 | 1627 | 2025-09-18 | 无严格 OSI 许可(含免责声明) | 有 | torch1.12.1+cu113+TF2.8.1 → sm_120 冲突 | 4~5 分钟 25fps 512² | 否 | 好:Windows 整合包 + 网盘 + Colab |
| NanoAvatar | 2026-09(极新) | ~15 | 2026-09-16 | MIT | CC BY-NC 4.0(权重禁商用) | torch 2.10+cu128,Blackwell 友好,仅 700~834 MiB | 10 秒视频 | 手机 39~41FPS,首帧 103ms,流式起播 ~0.3s | 有中文 README |
| INSTA | CVPR 2023 | 520 | 2025-08-03 | instant-ngp 衍生(非商用) | 同 | README 建议 RTX 3090 24GB + 32GB RAM,训练至少 1000 帧 | 视频序列 | snapshot 可在 8GB 笔记本渲染 | 有 |
| EmoZone-Talker | arXiv 2606.15848(2026) | — | — | arXiv only(无代码信息) | 未确认 | 未确认 | 未确认 | 是 | 无 |
| EmbedTalk | arXiv 2603.07604(2026) | — | — | arXiv CC BY 4.0(论文) | 未确认 | 未确认 | 未确认 | 是 | 无 |
| FA-LAM | arXiv 2607.20922(2026) | — | — | 未确认(未见官方仓库) | 未确认 | 未确认 | 单图 one-shot | 是 | 无 |
| FlexAvatar | CVPR 2026 | — | — | 未确认(未见官方仓库) | 未确认 | 未确认 | 单图/稀疏图,无需相机位姿与表情标签;10 秒微调 | 实时形变 | 无 |
| GaussianHeadTalk | WACV 2026 | 无仓库 | — | 未确认 | 未确认 | 未确认 | 单目视频 + 音频 | 是 | 无 |
2026 新论文来源:FlexAvatar (CVPR 2026) · Multi-view Consistent 3D Gaussian Head Avatars without Multi-view Generation (CVPR 2026)
一句话总结这一栏:能做 16GB 实时的是 NanoAvatar(权重禁商用)与 LAM(Apache-2.0,见下节);其余要么许可禁止商用,要么在 sm_120 上跑不起来,要么根本没有代码。
| 项目 | Star | 最近 push | 许可 | 16GB 可行性 | 结论 |
|---|---|---|---|---|---|
| LAM(阿里通义,SIGGRAPH 2025) | — | 活跃(MeshLAM/CVPR 2026 续作) | Apache-2.0 ✅ | 单图推理,秒级,极低;驱动与渲染无神经网络,WebGL,手机 120FPS | ★ 本块唯一「许可干净 + 16GB 随便跑 + 真 3DGS」的组合 |
| LAM-Audio2Expression | — | 2025-05 | Apache-2.0 ✅ | 实时音频→ARKit blendshape | 与 LAM + OpenAvatarChat 已打通端到端 |
| LHM(阿里通义,ICCV 2025) | — | 2026-03(LHM++ 开源) | Apache-2.0 ✅ | LHM++ 8 视角输入仅需 8GB | 单图→可动人体,非头部专用 |
| TripoSG | 1798 | 2025-04-18 | MIT(代码 + HF 权重均 MIT)✅ | README:最低 8GB VRAM → 16GB 轻松(只出形状,无纹理) | ★ 资产首选 |
| TripoSR | 6968 | 2026-06-04 | MIT ✅ | 低 | 轻量单图→网格 |
| TRELLIS v1 | 13691 | 2026-06-26 | MIT ✅ | README 要求 ≥16GB(A100/A6000 验证)→ 正好卡下限;需 Blackwell 重建路径 | 可跑但折腾 |
| TRELLIS.2(microsoft/TRELLIS.2-4B) | 11310 | 2026-07-10 | MIT(代码 + 权重)✅ · HF 卡 license: mit | 官方要求 ≥24GB,仅验证 A100/H100 → 16GB 官方不支持(repo,arXiv 2512.14692) | 与 16GB 卡无缘(官方口径) |
| Step1X-3D | 889 | 2025-09-08 | Apache-2.0 ✅ | README 表格:几何+纹理 27~29GB → 不可行 | 16GB 不可行 |
| Hunyuan3D 2.0 | 14936 | 2025-10-28 | Tencent Hunyuan 3D 2.0 Community License(排 EU/UK/KR;>100 万 MAU 须申请;禁止用输出改进其他模型) | README:形状 6GB / 形状+纹理合计 16GB | 卡边缘可跑 |
| Hunyuan3D 2.1 | 4053 | 2025-10-17 | 同族 2.1 版(同样排 EU/UK/KR) | README:形状 10GB / 纹理 21GB / 合计 29GB;--low_vram_mode 只降到 21GB → 16GB 只能出白模,纹理阶段必 OOM | 半可用 |
| Hunyuan3D-Omni | — | 2025-09-23 | Tencent Hunyuan 社区许可(排 EU/UK/KR) | HF 卡:10GB | 可跑 |
| Hunyuan3D 2.5 | — | — | 从未开源权重,仅 arXiv 2506.16504 技术报告;腾讯云 API 提供且2026-09-22 停止新购、2026-10-20 全量下线(迁移至 HY-3D-3.1) | — | 不可用 |
| Hunyuan3D 3.0 / 3.1 | — | — | 闭源商业。3.0 于 2026-02-13 以 ComfyUI Partner Nodes(云 API) 上线;3.1 在腾讯云 TokenHub | — | 不可用 |
| Rodin / Hyper3D(Deemos) | — | — | 闭源商业 API | — | 无开放权重 |
| RodinHD(微软+中科大 ECCV24) | 214 | 2025-01-15 | 未确认;训练数据因组织政策不公开 | V100 训练 | 头像向,但闭数据 |
| Pixal3D(SIGGRAPH 2026, TencentARC+清华) | — | 2026 | 未确认 | 基于 TRELLIS.2 backbone → 24GB 级 | 与 16GB 无缘 |
| SAM 3D Objects | 7439 | 2026-06-02 | SAM License(允许使用/分发/衍生,未禁商用,但受出口管制/军事用途限制,非 OSI 标准) | 2026-06-01 放出 encoder 权重;可直接导出 gaussian splat | 可用但非标准开源 |
| SAM 3D Body | 3547 | 2026-02-19 | SAM License | 单图人体网格 | 可用于人体重建 |
| MeshGPT 类 | — | — | — | — | 未检索到 2026 新开源进展 → 未确认 |
关键许可原文:Hunyuan3D-2.0 LICENSE · Hunyuan3D-2.1 LICENSE · HF 镜像同文:tencent/Hunyuan3D-2 · tencent/Hunyuan3D-2.1 · Hunyuan3D 3.0 上线 ComfyUI Partner Nodes:blog.comfy.org · Hunyuan3D 2.1 显存口径:Tencent Cloud techpedia · TripoSG README · TRELLIS README · LAM README · LAM LICENSE (Apache-2.0) · LHM README
「权重开放但禁商用」清单(3D 侧):Gaussian-Head-Avatar(清华,最严)、GaussianAvatars(Toyota, CC-BY-NC-SA)、SplattingAvatar(CC BY-NC-SA)、INSTA、TalkingGaussian / InsTaG / EmoTaG(research only)、NanoAvatar 权重(CC BY-NC 4.0)。外加所有 FLAME / BFM / SMPL 基础模型——它们本身就是非商用研究许可,是整条 3D 头像链的「上游污染源」。
真·可商用开源(3D 侧):LAM / LHM(Apache-2.0)、TripoSG、TripoSR、TRELLIS v1/v2(MIT)、Step1X-3D(Apache-2.0)、SAM 3D(SAM License,非 OSI)。 受限可商用:Hunyuan3D 2.x(排除 EU/UK/韩国 + 100 万 MAU 门槛 + 禁止用输出改进其他模型)。
| 项目 | Star | 最近 push | 许可 | 16GB / sm_120 |
|---|---|---|---|---|
| graphdeco-inria/gaussian-splatting(原版 3DGS) | 23940 | 活跃 | INRIA 自定义(非商用) | sm_120 有社区成功记录(issue #1215),但原版许可非商用 |
| MonoGS(Gaussian Splatting SLAM, CVPR24 Highlight) | 2164 | 2024-08-07 | 未确认 | RTX 4090 测试;dev.speedup 支达 10fps |
| Photo-SLAM(CVPR 2024) | 768 | 2024-06-12 | 未确认 | C++/CUDA,需 LibTorch ≤2.1.2 + 自行编译 OpenCV(with CUDA/contrib) → 构建门槛高 |
| Splat-SLAM(google-research) | 364 | 2025-01-05 | Apache-2.0 ✅ | 硬要求 CUDA 11.7 + pytorch 1.12 → sm_120 不可行 |
手机视频 → 人物 3DGS 的实用流水线:① FLAME/SMPL-X 跟踪配准(VHAP / metrical-tracker,都要学术注册)→ ② 抠像(RobustVideoMatting / EasyPortrait)→ ③ 相机位姿预处理(IMavatar 式)→ ④ 训练 mesh-embedded 3DGS(GaussianAvatars / SplattingAvatar)。注意第 ① 步的 FLAME/BFM 许可即已堵死商用,第 ④ 步的仓库许可也基本全非商用。 移动端方向可参考 HoloMobile(单目视频→紧凑动态高斯)。
| 路线 | 素材需求 | 训练量级 |
|---|---|---|
| Person-specific 3DGS 说话头(GaussianTalker / SyncTalk / TalkingGaussian) | 1~5 分钟 512²/25fps 单目视频 | GaussianTalker 10k 迭代;SyncTalk 60k + 100k finetune(各仓库统一小时数未确认) |
| Few-shot(InsTaG / EmoTaG) | 10 秒 / 5 秒(125 帧) 适配 | EmoTaG 适配 20k 迭代 |
| 单图 one-shot(LAM / FlexAvatar) | 1 张图(FlexAvatar 另有 10 秒精修) | LAM 无需训练(前向一次);FlexAvatar 10 秒微调 |
| 中文综述口径 | 「这类方法需要目标人物数分钟的音视频数据进行专属拟合优化」 | — |
来源:《音频驱动的数字人技术进展》,《中国图象图形学报》2026 年第 31 卷第 7 期,PDF(原文:特定人优化模型「需要目标人物数分钟的音视频数据进行专属拟合优化」;3DGS 路线「核心挑战仍集中在动态一致性与可编辑性……容易出现高斯漂移、密度分布不稳定或局部撕裂」)
3D 侧目前没有现成的「LLM + TTS + 3DGS 音频驱动」端到端开源方案——需要自己把音频驱动渲染接到流式 TTS 后面。
唯一的例外是阿里 LAM 生态,它已经打通:
来源:LAM README 的 News 区块、LAM_Audio2Expression README、OpenAvatarChat
这是 2026 年唯一「个人开发者用 16GB 卡 + Apache-2.0 + 真 3DGS + 实时对话」能走通的路径。 其余 2D 路线(见第二块)开箱即用度更高。
答:不该当主线;只做两个单点。
不该当主线的 4 个理由:
该做的两个单点(都是 Apache-2.0/MIT,都能在 16GB 上跑):
决策口诀:想出片/变现 → 走 2D(第二块);想做技术储备/差异化的 3D 形象 → 用 LAM + TripoSG;不要把时间投入到 person-specific 3DGS 说话头训练上。
HeyGem.ai = Duix.Avatar,是同一个仓库的新旧名。
github.com/GuijiAI/HeyGem.ai现 301 跳转到github.com/duixcom/Duix-Avatar(同一 repo id907627874)。中文互联网上大量「HeyGem vs Duix」的对比文章都已过时。 核查方式:GuijiAI/HeyGem.ai 的 raw LICENSE 与 duixcom/Duix-Avatar LICENSE 内容一致,均为 «DUIX.COM COMMUNITY LICENSE AGREEMENT»。
| 项目 | Star | 最近更新 | 许可证 | 可商用 | 显存(16GB 卡) | 部署难度 | 功能(口播/直播/实时对话/唇形/声克隆) | 中文资料 | 推荐度 |
|---|---|---|---|---|---|---|---|---|---|
| Duix.Avatar(原 HeyGem.ai) | 15547 | 2026-04-21(趋缓) | DUIX.COM Community License(自定义,GitHub 标 NOASSERTION) | ⚠️ 有条件:LICENSE 写 MAU>1000 须商业授权;README 却写 10 万用户/1000 万美元营收 → 自相矛盾,以 LICENSE 为准 | 官方推荐 RTX 4070 12GB;社区称 8GB 可用;镜像约 70GB + 磁盘 100GB | ★★☆☆☆ Docker Compose 一键(有 5090 专用 compose) | ✅✅ / ❌ / ❌ / ✅✅ / ✅✅ | 极丰富 | ⭐⭐⭐⭐ |
| Duix Mobile(duix.ai) | — | — | DUIX.COM Community License | ⚠️ 有条件(MAU>1000) | 端侧(手机),不占 PC 显存 | ★★☆☆☆ SDK 集成 | ❌ / ❌ / ✅✅ / ✅ / ⚪ | 中 | ⭐⭐(仅移动端/车机) |
| Linly-Talker | 3453 | 2026-02-10 | MIT(但组件传染) | ⚠️ 代码可,权重不可(默认打包非商用 Wav2Lip) | 未确认(分模型) | ★★★★☆ 需编译 NeRF + pytorch3d | ✅ / ❌ / ✅ / ✅ / ✅ | 极丰富 | ⭐⭐⭐ |
| Linly-Talker-Stream | — | 2026-02 | Apache-2.0 | ⚠️ 同上(仍用 Wav2Lip) | 未确认 | ★★★☆☆ 一键 setup-env.sh | ❌ / ⚪ / ✅✅ / ✅ / ✅ | 中 | ⭐⭐⭐ |
| Fay | 13545 | 2026-09-21(最活跃) | GPL-3.0 | ✅ 可(但传染性强) | 自身不占,由外接模型决定 | ★★☆☆☆ pip 安装 | ❌ / ✅✅ / ✅✅ / ⚪ / ⚪ | 极丰富 | ⭐⭐⭐⭐ |
| OpenAvatarChat | 3773 | 2026-07-31 | Apache-2.0 | ✅ 明确可(依赖 LiteAvatar=MIT、MuseTalk=MIT、FlashHead=Apache-2.0、CosyVoice=Apache-2.0) | LiteAvatar 社区实测仅 4GB;MuseTalk ≥12GB | ★★☆☆☆ uv run install.py 一站式 | ❌ / ⚪ / ✅✅✅(2.2s)/ ✅ / ✅ | 很好 | ⭐⭐⭐⭐⭐ |
| AigcPanel | 5574 | 2026-09-18 | Apache-2.0(Pro/VIP 功能收费) | ✅ 软件可(所挂模型各自许可,含非商用 Wav2Lip) | 由所挂模型决定(Heygem 一键包 8GB) | ★☆☆☆☆ 桌面 App + 模型市场一键包 | ✅✅ / ✅(VIP) / ❌ / ✅✅ / ✅✅ | 极丰富 | ⭐⭐⭐⭐⭐ |
| SadTalker | 14098 | 2024-06-26(停更 2 年+) | Apache-2.0 except 第三方(清单未列出,法律文本不完整) | ⚠️ 代码可;权重含非商用 Wav2Lip + s3fd | 未确认(偏低) | ★★★☆☆ 锁 Py3.8 + cu113,sm_120 不友好 | ✅ / ❌ / ❌ / ✅ / ❌ | 中上 | ⭐⭐ |
| EchoMimic V1 | 4300 | 2026-04-07 | Apache-2.0 | ✅ 可 | V100 16G 可跑 | ★★★☆☆ | ✅ / ❌ / ❌ / ✅ / ❌ | 好 | ⭐⭐⭐ |
| EchoMimic V2 | 4657 | 2026-02-23 | Apache-2.0 | ✅ 可 | 4090D 24G / V100 16G | ★★★☆☆ | ✅ / ❌ / ❌ / ✅✅ / ❌ | 好 | ⭐⭐⭐⭐ |
| EchoMimic V3 / Flash | 1061 | 2026-03-18 | Apache-2.0(README 声明;根目录无 LICENSE 文件) | ✅ 可("We claim no rights over your generated contents") | preview 12GB / Flash 12GB、768×768 ✅ | ★★★☆☆ Linux 脚本 / Windows 网盘一键包 | ✅✅ / ❌ / ❌ / ✅✅✅ / ❌ | 好 | ⭐⭐⭐⭐⭐ |
| MuseTalk | 6604 | 2025-09-26 | MIT(代码 + 权重) | ✅ 明确可(README:model "available for any purpose, even commercially") | 4GB 可跑 ✅✅ | ★★★☆☆ 需 mmcv/mmpose + ffmpeg | ⚪ / ❌ / ✅(30fps+) / ✅✅ / ❌ | 好 | ⭐⭐⭐⭐ |
| LatentSync | 6090 | 2025-06-20 | Apache-2.0 | ✅(SD 系权重需另查) | 偏高,官方未给单卡数值 → 未确认 | ★★★☆☆ | ⚪ / ❌ / ❌ / ✅✅✅ / ❌ | 中 | ⭐⭐⭐ |
| Wav2Lip | — | 老项目 | 自定义(无标准协议) | ❌ 明确禁止商用(README 双重声明,LRS2 训练) | 极低 | ★★☆☆☆ | ⚪ / ❌ / ❌ / ✅ / ❌ | 多 | ⭐(仅研究) |
| LivePortrait | 19084 | 2026-06-01 | MIT 但带保留 | ⚠️ 必须替换 InsightFace 检测模型才可商用 | 很低(1–2GB)✅ | ★★☆☆☆ | ⚪ / ❌ / ❌ / ⚪ / ❌ | 多 | ⭐⭐⭐ |
| Sonic | 3274 | 2026-01-08 | CC-BY-NC-SA 4.0 | ❌ 禁止商用 | 中 | ★★★☆☆ | ✅ / ❌ / ❌ / ✅ / ❌ | 少 | ⭐ |
| Hallo / Hallo2 | — | — | MIT | ✅ | 中 | ★★★☆☆ | ✅ / ❌ / ❌ / ✅ / ❌ | 中 | ⭐⭐⭐ |
| OpenTalking(2026 新) | 3056 | 2026-09-04(2026-04 建仓) | Apache-2.0 | ✅ | quicktalk 在 3090 实测 ~3.8 GiB、~35fps ✅✅ | ★★★☆☆ uv + Docker Compose | ❌ / ⚪ / ✅✅ / ✅ / ✅ | 好(中文优先) | ⭐⭐⭐⭐⭐ |
| SoulX-FlashHead(2026 新) | 1078 | 2026-05-28 | Apache-2.0 | ✅ | Lite 单 4090 实时(96FPS/3 路) ✅;Pro 需双 5090 → 16GB 跑不动 | ★★★☆☆ 需编译 flash-attn | ❌ / ⚪ / ✅✅ / ✅ / ❌ | 中 | ⭐⭐⭐⭐ |
| LongCat-Video-Avatar 1.5(2026 新,美团) | ~4634 | 2026-05(1.5 版) | MIT(repos LICENSE,Copyright (c) 2025 Meituan) | ✅ 可商用 | ❌ 最低 2×A100 80G;INT8 量化仍需 ~40GB | ★★★★★ | ✅✅ / ❌ / ❌ / ✅✅ / ❌ | 中 | ⭐⭐(16GB 不可行) |
| LiveTalking | ~9600 | 活跃 | Apache-2.0 + 水印附加条款 | ⚠️ 可,但声明发布视频须带 LiveTalking 水印和标识 | wav2lip256 @3060=60fps | ★★☆☆☆ | ⚪ / ✅✅ / ✅✅ / ✅ / ✅ | 多 | ⭐⭐⭐⭐ |
| LingCast(灵播) | — | 2026 | 未确认 | 未确认 | 低(CPU 亦可,Wav2Lip ONNX 35fps+) | ★★★★☆ 三微服务 + Docker | ✅ / ✅✅ / ✅ / ✅ / ❌ | 中 | ⭐⭐⭐(直播架构参考) |
| OmniHuman-1 / 1.5(字节) | ❌ 未开源 | — | 仅论文(ICCV 2025) | ❌ | — | — | — | — | ❌ 不可用 |
| HeiXia2077/live-avatar | — | 2026-08 | 未确认 | 未确认 | 全本地中文语音对话数字人 | — | ✅ / ❌ / ✅ / ✅ / ⚪ | 中文 | ⭐⭐⭐(可抄作业) |
Duix.Avatar(原 HeyGem.ai)— 许可最需要读原文的一个 LICENSE 第 2 条原文(来源):
"Additional Commercial Terms. If ... either (a) the Monthly Active Users of the products or services made available by or for Licensee ... is greater than 1 thousand in the preceding calendar month, or (b) your product incorporating DUIX.COM Materials has greater than 1 thousand Monthly Active Users, you must request a commercial license from DUIX.COM..."
但同一仓库 README_zh 写「支持全球免费商用(用户量超过 10 万或年营收达 1000 万美元以上的企业需签署商业许可协议)」→ LICENSE vs README 阈值冲突(1000 vs 10 万)。LICENSE 是法律文件,保守按 1,000 MAU 评估。
其他常被忽略的附加义务:
功能边界:Duix.Avatar 的官方 README 明确写「数字人实现的是克隆和非实时视频合成,如需交互请访问 duix.com」→ 它不做实时对话,只做离线口播视频。
Duix Mobile(duix.ai):是实时交互 SDK(Android/iOS/车机/大屏,端侧 <120ms),但仓库只提供 4 个公共形象(Leo/Oliver/Sofia/Lily),自定义形象需邮件 support@duix.com 付费定制(官方口径:提供 15 秒~2 分钟视频通常足够)。所以它是「开源 SDK + 商业定制形象」,不是拿来即用。
Linly-Talker:自身 MIT,但 README 明确警告 "In addition to adhering to the MIT License, ensure that you comply with all license agreements for any referenced models and components." 而它默认打包了 Wav2Lip 权重(明确禁止商用) 与 SadTalker 依赖链的 s3fd 等 → 默认配置下整体不可商用,必须替换权重。
Fay:不是视频生成器,而是数字人「大脑+总线」的 agent 框架(向上适配数字人模型、向下接 LLM)。GPL-3.0 允许商用,但传染性强——若你分发修改后的 Fay 或衍生作品,必须以 GPL-3.0 开源。自用/内部部署无此约束。
OpenAvatarChat:主项目 Apache-2.0,依赖链(LiteAvatar=MIT、MuseTalk=MIT、SoulX-FlashHead=Apache-2.0、CosyVoice=Apache-2.0、SenseVoice=Apache-2.0、silero-vad=MIT、wav2vec2=MIT)全链路无一处「禁止商用」,这在开源数字人里非常罕见。但默认预置配置用阿里云百炼 API 做 LLM+TTS(需 DASHSCOPE_API_KEY),不是全离线;想零 API 费用需自己换本地 LLM + 本地 CosyVoice。0.6.0(2026-04)重构为前后端分离,全数字人支持双工打断。
AigcPanel:软件本体 Apache-2.0,但 Pro/VIP 功能(可视化工作流、智能直播、云端模型服务)收费 → 「开源核心 + 闭源增值」。集成的视频模型为 MuseTalk / LatentSync / Wav2Lip / Heygem → 商用须避开 Wav2Lip 与 Heygem,固定选 MuseTalk 或 LatentSync。
SadTalker:README Highlights 首条写 "The license has been updated to Apache 2.0, and we've removed the non-commercial restriction";但它的 checkpoint 包捆了 wav2lip.pth,且 LICENSE 只说 "except for the third-party components listed below" 却没有实际列出清单(法律文本不完整)。代码许可 ≠ 可用。
EchoMimic 全家桶(重要澄清):不是 CC-BY-NC,也不是「仅限研究」。V1/V2 有 LICENSE 文件原文为 Apache-2.0;V3 根目录无 LICENSE 文件但 README 的「📜 License」章节明确写 "The models in this repository are licensed under the Apache 2.0 License. We claim no rights over your generated contents"。三个 README 都保留 "intended for academic research" 的 Disclaimer(免责声明,用户自担责任)——这是免责声明,不是授权限制,Apache-2.0 授权优先。这是中文社区误传最多的一条。
LivePortrait(最容易踩的坑):19k star,很多人以为 MIT 就直接商用。但 LICENSE 原文明确:
"The code of InsightFace is released under the MIT License. The models of InsightFace are for non-commercial research purposes only. If you want to use the LivePortrait project for commercial purposes, you should remove and replace InsightFace's detection models to fully comply with the MIT license."
.exe / macOS .dmg / Linux .AppImage + .deb),打开软件 → 模型市场下载一键启动包 → 直接用。零 Docker、零编译,Ubuntu 直接用 AppImage。还带 CLI(aigcpanel serverCall)便于脚本集成。必须操作:商用场景在 AigcPanel 里固定选 MuseTalk 或 LatentSync 作为口型引擎,不要用 Wav2Lip / Heygem。智能直播、可视化工作流、云端模型服务属 VIP 付费功能。
备选(更看重最终画质、且能接受读许可原文):Duix.Avatar(原 HeyGem)。口型效果公认第一梯队,Docker Compose 一键、有 5090 专用 compose、中文教程铺天盖地。但请按 LICENSE 的 1,000 MAU 阈值(而非 README 的 10 万)评估商用风险,并准备履行 "Built with DUIX.COM" 署名义务。
uv run install.py --config xxx.yaml 自动解析依赖、合并版本冲突、给 flash-attn 加 --no-build-isolation;uv run scripts/download_models.py 统一下模型(国内自动走 ModelScope + hf-mirror)。必须注意:默认配置用阿里云百炼 API(需 DASHSCOPE_API_KEY),不是全离线;MuseTalk 路线要 ≥12GB、FlashHead Pro 要双 5090 → 16GB 卡上 LiteAvatar 是唯一稳妥选择;LAM_Audio2Expression 已核实为 Apache-2.0 ✅。
并列备选:OpenTalking(3056 star,2026-04 新项目,Apache-2.0,quicktalk 在 3090 上 ~3.8GiB / ~35fps,带完整 WebRTC 前后端 + 形象库上传 UI,中文优先)。
直播推流场景:编排层选 Fay(GPL-3.0,13.5k star,日更),画面驱动选 LiveTalking(Apache-2.0,wav2lip256 在 3060 上 60fps,原生 WebRTC/RTMP/虚拟摄像头)或参考 LingCast 架构。注意 LiveTalking 的水印附加条款与 Fay 的 GPL-3.0 传染性。
LAM 3D 路线:OpenAvatarChat 内已有 LAM WebGL Interactive Chatting Avatar SDK + Avatar Export 工具,是「真 3DGS 实时对话」的落点。
| 类别 | 典型许可证 | 商用 | 义务 |
|---|---|---|---|
| 宽松开源 | Apache-2.0 / MIT / BSD | ✅ 自由商用 | 保留版权与许可声明;Apache-2.0 另含专利授权与 NOTICE 要求 |
| 署名/传染型 CC | CC-BY-4.0 / CC-BY-SA-4.0 | ✅(BY-SA 有传染) | 必须署名;SA 要求衍生同许可 |
| 非商业 CC | CC-BY-NC-4.0 / CC-BY-NC-SA-4.0 | ❌ 禁止商用 | 定义:"NonCommercial means not primarily intended for or directed towards commercial advantage or monetary compensation" |
| 自定义社区许可 | Tencent Hunyuan Community License / DUIX.COM Community License / Llama 系 / OpenRAIL-M | ⚠️ 有条件 | 常见条款:地域排除(EU/UK/韩国)、MAU 门槛(1000 / 100 万)、强制署名("Powered by…" / "Built with…")、禁止用输出改进其他模型、AUP 附加限制 |
| Copyleft | GPL-3.0 / AGPL-3.0 | ✅ 但传染 | 分发衍生作品须同许可开源;AGPL 还覆盖网络服务 |
| 无许可证 | 仓库无 LICENSE 文件 | ❌ 默认保留所有权利 | 法律上不可用(不是「开源」) |
⚠️ 关于「无 LICENSE 文件」:本次调研中,大量 3DGS 研究仓库根本没有 LICENSE 文件(GaussianTalker、HeadGaS、TensorialGaussianAvatar、gaussian-head 等均 404)。按伯尔尼公约,无许可 = 保留所有权利 = 不能合法使用,这是「看着开源」的终极形态。
| 模型 / 项目 | 许可证 | 可商用判断 | 关键约束(原文要点) |
|---|---|---|---|
| Wav2Lip | 自定义(无标准协议) | ❌ 禁止商用 | "should only be used for research/academic/personal purposes only ... any form of commercial use is strictly prohibited";"can only be used for personal/research/non-commercial purposes" |
| Sonic | CC-BY-NC-SA 4.0 | ❌ 禁止商用 | LICENSE 原文 为完整 CC BY-NC-SA 4.0 文本 |
| LivePortrait | MIT(代码)+ InsightFace 模型非商用 | ⚠️ 须替换 InsightFace 检测模型 | "The models of InsightFace are for non-commercial research purposes only. If you want to use the LivePortrait project for commercial purposes, you should remove and replace InsightFace's detection models" |
| InsightFace | 代码 MIT / 模型非商用 | ⚠️ 模型禁止商用 | 官方站点明确模型许可与代码许可分离 |
| SadTalker | Apache-2.0 except 第三方(清单缺失) | ⚠️ 代码可,权重含非商用 Wav2Lip + s3fd | README:"removed the non-commercial restriction";但 checkpoint 含 wav2lip.pth |
| MuseTalk | MIT(代码 + 权重) | ✅ 明确可商用 | "code: MIT, no limitation for both academic and commercial usage; model: available for any purpose, even commercially";注意 S3FD/face-alignment 等第三方检测器需各自遵守 |
| LatentSync | Apache-2.0 | ✅(SD 系权重需另查) | — |
| EchoMimic V1 / V2 / V3 | Apache-2.0(V3 为 README 声明) | ✅ 可商用 | V3 README:"The models in this repository are licensed under the Apache 2.0 License. We claim no rights over your generated contents";V1/V2 有 LICENSE 文件原文 |
| Hallo / Hallo2 | MIT | ✅ 可商用 | — |
| VideoReTalking | Apache-2.0 | ✅(组件需查) | — |
| Linly-Talker | MIT(代码) | ⚠️ 代码可,默认打包非商用权重 | README:须同时遵守所有引用模型的许可协议 |
| Fay | GPL-3.0 | ✅ 可(传染) | 闭源分发有风险 |
| Duix.Avatar / HeyGem.ai | DUIX.COM Community License | ⚠️ 有条件(MAU>1000 须商业授权) | 另需 "Built with DUIX.COM" 署名、Notice 文件、模型名以 DUIX.COM 开头、§5(c) 授予 DUIX 对你案例的永久免费使用权 |
| OpenAvatarChat | Apache-2.0 | ✅ 可商用 | 依赖链全干净(LiteAvatar MIT / MuseTalk MIT / FlashHead Apache-2.0 / CosyVoice Apache-2.0) |
| AigcPanel | Apache-2.0 | ✅ 软件可(Pro/VIP 收费) | 集成的 Wav2Lip/Heygem 各自受限 |
| LAM / LHM / LAM_Audio2Expression | Apache-2.0 | ✅ 可商用 | — |
| TripoSG / TripoSR | MIT | ✅ 可商用 | — |
| TRELLIS / TRELLIS.2 | MIT(代码 + 权重) | ✅ 可商用 | HF 卡 license: mit |
| Step1X-3D | Apache-2.0 | ✅ 可商用 | — |
| Splat-SLAM | Apache-2.0 | ✅(但 sm_120 不可行) | — |
| SAM 3D | SAM License | ⚠️ 未禁商用但非 OSI 标准开源 | 受出口管制、军事用途等限制 |
| Gaussian-Head-Avatar | 清华非商用许可 | ❌ 禁止任何商业用途 | 明确禁止用于训练商用模型 |
| GaussianAvatars / SplattingAvatar | CC-BY-NC-SA-4.0 | ❌ 禁止商用 | GaussianAvatars 另有 Toyota 限制 |
| TalkingGaussian / InsTaG / EmoTaG | research only | ❌ 禁止商用 | — |
| NanoAvatar | 代码 MIT / 权重 CC BY-NC 4.0 | ⚠️ 代码可,权重禁止商用 | 典型的「代码许可与权重许可分离」 |
| FLAME / BFM / SMPL(-X) | 各自研究许可 | ❌ 非商用 | 3D 人脸/人体链的上游污染源——几乎所有 3DGS 说话头都依赖它 |
| INRIA 3DGS 原版 | 自定义 | ❌ 非商用 | GaussianTalker 等依赖它 |
| MiniMax M2 / M2.5 | MIT | ✅ 可商用 | 2025-10 / 2026-02 发布 |
| MiniMax M2.7(2026-04) | NON-COMMERCIAL LICENSE(自称 "Modified-MIT") | ❌ 商用须事先书面授权 | 商业用途须显著标注 "Built with MiniMax M2.7";自托管编程豁免 |
| Qwen3.8-27B(2026-08) | Apache-2.0 | ✅ 可商用 | 实测 HF LICENSE 为标准 Apache-2.0 全文 |
| Qwen3.8-Max / 2.4T-A95B(2026-08) | 自定义 Qwen3.8-Max License | ⚠️ 有条件 | MaaS/AI Work Assistant 业务累计 12 个月收入 > 5000 万美元须另行授权;MAU>1 亿或月收入>2000 万美元须 UI 署名;内部使用豁免 |
| Qwen3.8-Flash-Next(2026-08-24) | Qwen Community License 1.0 | ⚠️ 有条件(更严) | MaaS 或 AI Work Assistant 业务,无收入门槛,商用前即须取得 Qwen 单独许可;署名门槛 MAU>1 亿或月收入>2000 万美元 |
| Kimi K3(月之暗面) | 自定义 | ⚠️ 有条件 | 年收入 > 2000 万美元即触发商业合同,报道称收入分成最高 30% |
以 Hunyuan3D 2.0 / 2.1 Community License 原文(2.0、2.1)为例:
① 地域排除(最需要注意) "THIS LICENSE AGREEMENT DOES NOT APPLY IN THE EUROPEAN UNION, UNITED KINGDOM AND SOUTH KOREA AND IS EXPRESSLY LIMITED TO THE TERRITORY, AS DEFINED BELOW." §1.l "Territory" shall mean the worldwide territory, excluding the territory of the European Union, United Kingdom and South Korea." §5.c "You must not use, reproduce, modify, distribute, or display the … Works, Output or results … outside the Territory. Any such use outside the Territory is unlicensed and unauthorized."
② MAU 门槛 §4 "If … the monthly active users of all products or services made available by or for Licensee is greater than 1 million monthly active users in the preceding calendar month, You must request a license from Tencent … and You are not authorized to exercise any of the rights under this Agreement unless or until Tencent otherwise expressly grants You such rights."
③ 禁止用其输出改进其他模型 §5.b "You must not use the … Works or any Output or results of the … Works to improve any other AI model (other than Tencent Hunyuan … or Model Derivatives thereof)."
其他义务:§3.a 须向第三方提供本协议副本;§3.b 修改文件须显著标注;§3.c 鼓励(非强制)发布博客并标注 "Powered by Tencent Hunyuan";§3.d 分发须附 Notice 文本文件;§3.e 若向第三方提供服务,须清晰准确披露实际提供方的法定全名,并声明腾讯未关联/未背书;§6.b 不授予商标许可;§6.a 腾讯不主张你对输出(Outputs)的权利(这一点对创作者友好)。
适用范围:Hunyuan3D 2.0 / 2.1 / Omni / Part、HunyuanVideo-Avatar(LICENSE,同族条款,Release Date 2025-05-28)、HunyuanWorld-1.0(LICENSE,2025-07-27)、HunyuanWorld 2.0 / HY-World-2.0 等。
结论:用混元做面向中国大陆的商业数字人通常可行(个人开发者远低于 100 万 MAU);但产品要出海到欧盟/英国/韩国就违反许可;且不能拿混元的输出(如 3D 模型、视频)去训练你自己的模型。做商业数字人时还要在界面上披露你自己是服务提供方。
| 版本 | 权重状态 | 许可 |
|---|---|---|
| Wan 2.1 / 2.2(含 TI2V-5B、T2V-A14B、I2V-A14B、Animate-2-14B) | 开放权重 | Apache-2.0(Wan2.1 LICENSE.txt 原文为标准 Apache-2.0 全文) |
| Wan 2.5 | 无公开权重 | API-only(阿里云百炼 / fal / Replicate) |
| Wan 3.0 | 无公开权重 | API-only(2026-08 上线 fal / Replicate / 8frame) |
核查方法(可自行复现,来自 8frame 2026-08-28 的核查文章):
curl "https://huggingface.co/api/models?author=Wan-AI&sort=createdAt&direction=-1"
实测最新仓库依次为 Wan2.2-Animate-2-14B-Distilled-Diffusers、Wan2.2-Animate-2-14B-Diffusers(2026-08-06)、Wan2.2-Animate-2-14B(2026-07-14)、Wan-Dancer-14B(2026-07-10),其后是 2025 年的 Wan 2.2 / 2.1。没有 2.5,也没有 3.0。
本次调研独立复核(经 hf-mirror API)结果一致:Wan-AI 组织下最新仓库为 2026-08-06 的
Wan2.2-Animate-2-14B-Diffusers/Wan2.2-Animate-2-14B-Distilled-Diffusers,无 2.5/3.0 权重仓库。
注意:Wan 官方模型卡另有可接受使用政策(禁止违法、色情、名人换脸等),Apache-2.0 是代码/权重的版权许可,不豁免 AUP 与本地法律(如中国的深度合成标识义务)。做商业数字人换脸尤其要看这一层。
| 模型 | 许可 | 核查 |
|---|---|---|
| LongCat-Flash-Chat | MIT(Copyright (c) 2025 Meituan) | HF LICENSE 原文 |
| LongCat-Video-Avatar-1.5(2026-05,13.6B DiT 音频驱动数字人) | MIT | HF repo、鲸智社区模型页 标注「开源许可证:mit」 |
| LongCat-2.0 / Flash-Lite / Image / AudioDiT 等 | 以各自模型卡为准 | 多数为 MIT |
但:LongCat-Video-Avatar-1.5 虽许可最宽松(MIT),算力门槛却是全场最高——最低 2×A100 80G,INT8 量化仍需约 40GB,单张 5060 Ti 16GB 完全不可行。这是「开源省的是授权费,不是算力费」的最好例证。
| 系列 | 状态 |
|---|---|
| 字节 OmniHuman-1 / 1.5 | ❌ 未开源——仅论文(arXiv 2508.19209 / ICCV 2025),只能通过即梦等商业产品使用。注意 julia-cherry/OmniHuman 是同名但无关的 ECCV 2026 数据集项目。 |
| 字节 LatentSync | ✅ Apache-2.0(已开源) |
| 快手 LivePortrait | ⚠️ MIT + InsightFace 模型非商用(见上) |
| 快手可灵 Kling | ❌ 闭源商业 API |
| 字节 Seedream / Seedance | ❌ 闭源商业(即梦 CLI 可调用,非开源权重) |
| 智谱 CogVideoX / GLM | 以各自仓库许可为准(本次未逐条复核 → 未确认) |
| 上海 AI Lab(InternVL 等) | 以各自仓库许可为准(未确认) |
这是本次调研中最值得写进决策文档的一条动向——「中国开源权重 = 永久宽松」的假设在 2026 年已经失效。
① 阿里 Qwen 系列:从 Apache-2.0 转向自定义「收入门槛」许可
署名触发条件:商业产品/服务若 MAU > 1 亿 或 月收入 > 2000 万美元 → 必须在用户界面上显著展示模型名称。
独立商业许可触发条件:若被许可方或其关联方从事 Model as a Service 或 AI Work Assistant 业务,且被许可方及关联方在任意连续 12 个月内累计收入超过 5,000 万美元 → 须事先从 Qwen 获得单独许可才能将本软件或其衍生作品用于任何商业目的。
内部使用豁免:上述要求不适用于内部使用,前提是该使用不使本软件、其输出或其底层模型能力对任何第三方可用。
「Model as a Service」定义为「让第三方访问语言模型推理或微调(如通过 API 或托管端点),使第三方能对输入、参数或训练数据行使有意义的控制」;「AI Work Assistant」定义为「主要设计用于 AI 辅助编程或办公效率的独立 AI 产品(如 Qoder、QwenWork)」,并明确排除单用途工具与域外助手。
⚠️ 关键理解:门槛画在公司总收入上,不是该模型的收入。一家任何业务年收入超 5000 万美元的公司,只要把基于 Qwen3.8-Max 的助手推到客户面前,就落入门槛。 同一家公司用它起草内部备忘录则豁免。
第 2 条:"If the licensee or any of its affiliates conducts a Model as a Service or AI Work Assistant business, the licensee shall obtain a separate license from Qwen before Using the Software … for any commercial purpose."
注意:这一条没有收入门槛。 只要你是 MaaS 或 AI Work Assistant 业务,无论收入多少,商用前都必须先拿到 Qwen 的单独许可(内部使用仍豁免,前提是不让第三方接触软件、输出或底层模型能力)。
第 1 条(署名):商业产品/服务 MAU > 1 亿 或 月收入 > 2000 万美元 → 须在 UI 显著展示模型名。
因此 Qwen 家族目前并存 3 种许可:Apache-2.0(Qwen3.8-27B 等)、Qwen3.8-Max License(带 5000 万美元收入门槛)、Qwen Community License 1.0(MaaS/AI Work Assistant 无门槛即须授权)。下载前必须逐仓库看 LICENSE 文件,不能凭「Qwen 都是 Apache-2.0」的印象。
来源:AI in Asia 分析(2026-08-14)、SCMP:Alibaba adds commercial restrictions to open-weight Qwen3.8-Max、Forkast:Open Weights, Closed Revenue Ceiling
② MiniMax:M2.7 把「MIT」改成了「Non-Commercial」——本次最典型的「看着开源禁止商用」案例
MiniMax 于 2026-04-14 前后变更 M2.7 授权。其 HF LICENSE 原文标题直接就是 NON-COMMERCIAL LICENSE(HF LICENSE 原文,本次实测):
"Non-commercial use permitted based on MIT-style terms; commercial use requires prior written authorization."
第 2 条:If the Software … is used for any Commercial Use, you shall prominently display "Built with MiniMax M2.7" … 第 3 条:Any Commercial Use … is prohibited without obtaining a separate, prior written authorization from MiniMax. 第 5 条 Permitted Free Uses:personal use(含自托管编程)、非营利/学术研究、为上述目的而修改。
背景与争议:MiniMax 于 2025-10 以 MIT 开源 M2、2026-02 以 MIT 发布 M2.5,M2.7 是首次打破完全开源惯例。争议点在于他们把该协议标注为 "Modified-MIT",而 MIT 本身明确允许商用——社区在 Hacker News 与 HF 讨论区批评这是「欺骗性开源」。MiniMax 开发者关系负责人 Ryan Lee 回应称「模型依然是开放的,你依旧可以下载权重、本地运行、微调、二次开发、开展研究、发布非商业项目」,调整的只有商业使用条款;并补充「自托管的 M2.7 用于代码编写是绝对允许且免费的,并且不需要显示 'Built with MiniMax-M2.7'」。
来源:36氪/光通信Pro:MiniMax 修改开源授权被骂疯了、InfoQ 报道、MiniMax-M2.7 HF LICENSE
③ 同类先例
对个人开发者的含义:
依据《互联网信息服务深度合成管理规定》,要求 AI 生成合成内容加显式标识(可被用户感知的文字/图形标记)与隐式标识(元数据中嵌入生成合成信息)。配套强制性国标《网络安全技术 人工智能生成合成内容标识方法》同步实施。
对数字人的影响:你用开源模型生成的数字人口播视频,对外发布时须依法加标识,不能去掉元数据标识。
发布会答记者问逐条披露了《意见》核心内容(最高法官网原文):
第 4 条(数字人创业者必读): "未经同意利用人工智能处理自然人的姓名、肖像等,生成可识别该自然人的虚拟数字形象并使用、公开的,构成对姓名权、肖像权等人格权益的侵害; 未经同意使用自然人声音作为训练语料,模仿其音色、语调和发音风格生成可识别的合成人声的,构成对声音权益的侵害; 操控虚拟形象、合成声音实施不当行为或者发表不实言论、降低他人社会评价的,构成对名誉权的侵害。"
训练数据的合规边界(利好开源训练,但对个人数字人 Clone 更严): "为人工智能模型训练,在合理范围内处理已合法公开的个人信息,且个人未明确拒绝的,一般不认定为侵权。但是,对个人权益有重大影响的,应当依照法律规定取得个人同意。"
仿冒名人带货:"利用人工智能'仿冒名人带货'且构成欺诈,消费者主张惩罚性赔偿的,人民法院依法予以支持。"
避风港规则的参照适用:生成式 AI 自动生成内容侵害人格权益,经权利人通知,服务提供者未及时采取停止生成等必要措施的,应承担侵权责任;用户恶意诱导生成的,用户承担侵权责任。
归责原则:除法律明确规定无过错责任或过错推定责任外,适用过错责任原则。严格将"人工智能产品"限定为以实物为载体的产品(如智能机器人、自动驾驶汽车),将没有实物载体的人工智能服务排除在产品责任之外。
对个人开发者的直接含义:
成都市市场监督管理局发布,明确 AI 生成广告的七项负面清单:
标识要求:AI 生成广告在依法显著标明「广告」的基础上,还应显著清晰标注「本广告使用 AI 技术辅助优化」「广告画面经 AI 处理」「本广告含 AI 虚拟场景」「本广告由 AI 技术生成」「本广告使用 AI 虚拟人」「本广告使用真人虚拟数字形象」等标识。
| 风险场景 | 风险等级 | 建议做法 |
|---|---|---|
| 用自己的照片/视频训练数字人分身 | 低 | 自用/商用均可;建议保留书面自同意声明备档 |
| 用公司员工/签约模特形象 | 中 | 必须签肖像权 + 声音权双重授权,明确授权范围(期限、地域、用途、是否可用于 AI 训练、可否转授权) |
| 用网络公开照片/视频(含网红、素人) | 高 | 依最高法《意见》,「可识别特定自然人的虚拟数字形象」未经同意即侵权——「公开可得」不等于「可授权」 |
| 用明星/名人形象 | 极高 | 一刀切禁止。构成欺诈的可主张惩罚性赔偿(最高法《意见》) |
| 用他人声音做 TTS 声音克隆 | 高 | 最高法《意见》已明确声音权益受保护,须取得同意 |
| 用逝者形象做「AI 复活」 | 高 | 最高法《意见》专门规定依法保护死者的人格利益 |
| 用LRS2 等数据集训练的权重(如 Wav2Lip) | 高 | 该数据集本身有伦理与授权限制,Wav2Lip 因此明确禁止商用 |
| 上传用户照片做数字人(SaaS) | 高 | PIPL 敏感个人信息需单独同意;需明确告知存储期限、是否用于训练;涉及境外用户须做数据出境合规 |
| 生成内容未加标识对外发布 | 中 | 违反《标识办法》,须加显式 + 隐式标识 |
| 在欧盟/英国/韩国部署混元系模型 | 高 | 属于许可明确排除的地域,使用即未经授权 |
按「绝对不能用 → 必须署名 → 必须申请授权」排序。
| # | 红线 | 来源 |
|---|---|---|
| 1 | Wav2Lip 权重严禁任何形式商用。它被广泛打包进 Linly-Talker、SadTalker、AigcPanel 的默认流程里——用了这些平台的默认配置就等于踩线。 | Wav2Lip README("any form of commercial use is strictly prohibited") |
| 2 | Sonic 是 CC-BY-NC-SA 4.0,禁止商用。 | LICENSE 原文 |
| 3 | GaussianAvatars / SplattingAvatar 是 CC-BY-NC-SA-4.0,且 GaussianAvatars 另有 Toyota 限制。 | 仓库 LICENSE |
| 4 | Gaussian-Head-Avatar(清华)明确禁止任何商业用途,且禁止用于训练商用模型。 | 仓库许可 |
| 5 | FLAME / BFM / SMPL(-X) 基础模型本身即非商用研究许可——它是整条 3D 头像链的上游污染源。只要你的 3DGS 头像依赖它,商用就被堵死。 | 各基础模型官方许可 |
| 6 | 仓库没有 LICENSE 文件 ≠ 开源。GaussianTalker、HeadGaS、TensorialGaussianAvatar、gaussian-head 等均无 LICENSE(404)→ 默认保留所有权利,不能合法使用。 | 各仓库根目录核查 |
| 7 | INRIA 原版 3DGS 是非商用许可——GaussianTalker 等一批说话头都建在它之上。 | graphdeco-inria/gaussian-splitting LICENSE |
| 8 | InsightFace 的模型只允许非商业研究用途。LivePortrait 是 MIT 代码,但不替换 InsightFace 检测模型就不能商用——这是 19k star 项目里被绝大多数教程忽略的一条。 | LivePortrait LICENSE |
| 9 | 不能在欧盟 / 英国 / 韩国使用腾讯混元系模型(含 Hunyuan3D 2.x、HunyuanVideo-Avatar、HunyuanWorld)。协议原文:这些地域完全不适用,境外使用「unlicensed and unauthorized」。 | Hunyuan3D-2 LICENSE §1.l / §5.c |
| 10 | 不得使用混元系模型的输出(Output)去改进任何其他 AI 模型(蒸馏、合成数据训练等均被禁止)。 | 同上 §5.b |
| # | 红线 | 来源 |
|---|---|---|
| 11 | Duix.Avatar(原 HeyGem.ai)分发时必须显著展示 "Built with DUIX.COM",须附 Notice 文件,用其材料训练的模型名字要以 "DUIX.COM" 开头;且 §5(c) 授予 DUIX 对你使用案例的永久免费使用权。 | LICENSE 原文 |
| 12 | 混元系若向第三方提供服务,须清晰披露实际服务提供方的法定全名,并声明腾讯未关联/未背书;分发须附协议副本与 Notice。 | Hunyuan LICENSE §3.a / §3.d / §3.e |
| 13 | 发布数字人视频须依法加 AI 标识(显式 + 隐式),尤其广告场景须标注「本广告使用 AI 虚拟人」等。去掉元数据标识属违规。 | 《人工智能生成合成内容标识办法》、《成都市 AI 生成广告合规指引》七项负面清单 |
| 14 | LiveTalking 有附加条款:基于它开发并发布在 B站/视频号/抖音等平台的视频须带 LiveTalking 水印和标识——这不是标准 Apache-2.0 条款。 | LiveTalking README |
| # | 红线 | 来源 |
|---|---|---|
| 15 | Duix.Avatar(原 HeyGem.ai)的 MAU > 1,000 即须向 DUIX.COM 申请商业许可。⚠️ 注意 LICENSE 写 1,000,README 写 10 万,二者冲突——按 LICENSE(法律文本)保守评估。 | LICENSE §2 |
| 16 | 混元系 MAU > 100 万须向腾讯申请许可(个人开发者通常不触发,但 SaaS 规模化后会)。 | Hunyuan LICENSE §4 |
| 17 | Fay 是 GPL-3.0,闭源分发衍生作品即违约;若你的产品需要闭源,不能直接用 Fay。 | LICENSE |
| 18 | AigcPanel 的 Pro/VIP 功能(可视化工作流、智能直播、云端模型服务)不在开源范围。 | AigcPanel README |
| 19 | 「代码许可」与「权重许可」分离是常态:NanoAvatar(代码 MIT / 权重 CC BY-NC 4.0)、LivePortrait(代码 MIT / InsightFace 模型非商用)、SadTalker(Apache-2.0 / 权重含 Wav2Lip)——必须分别核查,不能只看代码 LICENSE。 | 各仓库 |
| 20 | 「看着开源其实禁商用」的终极形态:无 LICENSE 文件。判断一个仓库能否用,第一步永远是 curl -sI .../LICENSE 看是不是 404。 | 方法论 |
| 21 | MiniMax M2.7 是「Non-Commercial License」却标注为 "Modified-MIT"——商业使用须事先取得 MiniMax 书面授权(api@minimax.io),商业用途还须显著标注 "Built with MiniMax M2.7"。⚠️ 同系列的 M2(2025-10)与 M2.5(2026-02)是 MIT,相邻版本许可完全不同。 | HF LICENSE 原文 |
| 22 | Qwen3.8-Max(2026-08)不再是 Apache-2.0,改为自定义许可:从事 MaaS 或 AI Work Assistant 业务且累计 12 个月收入 > 5000 万美元须另行取得商业许可;MAU > 1 亿或月收入 > 2000 万美元须在 UI 显著展示模型名。(对比:Qwen3.8-27B 仍是 Apache-2.0——同一家、同一周发布、许可完全不同。) | HF LICENSE 原文 |
| 23 | 把模型许可当作「版本化依赖」管理。中国大厂许可证在 2026 年系统性收紧(阿里 Qwen 3.5/3.6 开源→3.7 闭源→3.8 开源带条件;MiniMax M2/M2.5 MIT→M2.7 非商用;Kimi K3 年收入 2000 万美元触发分成)。衍生模型继承原条款,必须记录「哪个权重进了哪个产品」。 | AI in Asia |
| 24 | 「Qwen 都是 Apache-2.0」是过时印象。同一周发布的三份 Qwen 许可完全不同:Qwen3.8-27B = Apache-2.0;Qwen3.8-Max = 自定义(5000 万美元收入门槛);Qwen3.8-Flash-Next = Qwen Community License 1.0(做 MaaS/AI Work Assistant 业务无收入门槛即须先取得单独许可)。商用前必须逐仓库读 LICENSE 文件。 | Qwen3.8-Flash-Next LICENSE 原文 |
| 目标 | 首选 | 备选 | 显存 |
|---|---|---|---|
| 批量口播视频 | AigcPanel(AppImage + 模型市场)+ MuseTalk 口型引擎 | EchoMimicV3(12GB/8步/768²) | 4–12GB |
| 实时语音对话数字人 | OpenAvatarChat(LiteAvatar 路线) | OpenTalking(quicktalk 3.8GiB) | 4–8GB |
| 出片画质优先 | Duix.Avatar(读清 LICENSE 再用) | EchoMimicV3 | 8–12GB |
| 直播推流 | Fay(编排)+ LiveTalking(驱动,注意水印条款) | LingCast 架构 | 8–12GB |
| 3D 资产(道具/角色三视图) | TripoSG(MIT,≥8GB) | TRELLIS v1(MIT,16GB 下限) | 8–16GB |
| 真 3DGS 数字人形象 | LAM + LAM_Audio2Expression + OpenAvatarChat(全链 Apache-2.0) | — | 低(单图推理) |
--low_vram_mode 仍要 21GB)→ 16GB 只能出白模。curl -sI https://raw.githubusercontent.com/<owner>/<repo>/main/LICENSE → 404 就直接放弃。NonCommercial / commercial / Monthly Active Users / Territory / Attribution / Built with / Powered by。license: 字段、LICENSE 文件)——代码许可 ≠ 权重许可。api.github.com 直连失败),部分 star 数取自第三方口径 → 标注为「约」。Wan2.2-T2V-A14B 仓库 raw LICENSE 取到 "Entry not found"(文件名不同);Wan 2.1 已核实为标准 Apache-2.0 全文,Wan 2.2 的 Apache-2.0 归属依据第三方核查文章与官方发布信息 → 建议下载前在模型卡确认。许可证原文
华为/大厂条款与版本状态
法规与司法
论文
sm_120(Blackwell)适配证据链
平台与仓库