# AI 仙宫 / 珠光宝气古风美女视频：国内外制作方法调研报告

> 调研时间：2026-09 ｜ 调研方式：公开报道 + 创作者本人拆解 + 开源技能包 + 平台官方公告
> 所有关键数据均附来源链接；无法交叉印证的内容已标注"未证实"

---

## 0 一页速览

**这两类视频的核心结论（先看这五条）：**

1. **爆款靠审美母题，不靠技术栈。** 海外破 500 万播放的"中式天庭"，作者只用 **Midjourney 出图 + 可灵/即梦转视频**，一条 33 秒、无台词、无字幕。
2. **绕开 AI 的弱项，而不是硬刚。** 无台词、**人物占画面高度远景 1%–4% / 中景 5%–8%**、小尺度运镜、不拍手、不做复杂微表情——把剧本和分镜改到 AI 的能力圈内。AI 短剧团队的原话是："通过剧情铺垫避免让 AI 承担超出其能力的表演要求。"
3. **把"感觉"翻译成约束清单。** 可复用的一直是数字和规则：人物占画面高度远景 1%–4%、一条视觉轴线、云海分三层、柱子飞檐全程静止、换装卡点在 1.25/2.95/4.40/6.55 秒——**不是"仙侠天宫，唯美震撼"这八个字。**
4. **仙宫吃"空间一致性"，古风美女吃"角色一致性"——这是两条完全不同的技术路线。** 仙宫纯空镜 + 大景小人 + 无台词，绕开 AI 最弱的人脸与口型；古风美女必须锁脸锁服装，**成本是仙宫空镜的 3–5 倍**。用错力气是最常见的浪费。
5. **两类题材的共同最优解都是"静态图 → 图生视频"，不是文生视频。** 先出 20–50 张图选 1 张，再让视频模型做微动（云飘、衣摆、鹤飞、光移），比 T2V 一次成片成功率高一个量级。

**两类题材的难度与打法差异：**

| | 仙宫 / 天宫 | 珠光宝气古风美女 |
|---|---|---|
| 核心难点 | 建筑稳定（不融化、不变形）、云海动态、镜头幅度 | 人物一致（不换脸）、首饰质感（不塑料）、衣料物理 |
| 制胜关键 | 首帧锁死 + 小尺度运镜 + 构件写具体 | 形制词 + 材质词 + 光影 + 参考图 |
| 典型失败 | 动态 PPT 感 / 宫殿晃动 / 远景人物崩 | 义乌小商品塑料感 / 簪子插歪 / 手指畸形 |
| 成本档位 | 50–300 元/条（个人号）；国外链路约 $3–4.5 | **约 3–5 倍于仙宫空镜**（国外口径 $6–$15） |

---

## 1 现象：这波内容是怎么起来的

2026 年 8 月，一条**没有台词、没有字幕**的 33 秒 AI 短视频从国内被搬运到海外平台，**不到 4 天播放量突破 500 万**，收获 4.8 万点赞、转发超 9700 次。画面内容是：白玉长廊延伸向云海深处，南天门巍峨耸立，仙鹤穿梭于层层叠叠的飞檐琼楼之间。

随后**外交部发言人毛宁在个人账号转发**了这条视频，配文"中式天堂长什么样"——等于给这波内容做了一次官方背书，热度持续了不止一周。

**为什么是这两类题材：**

- **仙宫**的火，核心不是技术，是**审美母题**。云海、飞檐、白玉长廊、红衣身影——这套视觉语言几乎刻在中国人审美基因里，以前只能在游戏 CG 或影视特效里见到，现在一句话就能生成接近电影质感的画面。同时它在海外存在**明显的供给缺口**（中式天庭对海外观众是全然新鲜的视觉经验，评论区会自发往中国神话上延伸）。
- **珠光宝气古风美女**的火，核心是**成瘾式的视觉奢华感**。金玉珠贝的材质反光 + 高饱和暖光 + 极繁头面，在竖屏上极其抓眼，且天然适配换装、舞蹈、变装等**高完播率体裁**。

来源：[封面新闻/网易](https://www.163.com/dy/article/L3RIHBEN0514D3UH.html)、[数艺社/网易](https://www.163.com/dy/article/L5LO75TN05340TH8.html)、[四川新闻网](https://scnews.newssc.org/system/20260808/001632696.html)

### 1.1 海外侧：不止是仙宫，"中式审美"整体在起量

- **`#Chinamaxxing`（"极致中国化"）在海外累计浏览量已破 40 亿次**——这是一个现成的流量池，仙宫/汉服/古风美人内容可以直接蹭这个话题标签。
- **TikTok 汉服变装潮**：2026 年初"用 AI 把自己 P 成中国古装剧汉服美人"的玩法病毒式传播，印尼 Kompas 等非中文媒体专门出教程，工具站还做了"Chinamaxxing 趋势滤镜"。形态多为**前后对比/变装硬切，8–15 秒**。这说明趋势已经**从中文圈扩散到非中文创作者**。
- **AI 古风美人账号的商业化样本**：国内有创作者（@灵筠仙逸，35 岁 AI 人像创作者）靠**静态写真轮播短视频**（几乎不剪辑、不动画）做到 1.6 万粉、11.8 万点赞，定位"丰腴有韵、温婉藏柔"的东方美人，刻意避开白幼瘦模板与擦边。
  > **这个案例的可复制点非常重要**：**"审美定位"比技术更重要**——在同质化的 AI 美女赛道靠一套差异化审美（体态、色调、场景）建立辨识度；而**静态轮播的算力成本几乎为零**，是冷启动账号验证审美的极低成本做法。**先验证审美，再投算力做视频。**

来源：[Kompas 教程](https://www.kompas.com/tren/copy/2026/01/26/120000765/cara-edit-foto-ai-pakai-hanfu-ala-drama-china-yang-viral-di-tiktok)、[Kapwing Chinamaxxing trend](https://www.kapwing.com/kai/create/chinamaxxing-trend-filter)、[网易号报道](https://www.163.com/dy/article/L15JDBAL0553KEE1.html)

---

## 2 标杆案例（两档完全不同的做法）

### 2.1 个人号天花板：栖光（陈爱军）——"中式天庭"

| 维度 | 事实 |
|---|---|
| 身份 | 1991 年生，成都眼镜店老板，非设计科班，"纯小白"自学 AI 近两年 |
| **工作流** | **Midjourney 出图 → 可灵 / 即梦 转视频** |
| 爆款 | 33 秒无台词无字幕，海外 **不到 4 天破 500 万播放** |
| 产量 | 抖音 50 万+ 粉丝、200+ 条作品、接近**日更**；单条 **4–5 小时** |
| 成本 | 一般画质 **50–60 元/条**；4K 画质 **100–300 元/条** |
| 变现 | 仅靠平台流量收益，收支基本打平；下一步计划做**修仙向 AI 短剧** |

**这个案例最大的信息量是"链路可以有多简单"。** 他没有用复杂的 ComfyUI 工作流，没有自训 LoRA，没有多模型分流。他做对的是两件事：**选题精准 + 日更坚持**。

### 2.2 工业化基线：《斩仙台 AI 真人版》——AI 仙侠短剧

来源：[红星新闻/搜狐](https://news.sohu.com/a/1000949480_116237)

| 维度 | 事实 |
|---|---|
| 体量 | 81 集，单集平均 **40 个镜头**，上线 **6 天播放破亿** |
| 团队 | **12 人**（真人剧动辄几十人） |
| 周期 | 分镜 20 多天，整体约 **30 天** |
| 成本 | 算力约 **10 万元**（真人剧同体量 30–100 万元）≈ **31 元/镜头** |
| 流程 | 剧本 → 分镜 → 角色设定 → 场景设定 → 文生图 → 图生视频 → 剪辑 → 配音 |

**已知短板（这决定了所有 AI 仙侠内容的剧本边界）：**
1. **高速运动**（御剑飞行、激烈打斗）大场面边缘细节精度掉，人工微调成本高；
2. **复杂情绪**（"隐忍的愤怒""克制的喜悦""悲喜交加"）还原不了，要么夸张要么平淡；
3. **微表情**（嘴角微颤、眼神闪烁、眉头轻蹙）不可控。

**补救体系**：AI 生成 + 人工精准优化 + 专业指导三层；用**镜头语言兜底**（慢镜头突出情绪、特写聚焦眼睛/面部、BGM 与音效强化氛围）；**剧本层面主动避开 AI 做不到的表演**。

> **这一节是给所有想做 AI 仙侠内容的人的最重要提醒**：不要在文本阶段就写满微表情和高速武打，那是给自己挖坑。把镜头语言当"表演替身"。

### 2.3 拆解级案例：行者AI视频的天宫 48 小时实验

这是公开资料里**最实操**的一份天宫拆解，方法论部分见第 5 章。来源：[觉醒AI知识库转载](https://www.jxxy.net/ai/articles/joshesye-2087709684719292687/)

核心洞察一句话：**"画面越大，建筑越复杂，能交给模型的运动就越少。"**

---

## 3 当前工具格局（2026-09 快照）

### 3.1 文生视频盲测榜单（Artificial Analysis，抓取于 2026-09-02）

| 排名 | 模型 | 开发者 | Elo | 距榜首 |
|---|---|---|---|---|
| 1 | Gemini Omni Flash | Google | 1238 | — |
| 2 | **Wan 3.0** | Alibaba | 1237 | −1 |
| 3 | **MiniMax H3 Max**（fal 后训练） | Fal | 1235 | −3 |
| 4 | **MiniMax H3** | MiniMax | 1227 | −11 |
| 5 | **Dreamina Seedance 2.0 720p** | ByteDance Seed | 1221 | −17 |
| — | *（此处断层 60+ 分）* | | | |
| 6 | Wan2.7-260612 | Alibaba | 1157 | −81 |
| 7 | HappyHorse-1.1 | Alibaba-ATH | 1145 | −93 |
| 9 | Kling 3.0 1080p (Pro) | KlingAI | 1108 | −130 |
| 11 | SkyReels V4 | Skywork AI | 1103 | −135 |
| 13 | Veo 3.1 | Google | 1092 | −146 |
| 19 | Vidu Q3 Pro | Vidu | 1075 | −163 |
| 20 | PixVerse V6 | PixVerse | 1074 | −164 |
| 21 | grok-imagine-video | xAI | 1062 | −176 |

来源：[BenchmarkList 收录的 Artificial Analysis 文生视频榜](https://benchmarklist.com/arenas/artificial_analysis_text_to_video/)（榜单为"含音频视角"的盲测对比）

**读榜要点：**
- **前五名里有四个是中国厂商**（阿里 Wan、MiniMax H3 系、字节 Seedance）。国内工具在这一代已经站上第一梯队。
- 第 5 名与第 6 名之间有 **60+ 分的断层**，说明头部与腰部拉开了实质差距。
- Kling 3.0 有两档（Pro 1080p / Standard 720p），另有 **Kling 3.0 Omni**（多镜头 + 原生音频）。
- **榜单排名 ≠ 你的题材效果。** 榜单测通用质量，而古风题材吃的是**人物一致性、首饰细节、中国审美理解**，这些在通用榜上体现不出来。

### 3.2 一个必须知道的重大变动：Sora 已经关停

**OpenAI 已于 2026 年 3 月 25 日宣布关停 Sora**：App/网页于 **2026-04-26 关停**，开发者 **API 于 2026-09-24 下线**。

来源：[VentureBeat](https://venturebeat.com/technology/openai-is-shutting-down-sora-its-powerful-ai-video-app)、[澎湃/雷科技《Sora为何"暴毙"？》](https://m.thepaper.cn/newsDetail_forward_32829843)、[封面新闻](https://m.thecover.cn/news_details.html?eid=t/pW44zBZFGH90qSdq8Jkw==)

**关停数据与原因：**
- 2025 年 9 月发布 Sora 2.0 时同步推出独立 APP，12 月还与迪士尼达成 10 亿美元合作；**三个多月后即关停**。
- 下载量：2025 年 12 月环比 **−32%**，2026 年 1 月再 **−46%**。
- 收入：2025 年 12 月峰值 54 万美元 → 2026 年 1 月 **36.7 万美元**。
- 根因：**视频生成是低频需求，难以沉淀使用习惯；而每一次调用都是实打实的算力消耗**。叠加 Gemini 3 冲击、Claude 在企业市场挤压，以及 **Agent（OpenClaw/"龙虾"）对推理算力的抢占**（HBM 内存瓶颈导致全行业算力受限），OpenAI 选择收缩战线，把资源集中到 ChatGPT、Codex、Agent 与企业市场。

> **对做内容的人意味着什么**：别再参考任何把 Sora 当首选的教程了。同时这也预示一个更大的趋势——**视频生成的算力正在被 Agent 抢走，涨价和排队是长期趋势，不是短期波动**。这与第 11 章"即梦一年三次调价""Seedance 2.0 首日排队 8–10 小时"完全同源。

### 3.3 工具链：各自在链路中承担什么

| 工具 | 链路中的角色 | 关键评价 |
|---|---|---|
| **即梦 Dreamina**（字节） | 主力出图 + 图生视频 + 首尾帧 + 智能参考转绘 | 中文语义强，AI 漫剧/玄幻题材首选；内置 Seedream（图）/Seedance（视频）、角色锁定、局部重绘、三视图模板 |
| **可灵 Kling**（快手） | 图生视频、首尾帧、原生音频 | **镜头叙事感强、电影级画质**，适合影视短片 |
| **海螺 AI / MiniMax** | 人物表现、镜头生成、原生声音 | 常做镜头间过渡段；其官方 specular highlights 指南是"珠光宝气"最好的公开方法论（见 6.1.1） |
| **Vidu**（生数） | **多参考图生视频**（多主体一致性） | 用于"图一中的女人立于空中，图二中的飞剑刺中她"这类多素材合成 |
| **通义万相 Wan**（阿里） | 网页创作入口 + Model Studio API 双路径 | ⚠️ **网页版本名与 API model 字符串不能互相推断**（如网页展示万相 3.0，国际区 API 文档仍以 Wan 2.7 为主） |
| **腾讯混元** | 图生视频 + 首尾帧 | 已开源图生视频模型，可自部署 |
| **PixVerse**（爱诗） | 社媒特效、模板、快速迭代 | **同质化风险最高**——"模板越强，作品越容易出现相似构图" |
| **剪映** | 成片总装：拼接、卡点、智能字幕、BGM、调色 | 几乎所有教程的最后一步；"图文成片/智能画布"的细节**未找到权威拆解（未证实）** |
| **Liblib 哩布 / 无界AI / 堆友** | 国风**模型与 LoRA 社区 + 在线工作流**，负责出图侧风格化与一致性 | 无界AI 有独立"2.5D 国风"模型，公开参数：DPM++ SDE Karras、9:16、CFG 7、精绘 1.5 倍强度 50%。堆友的链路位置**未证实** |

**两条被验证的实战组合：**
- `Midjourney 出图 → 可灵/即梦 图生视频 → 剪映`（栖光，最简）
- `即梦3.0 出图 → 即梦/可灵首尾帧 → 海螺补图生视频 → Vidu 多参合成 → 剪映`（多主体仙侠片）

**逐环节对应关系：**

| 环节 | 主流选择 |
|---|---|
| 出图 | Seedream 4.5/5.0、Nano Banana Pro、Midjourney、即梦、Flux 系 |
| 图生视频 | Seedance 2.x、可灵 3.0 系、MiniMax H3 系、Wan 3.0 |
| 换装/卡点 | 即梦、可灵 + 换装技能规范（见 6.2） |
| 配音/BGM | TTS + Suno 国风 + ElevenLabs 音效（见第 12 章） |
| 放大/精修 | Topaz Video AI、ComfyUI 放大链 |
| 剪辑 | 剪映 |

### 3.4 国外链路：2026-09 的实际主力（两条时效校正）

> ⚠️ **必须先知道的两件事**（截至 2026-09）：
> 1. **Sora 2 已停服**——App/网页 **2026-04-26** 关停，**API 2026-09-24 下线**。任何仍以 Sora 2 为主力的方案已过期。
> 2. **Veo 4 从未发布**——2026 Google I/O 只发了 Gemini Omni；官方 Veo 系列仍是 **Veo 3.1**（1080p / 原生音频 / 8s 可续接）。

| 环节 | 国外实际主力 |
|---|---|
| 出图 | Midjourney V8.1/V8.2（alpha）、FLUX 3 / FLUX.1 Krea、Ideogram 4.0、Nano Banana Pro、Seedream 5.0、SDXL 生态（Pony/Illustrious/NoobAI） |
| 出视频 | **Veo 3.1**、**Kling 3.0 / 3.0 Omni**、**Runway Gen-4.5**、**Seedance 2.5**、**Hailuo 3（MiniMax H3）**、Grok Imagine Video 1.5、Higgsfield（聚合层） |
| 一致性 | Kling Elements、Runway Gen-4 References、Veo Flow Ingredients、Seedance 多参考（30 图）、Higgsfield Soul ID |
| 音频 | 模型原生音频（Kling 3.0 Omni / Veo 3.1 / Hailuo 3）、ElevenLabs、Suno v6 |
| 后期 | Topaz Video AI（2025-10 起改订阅制）、DaVinci Resolve |
| 分发 | 竖屏 9:16、8–15s、前 1–2 秒定生死 |

**各视频模型在仙宫题材上的实际差异：**

| 模型 | 单次时长 | 最强项 | 仙宫题材表现 |
|---|---|---|---|
| **Veo 3.1** | 4/6/8s 可续接 | 原生音频 + 提示词遵循 + 4K 质感 + Ingredients 参考 | 云海/建筑质感最"贵"，光很"电影"；缺点是贵、单段短 |
| **Kling 3.0 / 3.0 Omni** | 3–15s 可续到 3 分钟 | **一次生成 6 镜头故事板 + 原生 4K 60fps + Omni Audio（对白/音效/配乐同帧生成）+ Elements 角色锁定** | 仙宫"巡游式多镜头"最强；多角色同场也能锁 |
| **Runway Gen-4.5** | 2–10s | References（≤3 张）+ Motion Brush 逐区域控制 + Director Mode | 适合"先定角色板再动"的精修流程；纯空镜性价比一般 |
| **Seedance 2.5** | **4–30s 任意整秒** | 首尾帧 + 最多 30 图/10 视频/10 音频参考 + 编辑式局部改 | 720p 上限，但**长镜头一次成最省事**；竖屏短剧首选 |
| **Hailuo 3 / MiniMax H3** | 5–15s | **4K 原生 + 便宜**（$0.06/s @768p、$0.16/s @4K）+ 32kHz 立体声；H3-Base 已开源 | 仙宫大景"清晰又便宜"；但**该端点不吃关键帧/参考图** |
| **Grok Imagine 1.5** | 1–15s | 极快、便宜（$0.08/s @480p） | 用于**快速试运镜与构图（草稿）**，成片仍需换模型 |
| **Higgsfield** | 聚合层 | **Soul ID**（20+ 张图训练持久身份）+ Cinema Studio 运镜 | 做"同一仙女跨几十条视频"最省事的商业化方案 |

### 3.5 国外打法的四条结构性差异

1. **仙宫题材吃"空间一致性"，不吃"角色一致性"。** 这是 B 报告最有价值的判断，与栖光案例完全吻合：纯空镜 + 大景小人 + 无台词无字幕，**绕开 AI 最弱的人脸/口型，只压最强的建筑/云雾/体积光**。这是该题材能低成本跑通的根本原因。
2. **古风美人题材恰好相反**，必须有稳定的脸和服装，必须走参考图/身份训练路线，**成本约为仙宫空镜的 3–5 倍**。
3. **两个题材的共同最优解是"静态图 → 图生视频"，而不是文生视频。** 先出 20–50 张图选 1 张，再让视频模型做微动（云飘、衣摆、鹤飞、光移），**比 T2V 一次成片成功率高一个量级**。
4. **国外信的是"账号级资产"，不是"单条提示词"**：Midjourney 的 **moodboard（风格板）** + 角色四联表（character sheet）+ 身份训练（Soul ID），都是为了把一次成功变成可复用资产。

**Midjourney 古风调参四件套（可直接用）：**
- `--sref` 锁整体画风；`--sw`（0–1000）**古风场景建议 150–350**，太高会把建筑细节糊成插画；
- `--oref` + `--ow`（0–1000）锁人物/器物，**古风美人正式图建议 400–700**：低于 200 脸会漂，高于 800 会僵化、姿态锁死；
- **Moodboard**：把 10–20 张自家仙宫图建板，后续所有出图保持同一套审美——**账号辨识度最省力的做法**；
- 仙宫大景**建议先 16:9 出图，再 outpaint 到 9:16**，否则广角透视容易被裁掉。

**一致性方案的四套主流做法：**
1. **参考图锁脸**：Kling Elements（角色 **2–4 张**不同角度图，官方建议 5–10 张含正面/3-4/侧面/不同光照/一张特写）；Runway Gen-4 References（最多 **3 张**生效，官方建议**中性均匀打光**素材）；Veo 3.1 Flow Ingredients（1–3 张；**注意 Quality 档不支持 Ingredients，只有 Lite/Fast 支持**）；Seedance 2.5 参考预算最大（**30 图 + 10 视频 + 10 音频**）。
2. **角色表（character sheet）**：一次出"正面全身 + 3/4 侧 + 侧面 + 特写 + 服装平铺"四联图，作为**项目固定资产**。国外短剧团队把它当"选角照"用，**任何镜头都从这张表出发，而不是从文字描述出发**。
3. **首尾帧插值**：最实用的仙宫玩法是——**同一张图的"未加光"与"加光"两个版本做首尾帧，让光在镜头里生长**。
4. **身份训练（Soul ID 类）**：20+ 张图训练持久身份，之后在平台内**所有模型**（Seedance / Kling / WAN / Veo / Gemini Omni）复用，不必每次重传参考。

**多镜头同一角色的实操纪律**：把身份/服装/场景写在**固定段**，把动作/景别/机位写在**变化段**；**每条镜头只用一个变化点**（换机位就不换服装）；逐镜头按"身份 / 服装道具 / 场景连续性 / 动作连续性"四维评分——**耳环、发际线、手、眼珠颜色是最常崩的细节**。

**分发与算法偏好（国外）**：
- **YouTube Shorts 的首要信号是 swipe-away rate（划走率）的倒数**，**前 1–2 秒**决定初始分发；其次是**循环完成率**、评论率、分享率（**分享权重最高**）。新片先推给 **200–500 人**测试池，**前 2–4 小时**基本决定天花板。
- 标题套路：`Chinese Heaven` / `What Chinese people imagine heaven looks like` / `Xianxia in 4K`；
- 封面：**用最贵的那一帧**（大门 + 云海 + 体积光），**不要在封面上放小字**；
- 前 2 秒**直接给最大景别**（巨门压顶 / 天阶无人尽头），不要开场黑屏、不要慢起、不要标题卡；
- 话题：`#ChineseHeaven`、`#Chinamaxxing`、`#BecomingChinese`、`#hanfu`、`#xianxia`。**2026 年 "Chinamaxxing" 在海外累计浏览量已破 40 亿次**——这是个现成的流量池。

**国外单条成本折算（15 秒 5 镜头，含 4 次重试）：**

| 路线 | 单条成本 |
|---|---|
| 纯仙宫空镜（Kling 720p 无音频 + MJ 摊薄） | ≈ **$3**；加原生音频 ≈ **$4.5** |
| 纯仙宫空镜（Hailuo 3 @768p） | ≈ **$3.6**（最便宜） |
| 古风美人路线（角色表 + 参考锁定，生成量翻倍） | **$6–$15** |
| 古风美人 + Higgsfield Soul ID 锁脸 | **$5–$12** |

> ⚠️ **成本口径提醒**：不同来源的 Veo 3.1"每有效秒"差异极大（$0.17 ~ $5.5/秒），差异来自是否计入重试、是否用 Vertex 计费、Resolution/音频档位混算。**报价前务必用「有效秒 × 重试系数」自算，不要直接引用博客的单秒数字。**
> 另注意：**Kling 订阅 credits 不滚存、失败任务仍扣**（API 侧失败不扣）。

---

## 4 通用生产链路（六步法）

不管国内还是国外、个人还是团队，能跑通的链路都可以归到这六步：

```
① 创意/选题  →  ② 关键帧出图  →  ③ 图生视频（锁首帧 + 小运镜）
                     ↓                        ↓
              ④ 一致性处理            ⑤ 音频（配音/BGM/音效）
                     ↓                        ↓
              ⑥ 放大精修 + 剪辑 → 发布（含 AI 标识声明）
```

**每一步的核心原则：**

| 步骤 | 原则 | 典型翻车 |
|---|---|---|
| ① 选题 | 视觉母题必须一句话说清（"云海白玉长廊通向天门"） | 选题模糊 → 提示词只能"许愿" |
| ② 出图 | **图片是视频的结构母图**；先构图 → 再空间层次 → 再镜头位置 → 最后主次 | 一上来就写氛围词，AI 停在"图像渲染" |
| ③ 视频 | **锁首帧 + 只写看得见的动作 + 小尺度运镜** | 镜头幅度大 → 建筑融化、人物换脸 |
| ④ 一致性 | **人景拆分**（人物三视图单独做）+ 物料拆包（人物图 / 场景图分开） | 把参考图当"参考人物"，其实只是风格与结构输入 |
| ⑤ 音频 | 声音克制，画面才显得大 | 堆 BGM 和音效 → 廉价感 |
| ⑥ 后期 | 放大 + 调色数据化（Hex 色板）+ 剪词 | 过度磨皮、过度锐化 = AI 味 |

---

## 5 仙宫 / 天宫 专项打法

来源：行者AI视频拆解（同 2.3）+ [gjgagvg/tiangong-image-prompt-generator](https://github.com/gjgagvg/tiangong-image-prompt-generator)（目前最系统的公开"仙宫提示词规约"，已逐条核实）

### 5.0 巨物尺度分级（把"宏伟"变成可量化数字）

这是整个仙宫题材**最重要的一组数字**。人物占画面高度比按景别分级：

| 景别 | 人物占画面高度 |
|---|---|
| 远景 | **1%–4%** |
| 中景 | **5%–8%** |
| 近景 | **12%–20%** |

**除非明确要求，人物不抢占建筑主体。** 同时必须**至少保留两级尺度参照**（人物、仙鹤、灯火、栏杆、门洞、云层、远山任选）。以遮挡、透视收缩、空气透视和重复结构表达体量，**不只依赖"巨大、宏伟"这类形容词**。

常见错误：门窗与人物比例冲突；远近物体同等清晰；重复柱网失真；无承重逻辑的结构。

### 5.1 出图的四条铁律

1. **人物要小。** 远景把人物压到画面 **3%–5%**。再大一点，天宫就变成人像写真的背景板。
2. **建筑要有轴线。** 白玉阶、南天门、主殿、远山落在**同一条视觉线**上，观众视线有路可走。
3. **建筑要写具体构件。** 柱、斗拱、抬梁、飞檐、白玉基座、云龙浮雕——写清楚构件，模型才知道东西该放哪。
4. **云海要分层。** 前景薄雾 / 中景翻涌云海 / 远景空气透视 + 虚化山体。

**配色公式：白玉 + 冷青灰打底，暖金光只照重点，加一点朱红压细节。**

**构图量化配方（实测输出）**：一点透视柱廊引导视线延伸；右侧留 **40%–60%** 云海呼吸空间；暖金色晨光斜射；红衣人物立在画面约 **3%** 位置作为视觉锚点。

### 5.2 动起来的五个字段

把一张静图拆成：**时间轴 / 镜头 / 人物动作 / 环境动态 / 连续性约束**。

- **先锁首帧**——建筑位置、人物站位、光源方向、栏杆柱子与云海关系全部沿用原图。**"首帧锁不住，后面写再多动作也没用。"**
- **只写看得见的动作**——云往哪边飘、薄雾怎么进长廊、衣袖摆动多少、人物抬头还是迈步。
- **镜头收着写**——慢推、轻移、缓慢抬升基本够用。"穿云、俯冲、环绕宫殿"提示词看着爽，成片通常不能看。
- **远景人物别太忙**——抬头、拢袖、侧身、向前走一步 > 奔跑、转圈。
- **该钉住的直接点名**——柱子、飞檐、门板、栏杆、长廊**全程静止**；云、雾、衣服、头发、水流负责动。

### 5.3 进阶：第一人称 Vlog（把远景变成能看 60 秒的内容）

**工程关键：物料拆包。** 用 **7 张图**：1 张人物主图（锁脸/发型/衣服）+ 6 张场景图（白玉广场、云阶、月门、云桥、云廊、茶席）。**"人物归人物，地点归地点"**——生成时不用每到一处重新猜。

60 秒 Vlog 选 3 个片段，每段给秒级区间 + 明确动作，让**人物把镜头带到下一个地方**（穿过月门、纱幔掠过镜头）。

### 5.4 材质要写出物理差异（同一画面里玉、木、瓦、金、云、水必须能区分）

| 材质 | 要写的 | 要避免的 |
|---|---|---|
| 白玉 | 温润、微透光、细微矿物纹理、边缘磨损 | 塑料感、均匀自发光 |
| 木构 | 可见古木纹理、榫卯关系、朱红漆面与岁月痕迹 | 光滑玩具质感 |
| 琉璃瓦 | 沿曲面反射天光，粗糙度有变化 | 镜面金属屋顶 |
| 金属 | 只用于节点和礼器，氧化/拉丝/锤纹，**不大面积铺金** | 满铺金饰、廉价"国潮"贴图 |
| 云雾 | 有密度梯度、受光面和阴影面 | 棉花状重复纹理 |
| 水体 | 反射、波纹、折射、表面张力，与重力方向一致 | 完整镜像、镜面水 |
| 废墟 | 断口、灰尘、苔痕与结构受力相互吻合 | 随机裂纹贴图 |

**构图三层**：前景框架 / 中景叙事主体 / 远景世界延伸。
**每幅最多一个主奇观 + 两个辅助奇观**（这是"画面不堆砌"的硬约束）。
**仪式场景**优先对称与中轴；**探索场景**优先偏心、遮挡、负空间；**危机场景**用斜线、断裂、逆向动势。
画面要能一眼回答：**人物在哪里、要去哪里、世界有多大、此刻发生什么。**

### 5.5 九组差异化生成策略（做系列号直接照抄）

做天宫系列号最怕"每条都一样"。这套九组策略保证世界观和角色连续，同时让叙事、空间、镜头、时段或动态中**至少两项显著不同**：

| # | 策略 | 要点 |
|---|---|---|
| 1 | **天门初见**｜建立世界 | 超远景/越肩；人物首次抵达巨型天门；门框套景、云海、尺度震撼 |
| 2 | **中轴朝圣**｜秩序仪式 | 正面对称、低机位、长玉阶；少量仪仗沿中轴前行 |
| 3 | **云廊漫游**｜空间纵深 | 侧向长廊、重复柱网、消失点；平视跟拍或缓慢横移 |
| 4 | **月宫静夜**｜诗性孤寂 | 冷色夜景、巨月、白玉平台；单人小比例；负空间与静止感 |
| 5 | **星河祭坛**｜宇宙神圣 | 高台/俯瞰，天河环绕；圆形秩序、星轨、可读光源 |
| 6 | **浮城全貌**｜体系规模 | 极高机位/航拍推进；多层宫群与悬桥构成城市体系 |
| 7 | **云瀑奇境**｜自然共生 | 垂直构图；宫殿嵌入神山，云瀑穿越桥下 |
| 8 | **战争遗迹**｜历史创伤 | 破碎天桥、倾塌殿宇、熄灭宫灯；偏心构图与逆光 |
| 9 | **神迹降临**｜叙事高潮 | 光柱/天门开启/神兽掠过，**只保留一个核心神迹** |

连续九镜的叙事映射：`建立世界 → 抵达 → 深入 → 发现 → 仪式 → 全貌 → 异变 → 遗迹真相 → 神迹高潮`。

### 5.6 分平台提示词写法（别把多个平台的语法混进同一条）

| 平台 | 写法要点 |
|---|---|
| **Midjourney** | 紧凑自然语言，顺序：主体→环境→构图→光线→材质→风格；`--ar` 指定画幅；无独立负面栏时用 `--no` 放少量明确对象 |
| **Flux** | 完整描述句，明确空间关系、材质、光源；**避免大量逗号标签与互相矛盾的风格词**；把限制写成可观察的正向约束 |
| **SDXL** | 正负分离；按主体/环境/摄影/质量组织；**写实模型要减少引擎名和冲突的艺术家风格词** |
| **即梦** | 清晰中文：主体、景别、动作、环境、光影、画幅、风格；视频任务补镜头运动、主体运动、环境运动与稳定性限制 |
| **可灵** | 按"**首帧场景—主体动作—镜头运动—环境响应—结尾状态**"描述视频；控制单镜头动作数量，写清速度/方向/幅度/前后景视差 |
| **Runway** | 只写视觉可见、可拍摄的运动；**区分镜头运动与主体运动**；多写"如何移动"，少写抽象审美标签 |
| **AI 漫剧分镜** | 每镜输出：镜号、时长、景别、画面、角色动作、台词、音效、转场、连续性锚点；相邻镜头遵守视线/运动方向/轴线连续；**每镜只承载一个主要叙事动作** |

### 5.7 镜头运动的四条硬规则

来源：[Runway Gen-4 官方指南](https://help.runwayml.com/hc/en-us/articles/39789879462419-Gen-4-Video-Prompting-Guide) + [AI漫剧提示词写法](https://github.com/kangarooking/ai-short-drama-resources)

1. **一段只保留一个主运镜。** 不要在同一小段同时写推近、横移、升高、环绕、俯冲、变焦——过多冲突指令会让模型"尝试调和矛盾"。
2. **"缓慢推进"必须是摄像机空间位移。** 近景视差快、中景适中、远景最慢；**禁止用数码放大冒充推进**。
3. **追逐镜头要分开写三种方向**：主体运动 / 摄影机运动 / 场景相对运动。只写"高速追逐"，模型会自行发明方向。
4. **用时钟方位描述光源**（"11 点方向低角度逆光"）比"侧逆光"更可控；时间轴用 **2–4 个阶段**组织，不必逐秒切碎。

**首尾帧衔接的判据（这条很关键）：** 首尾帧差异**必须能由真实摄影机路径解释**——先判断摄像机能否从首帧位置物理到达尾帧位置、两者是否同侧轴线、门/墙/道路内外关系是否一致。**不能解释时应改首帧或尾帧，而不是用复杂运镜硬接。** 最常见的续接方式是直接导出上一镜尾帧当下一镜首帧。

### 5.8 零提示词路线（不想写提示词的人）

两个开源技能包，装上就是"视觉导演 + 运镜导演"：
- [liyue-aigc/xianxia-visual-director](https://github.com/liyue-aigc/xianxia-visual-director)（出图）
- [liyue-aigc/xianxia-cinematic-video-director](https://github.com/liyue-aigc/xianxia-cinematic-video-director)（视频运镜）

**三步复刻法**（来源：[数艺社实测](https://www.163.com/dy/article/L5LO75TN05340TH8.html)）：
1. 在豆包"工作任务"里发"安装这两个技能：<GitHub 链接>"；
2. 出图：有参考图用图生图（更稳），没有就词生图，**点名 Seedream 4.5**；
3. 出视频：附上满意的图，说"根据这张图片生成视频，使用 Seedance 2.5"。

同类可参考的还有 [joshesye/design-xianxia-celestial-shots](https://github.com/joshesye/design-xianxia-celestial-shots)（生图）与 [joshesye/design-seedance-celestial-motion](https://github.com/joshesye/design-seedance-celestial-motion)（运镜）。

> ⚠️ **可信度提示**：`liyue-aigc/xianxia-visual-director` 与 `xianxia-cinematic-video-director` 两个仓库的 SKILL.md 在实测中**返回 404，其内部规则未能直接核实**（"安装即用"的效果描述来自第三方测评）。**已逐条核实、可直接使用**的是 [gjgagvg/tiangong-image-prompt-generator](https://github.com/gjgagvg/tiangong-image-prompt-generator)——本报告第 5 章的尺度分级、九组策略、材质规则、分平台写法、质量检查清单均取自该规约。建议优先用它。

---

## 6 珠光宝气古风美女 专项打法

### 6.1 去塑料感：四板斧

来源：[FlowPix《AI绘画古风发饰怎么画不塑料？》](https://www.flowpixai.com/ai-art/ai-hair-ornament.html)

**第一板斧——形制写准。** 只写 "hairpin" / "hair accessory"，形态全凭运气：

| 形制 | 正确写法 |
|---|---|
| 簪（单股） | `zan, single-prong hairpin` |
| 钗（双股） | `chai, double-prong hairpin` |
| 步摇（带坠流苏会动） | `buyao, hairpin with dangling pendants that sway` |
| 钿（花形片状） | `dian, floral inlaid hair ornament` |

> 新手建议从**步摇**入手：流苏坠子辨识度高，AI 容错率大。

**第二板斧——材质写出工艺和透感**（塑料感的根子在材质词太笼统）。见第 7 章模板。

**第三板斧——光影让发饰立体。**
`soft directional light from upper left, specular highlights on metal edges, subsurface scattering on jade, gentle shadow under ornaments`
**绝对不要写** `flat lighting` / `even lighting`——那种光下发饰必扁。背景要压暗（深褐或墨绿）才衬得出高光。

**第四板斧——朝代锁调性。** 唐华丽 / 宋清雅 / 明繁复 / 清点翠（关键词见第 7 章）。

**两条硬数据：**
- Civitai 社区评测：主流模型生成**精细金属花丝工艺**图像时，**结构正确率不足三成**，崩点在细线条连贯性与对称性。"十张里能挑出两张结构没崩的就算运气好。"——**AI 画首饰的崩坏率比画脸还高。**
- 应对：**分辨率至少 1024 起，有条件放大到 2048**；**喂博物馆藏品/实物参考图做图生图，崩坏率能降一半**。

**局部修复优先于整张重来**：发饰"长歪"（簪子插到耳朵上面、步摇垂到肩膀外）用局部重绘框住发饰区域单独修。

### 6.1.1 金属与宝石的物理关键词体系（来自海螺 AI 官方指南）

来源：[Hailuo AI《Prompting Specular Highlights for Luxury》](https://hailuoai.video/pages/knowledge/specular-highlights-luxury-ai-video-guide)（2026-07-27）——目前"珠光宝气"质感**最权威的公开方法论**。

| 关键词 | 作用 |
|---|---|
| `anisotropic highlights` | 各向异性高光——**拉丝金属**的关键 |
| `specular roll-off` | 高光滚降（高光到暗部的过渡） |
| `warm metallic luster` | 暖金属光泽 |
| `internal refractions` | 内部折射（宝石/玉石） |
| `caustics` | 焦散（光线透过宝石投下的光斑） |
| `prismatic glints` | 棱面闪彩（火彩） |
| `Fresnel effect` | 菲涅尔效应（掠射角反射增强） |
| `iridescent overtone` | 虹彩泛色（珍珠） |

**三条反直觉的核心原则：**
1. **优先描述光源与材质物理，而不是直接描述高光位置。** 让模型自己算高光。
2. **用 `soft glow` 搭配 `specular`，比单写 `extremely shiny` 更物理可信。** "极致闪亮"会导致高光溢出、细节被吃掉。
3. **金属必须有东西可反射才像金属。** 金属在纯黑背景里会"融"进去——必须用 rim lighting 勾边，或给它环境反射源。

**珍珠的四层光学写法**（来源：[FlowPix《AI珍珠首饰绘画》](https://flowpixai.com/ai-art/ai-pearl-jewelry-painting.html)）：

```
珍珠 = ① body color（底色，暖奶油白带象牙底）
     + ② 表面虹彩晕彩（soft pink → pale green，边缘掠射光处最明显）
     + ③ 镜面高光（柔和扩散光斑，而非锐利白点——"像一片月光而不是激光点"）
     + ④ 内部微弱内发光（光被封在层叠半透明结构里）
```

**必须分层描述**。正面直射光会压掉晕彩；CFG 建议 **5–7**。
**反面教训**：只写 `pearl necklace on a black velvet background` 会得到"乒乓球串"；**负面词若包含 `plastic / glossy / shiny / reflective`，会把珍珠高光一并压低**——这是很多人生搬硬套负面词反而翻车的原因。

⚠️ **"人物 + 首饰"同时生成会牺牲首饰精度**：必须用 Inpaint 单独重绘首饰区域，或干脆分开出图再合成。

### 6.1.2 人物资产前置：三个记忆点 + 别堆头饰

来源：[刺猬星球/FlowPix](https://www.flowpix.club/community/122.html)（2026-06-17）

- **不要只生成一张图**，而要拆成**脸部三视图**（面部 + 妆造 + 发饰）和**全身三视图**（服装结构），再融合。
- 女主固定 **3 个记忆点**（例："高颅顶黑发 + 金色古风头饰 + 浅色系长裙"）。
- **"头饰堆太多，生成视频时非常容易崩"**——这是古风美女类最典型的翻车原因，与"珠光宝气"的诉求天然冲突，需要在**精度**和**繁复度**之间取平衡。
- 出片后**优先用近景特写而非大景别**；15 秒内保持故事版干净。

### 6.2 换装类内容：工业级规范

来源：[liyue-aigc/female-outfit-director](https://github.com/liyue-aigc/female-outfit-director/blob/main/skill/SKILL.md)

| 项目 | 规范 |
|---|---|
| 画幅/时长 | 9:16，**8 秒 = 初始造型 + 4 次换装** |
| 卡点 | **1.25s / 2.95s / 4.40s / 6.55s**（最后一段必须留最终造型展示时间） |
| 机位 | 固定高位俯拍（前上方，向下 **30–35°**），全程不推拉摇移变焦 |
| 换装机制 | 汉服大袖/披帛 → 袖摆遮镜；古风贵女 → 团扇/折扇遮挡；东方幻想/神女 → 披帛、花瓣、云纹、水墨 |
| 首帧版式 | 中央主体占画面宽 **60%–65%**，四周 4 个小人物（同一角色，白色虚线轮廓抠像） |
| 硬性约束 | 同一张脸、同一成年年龄感、同一族裔外观、同一肤色、同发型发色、同头饰耳饰、同身材比例；**只改变穿搭，不重做人物** |
| 衣料物理 | 自然重力、转身轻微惯性延迟、停止后逐渐回落；不僵硬漂浮、不穿模、不粘连身体 |

**最容易被忽略、也最重要的两条：**
1. **首帧要为视频兼容而优化**——小人物避免极端扭曲姿势，头肩腰臂结构清晰，小人物与中央人物**身体拓扑尽量兼容**（便于重合换装），袖摆裙摆披帛完整不裁切。**图片是视频的结构母图，首帧不合格后面全废。**
2. **短时长中不要同时叠加复杂运镜与复杂换装机制。**

### 6.3 古风美人视频的六段式结构

见第 7 章 G4 模板。值得单独强调的是它的分工：`首帧锁定 → 人物表情动作 → 台词 → 镜头 → 氛围光线 → 约束`。
**仙宫类只需把"台词"段换成"环境动态"、把"人物"段缩到最小——结构完全通用。**

---

## 7 提示词模板

完整可抄的模板（仙宫中文/英文、古风美女中文/英文、头面特写、朝代切换、换装规范、负面词速查）见附录：
**→ `_parts/G-提示词模板合集.md`**

---

## 8 去 AI 味：这套工程化技巧库比提示词本身更重要

来源：[shyman159/seedance-prompts-skill · prompt-craft-and-realism.md](https://github.com/shyman159/seedance-prompts-skill/blob/main/skills/seedance-prompts-skill/references/prompt-craft-and-realism.md)（由抖音"刺猬星球superi"37 集合集蒸馏）

> **核心理念：AI 图/视频"一眼假"的根因不是模型弱、也不是提示词不够长，而是你在"许愿"而不是用视觉语言下指令。**

### 8.1 五板块结构 + 词序就是优先级

`情绪 + 主体 + 光线 + 镜头 + 细节`

- **主体词放最前**——AI 优先解析靠前的词，重点不跑偏。
- **光影词放中段**——放末尾 AI 会"不分主体随便补光"。
- **抽象词放末尾**——放前面会被当全局指令破坏主体与光影；放末尾只做整体微调。

### 8.2 把抽象词翻译成可量化视觉动作

| 你想说的 | 要写的 |
|---|---|
| 梦幻 | 低饱和 + 软光源 + 长焦压缩 |
| 高级 | 强光线对比 + 部分留白 |
| 质感 | 微弱侧光 + 高阴影对比 |

并**直接告诉 AI 不要什么**：`无纹理、无锐化`。

### 8.3 光线控制（AI 最容易露馅的地方）

- **基础三步**：① 光的方向/来源/阴影布局（别只写"摄影灯光"）；② **光比**（明确哪里亮哪里暗）；③ **色温**（偏冷=清晨雾，偏暖=傍晚风）。
- **进阶三步**：① **体积光**（光穿过什么介质 → 变成怎样的光束）；② **反光与反射色**（反射来源点/反射到哪/反射光颜色）；③ **补光层次**。

### 8.4 去 AI 感："AI 最大的问题不是不真实，而是太干净"

**去摆拍感，摆拍感来自镜头与画面关系不真实，与提示词无关**，三因三解：

| 病因 | 解法 |
|---|---|
| 取景起点完成度过高 | 让画面从**不完整视角**开始（前景遮挡/构图偏移），再用运镜去"找"画面 |
| 运动轨迹过度平滑 | 引入减速/停顿等**人为操作痕迹** |
| 主体动作与镜头完全同步 | 让**人物动作早于镜头反应**，制造"被进入的瞬间" |

**前景遮挡去 AI 味**：物理遮挡（树叶/柱子/人物背影 + 低角度 + 前景虚化；注意 **AI 遵循顺序机制，不写"虚化"它会把前景画清楚**而失去景深）+ 氛围遮挡（空气里有雪花/雾气/颗粒感）。

**电影感 = 摄影约束先于美学**：先写镜头类型/拍摄距离/光线结构，再写风格。**90% 的人上来就写氛围，AI 只停在"图像渲染"而非"真实摄影"。**

**剪词（让画面显贵）**：
- 剪**情绪词**（"高级感/电影感"对 AI 不是有效控制信息，本质还是抽卡）；
- 剪**重复词**（同义反复只会分散权重，每个信息只出现一次）；
- 剪**人类句式**（别写成讲故事的整句，拆成元素：谁在动 / 怎么动 / 镜头固定还是跟随）。

### 8.5 动作崩坏的三条规则

AI 眼里动词是"**目标状态**"不是"进行态"。

1. **减动词、增方式词**——保留一个核心动作，用"犹豫的/持续的/重心转移"限定节奏。
2. **单一主动作锁身体结构**——走路的主动作是 walking，"回头看"只是朝向变化。
3. **别用"然后/接着/同时"**——深层模型不可靠地执行时间轴；改描述"动作发生时角色处于什么状态"。

### 8.6 调色数据化

- 三步法：把审美**叫为数据**（色相分布/明暗比例/色温倾向）→ 用 JSON 控色 → 与参考图对比验证。
- **Hex 自动调色法**：上传几张参考图让模型扫描提取 Hex 色值生成专属调色板，生成时选用该色板——**把颜色控制从"后期"提前到"生成之前"**。

### 8.7 后期去 AI 味三步（带具体参数，可直接照做）

来源：[器灵科技《Seedance出的片总觉得"怪怪的"？可能是少了这三步》](https://segmentfault.com/a/1190000048034626)（2026-07-16）

**第一步：拉反差**
- S 曲线压暗部、提亮部；色温往暖推 **3%–5%（+200K）**；挂胶片模拟 LUT（**Kodak 2383 / Fuji 3513**）。
- 参考参数：对比度 **+15~20**、饱和度 **−5**。

**第二步：锐化但别狠**
- unsharp mask：amount **40–60**、radius **0.8–1.2**、threshold **2–3**。
- **降噪在前、锐化在后**——顺序反了会把压缩噪点一起放大。

**第三步：三个藏味细节（这才是拉开差距的地方）**
1. **加胶片颗粒**（35mm 400T，强度 **15–20%**）——"塑料感立刻消退"，**最快见效**；
2. **补运动模糊**（物理快门有曝光时间，AI 运动太丝滑；沿运动方向模糊 **3–5 像素**）；
3. **帧混合过渡**（分镜衔接处加 **1–2 帧交叉溶解**，透明度 80%→20%）。

> 作者的总结很到位："不是参数，是你愿不愿意多花半小时。"

### 8.8 手指与脸崩的修复参数

| 问题 | 处理 |
|---|---|
| 手指 | 提示词末尾加 `perfect hands, detailed fingers, five fingers, anatomically correct`；配合手部修复/OpenPose 固定骨骼；**仍崩就裁掉手部用局部重绘** |
| 脸 | 面部关键词权重 **1.3–1.4**，CFG 降到 **5–6**，步数提到 **30 以上**；"脸崩多半是过度优化或权重打架" |
| 权重纪律 | **1.1–1.3 最稳妥**；超过 1.5 会让发丝变钢丝、眼睛高光变成大白点 |

**通用负面词**：
```
low quality, blurry, pixelated, noise, text, subtitles, watermark, logo,
deformed, bad anatomy, extra limbs, extra fingers, oversaturated, overexposed
```
人像另加：`bad face, asymmetrical eyes, weird teeth`

⚠️ 但注意 6.1.1 的反面教训：**做珠宝/珍珠题材时，`plastic / glossy / shiny / reflective` 这几个词会误伤材质表现**，需按题材裁剪负面词，不要机械照搬。

---

## 9 一致性工程（古风美女类内容的生死线）

来源：同 8；以及 [2018 年前的经典做法 + 当前技能规范](https://github.com/liyue-aigc/female-outfit-director/blob/main/skill/SKILL.md)

**一句反直觉但极关键的结论：**
> **参考图不是"参考人物"，只是风格与结构输入。**

**三招保一致性：**
1. **人景拆分**——先生成人物多角度三视图，成为稳定可复用对象；**别和场景一起生成**。
2. **先动作、再进场景**——先让人物完成指定动作再与场景合成，避免叠加场景时重推人物结构。
3. **拆镜头降时间维度**——连续帧每多一帧多一次偏移，**尽量一个动作一段视频**。

**物料层面**：远景/中景用"人物主图 + 分场景图"拆包；特写/近景人脸崩时用 FaceRefine 类修复后处理。

### 9.1 角色一致性的七条路径（按门槛从低到高）

来源：[火星时代《AI短剧角色一致性的7种方案》](https://www.hxsd.com/content/59418/)（2026-08-11）

有文章称 **76% 的 AI 短剧创作者把"镜头一切就换人"列为第一大痛点**。七条路径：

| # | 路径 | 门槛 / 效果 |
|---|---|---|
| 1 | **图生视频 + 参考图驱动**（先出定妆照，后续只写动作） | 最低；但侧面/远景匹配度约 **55%** |
| 2 | **角色卡片 + 外貌锚点**（固定文字段每镜原样粘贴） | 低；对提示词纪律要求极高 |
| 3 | **固定 seed** | 低；同场景有效，**跨场景仍漂移** |
| 4 | **AI 换脸后期**（ReActor / InstantID） | 中；救急用 |
| 5 | **LoRA 训练**（20–50 张多角度，rank 32–64，strength 0.7–1.0） | 高；每角色 **5–8 小时** |
| 6 | **ComfyUI IP-Adapter FaceID + LoRA + ControlNet 三重锁定** | 最高天花板；需 **12GB+ 显存** |
| 7 | **全流程角色引擎**（项目级角色档案，跨集引用） | 团队级 |

**四个低成本辅助技巧**：**服装锚点法**、**快速剪辑法**（每镜 2–4 秒，观众来不及看脸）、**统一调色法**、**剪辑过渡法**。

**核心纪律：先把角色锁定，再开拍。**

**外貌锚点串的写法（每一镜原样粘贴，不要改写）：**
```
角色C01：25岁亚洲女性，鹅蛋脸，杏仁眼，右眼下方浅色小痣，
黑色齐肩直发，三七侧分，银色圆形耳环。
```
> 纪律原话："不要把'齐肩直发'改成'中长发'，不要交替使用'清秀''妩媚'等主观词——**每个词都会导致模型重新推断面部**。"

**声音一致性**（AI 视频最易露馅的是声音）：建**角色声音参考库**（把满意片段的音频抽出来存独立文件，每次生成上传作参考）+ 独立配音模型锁定音色 + **情绪声音库**（同一角色"正常/愤怒/伤心"样本按剧情选用）。

---

## 10 本地复现（RTX 5060 Ti 16GB / Blackwell sm_120）

完整方案（量化档位、50+ 个可验证的 Civitai 资源、三套节点级工作流、显存与耗时表）见附录：
**→ `_parts/C-本地ComfyUI复现方案.md`**

### 10.1 本卡实测数据（照抄即可，不用再试错）

**出图：**

| 模型 | 配置 | 耗时 |
|---|---|---|
| **FLUX.1 Krea dev** | fp8_e4m3fn 或 GGUF Q8，992×1440 / 20 步 | **≈53 秒**（冷启含加载 121.7s） |
| FLUX.1 Krea dev | + DyPE，1440×2560 | **≈94 秒** |
| **Qwen-Image** | Q4_K_S（12.14GB），Lightning 4 步，1080×1360 | **≈21~23 秒** |
| FLUX.2 dev | fp8 33GB（需 **83GB 总内存**）/ GGUF Q5 992×1440 | **>4 分钟** → ❌ 本机不实用 |

> **结论：写实古风首选 FLUX.1 Krea dev；中文提示词、画面内题字、换镜头首选 Qwen-Image（4 步版）——同样时间里 Qwen-Image 能出 5~8 张。FLUX.2 dev 明确不推荐**（官方 fp8 20.43GB 的 Qwen-Image 同样必 OOM，必须走 GGUF Q4_K_S）。

**视频（这是最硬的一组数据）：**

| 模型 | 分辨率 / 帧 | 耗时 |
|---|---|---|
| **Wan2.2 I2V 14B**（High Q8 + Low Q6 + BlockSwap + Sage + TorchPatch） | 496×720 / 81f | 冷启 222.8s → **热启 133.2s** |
| 同上 | 496×720 / 97f | **158.6s** |
| **HunyuanVideo 1.5**（720p i2v cfg-distilled fp8） | 496×720 / 97f | **198.0s**（慢些但更省显存、物理更真） |
| **LTX-2.5 22B**（Q3_K_M GGUF，10.73GB） | 1920×1088 / 97f | **183.1s**，峰值 14.1–15.5GB，**带同步音频** |
| **MiniMax H3**（已有） | 864×480 / 5.17s / 20 步 + EasyCache | **194s**；**无 EasyCache 是 633s** |

### 10.2 这块卡上最大的提速杠杆：EasyCache

**ComfyUI 原生 EasyCache** 在 H3 上把 **633s → 194s（3.3×）**，在 FLUX.2 GGUF 上把 20 步 181s → 91s。**同一张 5060 Ti 的两篇公开实测差异全部来自它。** 开它比换模型更有效。

### 10.3 sm_120 的四个必踩坑

| 坑 | 现象 | 处理 |
|---|---|---|
| **PyTorch CUDA 版本** | 低于 cu128 的轮子无 sm_120 kernel → `no kernel image is available` | 必须装 cu130（或 cu128）轮子 |
| **requirements 顺序** | `torch` 未 pin，在装完 CUDA13 栈后再跑 `requirements.txt` 会**静默覆盖回默认源、失去加速** | **顺序固定：`requirements.txt` 先，CUDA 13 栈最后装**；启动日志必须看到 `+cu130` 与 comfy-kitchen CUDA backend `available: True` |
| **Triton / SageAttention** | sm_120 的 triton 支持滞后 | 不强求 triton；SageAttention 走源码编译（`--no-build-isolation` **必须**，否则 pip 会拉第二份 torch）。**sm_120 上所有显式模式都崩，只留 `auto`** |
| **32GB 内存 + pinned memory** | H3 这类大模型被 OOM-killer 杀 | 启动加 **`--disable-pinned-memory`**（实测：默认 29,866MB 被杀 → 7,508MB 跑通） |

**ComfyUI 版本地板**：MiniMax H3 核心节点自 **v0.30.0**，LTX-2.5 自 **v0.32.0**，Krea 2 自 **0.25.0**。建议直接跟 master。

### 10.4 古风资源：老生态最全，Flux 侧靠组合

**关键发现：汉服、仙侠、古建类 LoRA 绝大多数是 SD1.5 / SDXL / Illustrious 底模**，Flux 侧资源较少，需要靠"通用古风 LoRA + 光影 LoRA + 提示词"补。

**可直接检索到的资源（均经 Civitai API 逐条验证，下载量附后）：**

| 类别 | 代表条目 | 底模 / 下载量 |
|---|---|---|
| 仙侠风格 | `仙侠道/xianxia/taoist/法天象地` | SD1.5 / 5,099 |
| | `PAseer 的仙侠之境` | SD1.5 / 6,613 |
| | `xianxia` | **Flux.1 D** / 304 |
| | **`ChineseXianxiaStyle`** | **LTXV 2.3** / 447 ← **可直接进视频侧** |
| 国风底模 | `国风3 GuoFeng3` | SD1.5 / **160,805** |
| | `国风4 GuoFeng4 XL` | SDXL / 27,357 |
| 汉服 | `hanfu 汉服` | SD1.5 / **106,378** |
| | `汉服合集 [Flux.1] Hanfu Collection [Female]` | **Flux.1 D** / 4,867 |
| | `hanfu tang / song / ming` | SD1.5 |
| 古建 | `Ancient Chinese architectural style` | SD1.5 / 11,191 |
| 珠宝 | `jewelry Slider` | Pony / 4,105 |
| | `GemstoneAI - konyconi` | SD1.5 / 9,081 |
| 打光 | **`Backlight (Hair light) cinematic lighting`** | Flux.1 D + SDXL / 3,901 ← 轮廓光/发丝光 |
| | `Cinematic "Warm Light" 3200k` | 多底模 / 12,361 |
| | `Cinematic Volumetric (God Rays)` | 多底模 / 6,233 |
| 降 AI 味 | `NL2 \| film grain & chromatic aberration` | Illustrious |
| | `FilmGrain.Redmond` | 多底模 |

> **「云海」没有专门的 LoRA**——Civitai 无有效结果，走提示词 + 体积光 LoRA：
> `sea of clouds, cloud ocean, aerial view above clouds, volumetric god rays, mist, atmospheric perspective, ethereal`
>
> ⚠️ Civitai 官方域名在本网被 DNS 污染，实际下载走 `civitai.red` 镜像（API key 见 `~/Downloads/civitai_api_key.txt`）。LiblibAI 站点可达但搜索 API 返回 500，需手工站内搜。

**推荐权重组合（Flux Krea dev 基准）：**
```
古风底味：     风格 LoRA (xianxia/古风)         0.5 ~ 0.7
服装：         汉服 Collection [Flux.1]         0.7 ~ 0.9
配饰：         Jewelry Gemstone Pearl Diamond   0.6 ~ 0.8
打光：         Backlight (Hair light)           0.6 ~ 0.8   ← 轮廓光/发丝光
               Cinematic Warm Light 3200k       0.5 ~ 0.7
氛围：         Volumetric God Rays              0.4 ~ 0.6
质感：         film grain & chromatic aberration 0.3 ~ 0.5  ← 最后加
加速：         Flux Lightning 8step             0.6 ~ 0.8
换脸：         BFS 换脸 LoRA                    0.8         （1.0 会出画面问题）
```
**经验规则**：风格类 ≤0.8、材质/光照类 ≤0.8、加速类 0.6~0.8、颗粒类 ≤0.5。
**总 LoRA 数超过 4 个时 Flux 会掉细节** → 串成两级采样（第一级只放风格+服装，第二级只放打光+颗粒）。

### 10.5 本地一致性技术（这块本地比云端有优势）

| 方案 | 16GB 可行性 | 用途 |
|---|---|---|
| **三视图 + ref2v**（已有 H3 工作流） | ✅ 已在用 | 最强的身份锚定；配 `h3-turnaround-autoprep` 技能先裁出正面图 |
| **Qwen-Image-Edit 2509 + BFS 换脸 LoRA(0.8)** | ✅ 4 步加速后 20~35s/张 | 把已定妆的脸批量贴到不同镜头/角度（v1 保脸型、v2 换整头） |
| **PuLID for FLUX** | ✅（约 +2~3GB） | 单张参考图锁脸，比 InstantID 轻 |
| FLUX Redux | ✅ | 保风格/构图/服装，**不保脸**；权重 0.4~0.6 |
| FLUX.1 Kontext dev | ✅ | 指令式编辑："同一个人换到侧脸/换背景" |
| InstantID / IP-Adapter FaceID | ⚠️ 需 `insightface`，Py3.13 编译常失败 | SDXL 老工作流 |

**跨镜头配方**：① 出定妆照锁 seed → ② Qwen-Image-Edit 2509 + BFS(0.8) 生成 3~5 个角度 → ③ 每镜头 `参考图 + 服装 LoRA 0.8 + 打光 LoRA 0.7 + Redux 0.5` → ④ 视频阶段统一用同一参考图走 Wan2.2 I2V 或 H3 ref2v。

> ⚠️ 注意：**LTX-2.5 上身份漂移与分辨率绑死**——640×320 会明显漂，768×448 以上才稳。

### 10.6 本地 vs 云：怎么分工

**单条 5 秒 720p 成品本地链路**：关键帧 60s + 放大 30s + I2V 150s ≈ **4 分钟/条**；一天 8 小时名义可出 100~120 条，**含试错打 5~8 折 → 实际 15~30 条可用**。电费不到 1 分钱/条。

**云价对照（2026 公开价）**：Kling 2.1 Standard **$0.07/5s**、Pro $0.28/5s、Seedance 2.0 $0.30、Veo3 $0.50。

> ⚠️ **但云价的真实成本要乘 2.5× 以上**：失败率 10~15% + 平均需 2~3 次迭代，行业实测"一条能用的 AI 视频，实际成本是标价的 **5~20 倍**"。

| 环节 | 放哪 | 理由 |
|---|---|---|
| 概念探索、构图、风格试错 | **本地** | 秒级反馈，零边际成本 |
| 古风 LoRA 调权重、打光试错 | **本地** | 需要几十次快速迭代 |
| 关键帧定稿 + 放大 | **本地** | 2K 出图本地已够用 |
| 人物一致性镜头（同一人多角度） | **本地** | 云端无对应开源级控脸能力 |
| 纯场景/运镜镜头（仙宫航拍、云海） | **本地 Wan2.2 / LTX-2.5** | 130~200s/条可接受 |
| 带对白/音效的镜头 | **本地 MiniMax H3**（已有） | 唯一本地同步音频方案 |
| 复杂多人交互、需 1080p 物理正确 | **上云 Kling Pro / Veo3** | 本地 16GB 做不到稳定 |
| 商业终稿、客户交付素材 | **上云** | 质量与一致性上限更高 |

> **一句话策略**：**本地承担 80% 的迭代 + 所有关键帧 + 所有身份一致性工作；云端只买"复杂动作 + 1080p 终稿"这两个本地做不到的能力。**

**与本机已有 H3 工作的分工建议**：**H3 出"有人物 + 要说话/有音效"的镜头，Wan2.2 出纯场景/运镜镜头。**

---

## 11 成本与变现（这段最容易被忽略，也最容易亏钱）

### 11.1 真实成本结构

**栖光口径**（个人号）：一般画质 50–60 元/条，4K 100–300 元/条。

**即梦价目表口径**（[蓝鲸财经/东方财富](https://finance.eastmoney.com/a/202604103701040886.html) + [娱乐资本论/澎湃](https://m.thepaper.cn/newsDetail_forward_32940440)，2026-04-10）

| 档位 | 年费（原价） | 首充优惠 | 月积分变化 |
|---|---|---|---|
| 基础 | **659 元/年** | 5 折 → **6 折** | 1080 → **725** |
| 标准 | **1899 元/年** | 5 折 → 6 折 | 4000 → **2210**（砍半） |
| 高级 | **5199 元/年** | 5 折 → 6 折 | 15000 → **6160**（另一来源记为 5870） |

> 两个来源的价格看起来不同（329/949/2599 vs 659/1899/5199），实际是**首充五折价 vs 原价**的关系：659×0.5≈329、5199×0.5≈2599。改六折后即 395/1139/3119，**每档每年多交约 500 元**。

- **单条 15 秒视频**：高级会员原 45 分（4 折）→ **120 分**；Seedance 2.0 VIP 免排队通道 **210 分**。
- 从业者测算：涨价前 15000 积分可做 **333 条** 15 秒（83 分钟）；涨价后 6160 积分只能做 **29 条**（7 分钟）。
- 连续包月 499 元/月。
- 横向比：**0.335 元/秒**仍算性价比 T0。
- **涨价的原因是算力**：Seedance 2.0 全量开放首日**排队 8–10 小时**，部分用户等 **24 小时**；为错峰，很多漫剧公司**半夜 3 点上班**，有的改到早上 6–7 点。另有"工作日排队、周末不排队"的现象，以及"排队 30 分钟仍 0% 进度"的故障报告。

**可灵价目表口径**（[Modellix 引官方页](https://www.modellix.ai/blog/kling-ai-pricing-per-month/)，2026-08-14）

| 档位 | 首月 / 续费 | Credits |
|---|---|---|
| Standard | $6.99 / $8.80 | 660 |
| Pro | $25.99 / $32.56 | 3000 |
| Premier | $64.99 / $80.96 | 8000 |
| Ultra | $127.99 / $159.99 | 26000 |

免费 66 credits/天、**24 小时过期**。VIDEO 3.0 每秒消耗：**720p 无音频 6 / 1080p 无音频 8 / 1080p 原生音频 12 / 4K 30 credits**。
- 一条 5 秒 1080p 无声 ≈ 40 credits（Pro 续费价约 $0.43）
- 一条 10 秒 1080p 带原生音频 ≈ 120 credits（约 $1.30）

（国内"黑金连续包月 169 元/月"来自第三方测评文，**未证实**。）

**工业化口径**：《斩仙台》算力约 10 万元 / 约 3240 个镜头 ≈ **31 元/镜头**。

### 11.1.1 失败率：价目表上的钱要除以 3–5

- **可灵侧，生成的失败任务仍消耗 credits，没有公开的自动退还政策**（Modellix）。
- 实际工作流通常**每个可用镜头要 3–5 次尝试**——所以要把"每月可生成的视频数"**除以 3–5** 才是真实产能。
- **爆款节奏参考**：15 秒拆 **6–10 个镜头**、30 秒 10–16 个、60 秒 16–26 个，**每镜 1.5–3 秒最舒服**。"新手别做 6–8 秒的长镜头，稳定性差，出片概率低。"仙宫类成品通常**无台词无字幕**，爆款案例长度为 **33 秒**。

### 11.2 完整成本公式

```
总成本 ≈ 单位成本 × 镜头数 × (1 + 返工率)
```

- **单位成本**由平台定价决定，创作者被动接受（一年调三次价）；
- **镜头数**由体裁决定（33 秒奇观流 ≈ 5–10 镜头；3 分钟剧情流 ≈ 50 镜头）；
- **返工率是唯一由技术能力决定的因子**，也是唯一能靠方法把成本压掉一半以上的因子。

**返工率的实际差距**（[器灵科技复盘](https://segmentfault.com/a/1190000047955112)）：
- 经验不足者**返工率 >50%**——一个镜头平均跑 2–3 版；
- 用"按镜头类型分流模型 + 双 seed 取优"可把返工率压到 **18%–20%**；
- 一条 3 分钟 50 镜头短剧：理想最低 **约 200 元**，实际平均 **350–600 元**。

**按镜头类型分流模型的策略：**
```
特写 / 近景  → 面部保持最好的模型（保证角色不出戏）
全景 / 场景  → 场景还原度高的模型（保证氛围）
运动镜头    → 动态流畅的模型（保证过渡自然）
```

### 11.2.1 云价的"真实成本"要乘 2.5× 以上

标价单秒数字**不能直接用来报价**：
- **失败率 10%–15%**（可灵侧失败仍扣 credits，无公开自动退还政策）；
- **平均需 2–3 次迭代**；
- 因此**真实成本 ≈ 标价 × 2.5**，再叠加抽卡损耗，行业实测结论是：**"一条能用的 AI 视频，实际成本是标价的 5–20 倍"**。

这条与 C 部分的本地电费对照（4 分钟/条，电费不到 1 分钱）结合起来，就是"本地做迭代、云端买终稿"这个策略的全部理由。

### 11.3 变现：**靠平台分成基本不可能回本**

| 平台 | 模式 | 实际收入参考 |
|---|---|---|
| 抖音 | 中视频计划 + 广告分成 | **10 万播放 ≈ 30–80 元**；百万播放 ≈ 300–800 元 |
| 红果短剧 | 独家签约或播放分成 | 相对稳定，但对更新频率与剧集质量要求高 |
| 快手 | 光合计划 + 流量分成 | **新手扶持期后播放量断崖式下降很常见** |

**两个残酷数字：**
- **AI 短剧完播率普遍比真人低 30%–40%**；平台算法对 AI 内容的推荐权重本身偏低。
- 某创作者 20 条短剧、总播放约 180 万，分成合计 **不到 900 元**，API 成本约 2400 元——**每条净亏约 75 元**。

> 但这与栖光"靠流量收益基本打平"并不矛盾：**奇观流（33 秒无台词）的完播率天然高于剧情流**，且他有日更 + 50 万粉的规模效应。**个人号做奇观流可以打平；做剧情流靠分成必亏。**

**真正赚钱的是商单**：新人单条定制 500–2000 元，有粉丝基础可报 3000–8000 元。真实项目：一条净亏 95 元的短剧，因被品牌看中做 3 条定制 @1500 元，**进账 4500 元**。

**值得试的方向**：品牌剧情类短剧 / 悬疑恐怖科幻垂类（观众对画面真实感要求低、对创意氛围要求高；有账号做到 90 秒内、前 5 秒抛钩子，完播率稳定 45%+）/ 素材批量销售。

---

## 12 音频与配乐（仙宫类的高级感有一半来自声音）

### 12.1 声音克制，画面才显得大

天宫类视频普遍采用极简声音设计：**高空风声 + 轻微衣袂声 + 远处鹤唳 + 编钟余韵**。行者AI视频的 5 秒提示词里明确写了"环境声以高空风声和轻微衣袂声为主"。

### 12.2 Suno 国风：把"国风"拆成乐器 + 演奏法 + 情绪 + 场景

来源：[谱乐AI《Suno 国风提示词指南》](https://yourmusic.fun/blog/suno-chinese-style-prompts)

**黄金三角结构**：
```
主旋律乐器（1件）+ 和声/衬托乐器（1件）+ 打击/节奏乐器（1件）
例：古筝（主旋律）+ 洞箫（衬托）+ 大鼓（节奏）
```

**仙宫/天庭直接可用：**
```
Chinese court music, pentatonic scale, pipa and yangqin and small drum, elegant, bpm-88,
refined ornamentation, silk and bamboo ensemble, palace hall with lanterns, instrumental
```
**苍凉空镜可用：**
```
Chinese folk, pentatonic scale, xiao and guqin, desolate, bpm-65, slow and sparse,
wind effect, horse bell in distance, desert outpost atmosphere, instrumental
```

**搭配逻辑**：情绪相近、音色互补（古琴+洞箫 = 一弦一气；琵琶武曲+大鼓 = 一旋律一节奏）。情绪相悖要慎重（洞箫+唢呐、古琴+快速打击乐、葫芦丝+编钟）。

⚠️ 已知坑：[Suno 生成古风音乐容易带电子味](https://www.php.cn/faq/2745316.html)，需加抑制词。

### 12.3 音效与原生音频

- **ElevenLabs 视频转音效**：为已有视频生成匹配音效；其音效模型 V2 支持长片段、无缝循环与高保真（[报道](https://www.aitop100.cn/infomation/details/28896.html)）。
- **Kling 3.0 Omni / Seedance 2.x / Veo 3.1 原生音频**：图生视频时同步生成音效与对白，**省掉独立配音环节**——这是"音画一体"模型相对传统链路的结构优势。Kling 3.0 的 Omni Audio 与视频**同一前向过程**生成，音素在扩散阶段对齐口型；Hailuo 3 原生 32kHz 立体声。

### 12.4 工具与授权（2026 时点）

| 工具 | 价格 | 关键限制 |
|---|---|---|
| **Suno v6**（2026-09-11 发布） | 免费档 v6-mini；Pro **$8/月**；Premier **$24/月** | 首个**用正版授权音乐训练**的版本（华纳、BMG、Believe/TuneCore），支持段落级编辑与混音；⚠️ **索尼、环球版权诉讼仍在进行，授权尚未全覆盖** |
| **ElevenLabs** | Starter **$5/月**（有商用权 + 即时克隆）、Creator $22（专业克隆、192kbps）、Pro $99、Scale $330、Business $1,320 | **Free 档无商用权**——做付费内容**至少 Starter** |
| **Topaz Video AI** | 2025-10 起订阅制：Personal **$299/年**、Pro **$699/年** | 价格来自竞品博客，**建议官网复核**；典型链：Starlight/Astra 生成式放大 → Proteus 细修 → Apollo/RIFE 补帧 → 稳定 |

### 12.5 仙宫环境音清单（直接写进提示词的 audio block）

```
high-altitude wind, distant bronze bell, crane calls, waterfall,
temple chime, fabric rustle, stone footsteps
```

**Suno 国风关键词串**：
```
guqin, guzheng, dizi bamboo flute, pipa, bianzhong bronze bells,
pentatonic, guofeng, cinematic Chinese fantasy score, sparse, 60 BPM, no vocals
```

> **"中式天庭"类爆款的共同点是：无台词、无字幕，只靠画面 + 环境音。** 这恰恰规避了 AI 口型与配音的短板，也让它**无需翻译即可跨国传播**。

### 12.6 调色的一个专业细节

国外团队在 DaVinci 里调 AI 生成的仙宫片时的重点不是加饱和，而是**降饱和 + 分离色相**——AI 出图常见"全局橙金滤镜"和"灰雾吞色"，需要把**白玉/云层/皮肤拉回中性**，只让**朱红与暖金保持高纯**。这与第 8 章"减法审美"是同一件事。

---

## 13 合规：AI 标识是硬性要求

来源：[抖音黑板报公告](https://api.app.anhuinews.com/content/9545386.html)

- **2025-09-01**《人工智能生成合成内容标识办法》正式实施；
- **2026-05** 抖音发布《抖音内容标识使用规范》：**使用平台 AI 特效或第三方 AI 工具生成的内容，应添加"内容由 AI 生成"的标识。**

**平台能力（可识别、可提示、可追溯）**：AI 内容标识功能 + **元数据标识读写**（可识别并写入，用于溯源）+ **AI 内容检测模型矩阵**。

**平台会自己加标识的情况**：核验/检测站内**未主动标识**的内容是否由 AI 生成，对疑似 AI 内容或元数据含 AI 标识的作品**补充添加显式标识**；通过抖音账号直接制作发布的 AI 内容，平台**主动添加显式标识**；所有 AI 内容同步添加/更新**隐式标识**。

**风险**：平台对**故意规避 AI 标识、滥用 AI 内容**开展主动治理，并**排查历史投稿**的"标识缺失、标识不规范、漏标识"。

> **落地建议**：把"发布时勾选 AI 声明"写进 SOP。不要试图靠去元数据、二次转码规避。
> 另外注意：**海外平台（YouTube/TikTok）同样要求 AI 内容披露**，跨平台分发时两边都要声明。

---

## 14 上手路线（三档，按投入选）

### 档位 A：零基础验证（1 天，几十元）

1. 装两个技能包（[xianxia-visual-director](https://github.com/liyue-aigc/xianxia-visual-director) + [xianxia-cinematic-video-director](https://github.com/liyue-aigc/xianxia-cinematic-video-director)）到豆包；
2. 出图（Seedream 4.5）→ 挑最好的 1–2 张；
3. 图生视频（Seedance 2.5），用 5.4 的三步法；
4. 配 Suno 国风 BGM + 极简环境音；
5. 剪映合成 9:16，发布并勾选 AI 声明。

**目标**：先跑通链路，看看自己脑子里的画面能不能做出来。

### 档位 B：稳定出片（1–2 周，日产 1 条）

1. **建自己的提示词 Skill**——把第 5 章天宫规则、第 6 章头面规则固化成清单（行者AI视频的做法：把规则写成 Skill，下次换题材只改主体和构图元素）；
2. **出图侧**用 Midjourney/Seedream 批量抽卡，一次出 30–50 张挑 5 张；
3. **视频侧**严格锁首帧 + 小尺度运镜，单镜头 5 秒，一条 33 秒 = 6–7 个镜头；
4. **物料拆包**：人物主图 1 张 + 场景图 5–6 张；
5. **按镜头类型分流模型** + 双 seed 取优，压返工率；
6. 建立**声音参考库**与**情绪声音库**。

**目标**：把单条成本压到 50–100 元、返工率压到 20% 以下、做到日更。

### 档位 C：本地流水线（1 个月，硬件已就位）

1. **先把底座修对**：装 cu130 轮子（`requirements.txt` 必须先跑）、启动加 `--disable-pinned-memory`、SageAttention 只选 `auto`、**打开 EasyCache**（本卡 3.3× 提速）；
2. **图像侧本地化**：FLUX.1 Krea dev fp8（992×1440/20 步 ≈53s）出关键帧；快速迭代用 Qwen-Image Q4_K_S 4 步版（≈21–23s/张）；中文题字/换镜头用 Qwen-Image-Edit 2509 + BFS 换脸 LoRA(0.8)；
3. **按第 10.4 节的权重组合配 LoRA**（风格 ≤0.8、材质/光照 ≤0.8、加速 0.6–0.8、颗粒 ≤0.5；超 4 个 LoRA 要串两级采样）；
4. **视频侧本地补位**：纯场景/运镜走 Wan2.2 I2V 14B（496×720/97f ≈159s）；要音频走已有 MiniMax H3（≈194s）；长镜头草稿可用 LTX-2.5（1080p/4s ≈183s，带音频）；
5. **云端只留两个口子**：复杂多人交互 + 1080p 商业终稿。

**目标**：图像成本归零，把省下的钱全部投给视频算力。

### 档位 D：出海（在档位 B 基础上加三步）

1. **先建 Moodboard**：MJ 跑 30–50 张仙宫图建风格板，固定 `--sref --sw`，确定"一个主色 + 一个点缀色"（例：月白 + 朱红鎏金）；
2. **换分发逻辑**：Shorts 首要信号是 **swipe-away rate**，**前 1–2 秒直接给最大景别**，封面用最贵的那一帧，标题用提问式（`What Chinese people imagine heaven looks like`），话题带 `#ChineseHeaven` / `#Chinamaxxing`；
3. **音画一体**：把 audio block 直接写进视频提示词（Kling 3.0 Omni / Veo 3.1 / Hailuo 3 都支持），省掉配音环节——**无台词无字幕反而是优势，跨国传播零损耗**。

**出海专属的一条纪律**：**不要把"角色一致性"当成仙宫题材的必做项**。仙宫要的是**空间一致性**；只有做古风美人时才需要投入身份训练（Soul ID / 参考图包），而那会把成本推高 3–5 倍。

---

## 15 避坑清单（按血泪值排序）

| # | 坑 | 正确做法 |
|---|---|---|
| 1 | 一上来就写"唯美震撼、电影感、高级感" | 五板块结构 + 把抽象词翻译成可量化视觉动作（8.2） |
| 2 | 跑大运镜（穿云、俯冲、环绕宫殿） | 慢推/轻移/缓慢抬升三选一；画面越大越要少动 |
| 3 | 远景人物画太大 | 远景压到 **1%–4%**（中景 5%–8%，近景 12%–20%） |
| 3b | 用一个主运镜以外的第二、第三个运动指令 | **一段只保留一个主运镜**；"缓慢推进"必须是摄像机空间位移，禁止数码放大冒充 |
| 3c | 首尾帧用复杂运镜硬接 | 首尾帧差异**必须能由真实摄影机路径解释**，否则改首帧或尾帧 |
| 3d | 给珠宝/珍珠题材照搬通用负面词 | `plastic / glossy / shiny / reflective` 会误伤珍珠高光，需按题材裁剪 |
| 4 | 没锁首帧就直接写动作 | 先锁首帧，再写"看得见的动作" |
| 5 | 把参考图当"参考人物" | 参考图只是风格与结构输入；人物一致性靠人景拆分 + 三视图 |
| 6 | 发饰材质只写 gold / jade | 写工艺（filigree/granulation）+ 透感（translucent/inner glow） |
| 7 | 用 `flat lighting` / `even lighting` | 明确主光方向 + 金属镜面高光 + 玉石次表面散射 |
| 8 | 用矩形缩略图替代人物抠像（换装） | 必须沿真实身体轮廓裁切的完整抠像 |
| 9 | 短时长里同时堆复杂运镜和复杂换装 | 二选一 |
| 10 | 剧本写满微表情和高速武打 | 改剧本避开；用镜头语言兜底 |
| 11 | 提示词堆 40+ 个关键词 | 控制在 **15–25 个**，过多分散注意力 |
| 12 | 负向限制词写十几条 | 选 3–5 个最相关的 |
| 13 | 全部镜头用同一个模型死磕 | 按镜头类型分流（特写/全景/运动） |
| 14 | 靠平台分成指望回本 | 奇观流可打平；真钱在商单，把片子当作品集 |
| 15 | 发布不勾 AI 声明 | 硬性要求，且平台会追溯历史投稿 |
| 16 | 还照着 Sora 的教程做 | **Sora App/网页 2026-04-26 已关停、API 2026-09-24 下线**；换 Seedance/可灵/Wan/MiniMax |
| 17 | 以为 Veo 4 已发布 | **Veo 4 从未发布**，官方仍是 Veo 3.1；Google 转向 Gemini Omni |
| 18 | 直接把"角色一致性"套到仙宫题材上烧钱 | 仙宫吃**空间一致性**；角色一致性成本是它的 3–5 倍，别用错力气 |
| 19 | 每条提醒词都从零写 | 建 **Moodboard 风格板 + 角色四联表**，把一次成功变成可复用资产 |
| 20 | 封面上放小字 / 开场黑屏 | 封面用**最贵的那一帧**；前 2 秒直接给最大景别 |

---

## 16 附录索引

| 文件 | 内容 |
|---|---|
| **`速查卡.md`** | **一页纸速查：开工前必记的 5 个数、六步链路、四板斧、去 AI 味三招、成本速算、发布前 8 项检查** |
| `_parts/A-国内平台链路.md` | 国内平台（即梦/可灵/海螺/Vidu/万相/混元/PixVerse/剪映/Liblib）链路与 10 条可抄中文提示词 |
| `_parts/B-国外链路.md` | 国外链路（Midjourney/FLUX/Veo 3.1/Kling 3.0/Runway Gen-4.5/Seedance 2.5/Hailuo 3/Higgsfield）与 15 条英文提示词、完整价格表、3 个海外案例 |
| `_parts/C-本地ComfyUI复现方案.md` | RTX 5060 Ti 16GB 本地 ComfyUI 完整复现方案 |
| `_parts/D-案例与核心技法.md` | 标杆案例细读 + 仙宫/古风美女技法原始素材 |
| `_parts/E-成本合规与分发.md` | 成本数据、算力排队现实、AI 标识合规、分发约束 |
| `_parts/F-变现与音画.md` | 变现复盘、Suno 国风配乐、降返工率策略 |
| `_parts/G-提示词模板合集.md` | **全部可直接抄用的提示词模板**（含天宫规约完整示例与 14 项质量检查清单） |

---

## 17 主要来源

**案例与报道**
- [封面新闻/网易：中式天庭海外破 500 万，创作者是成都 90 后眼镜店老板](https://www.163.com/dy/article/L3RIHBEN0514D3UH.html)
- [数艺社/网易：爆火海外的中式天宫 AI 视频，零提示词新手也能一键复刻](https://www.163.com/dy/article/L5LO75TN05340TH8.html)
- [红星新闻/搜狐：《斩仙台》6 天播放破亿，AI 正在让短剧行业走向工业化](https://news.sohu.com/a/1000949480_116237)
- [觉醒AI知识库：折腾 48 小时，我把神话里的天宫做成了 AI 视频（附生图和运镜 Skill）](https://www.jxxy.net/ai/articles/joshesye-2087709684719292687/)

**技法**
- [FlowPix：AI 绘画古风发饰怎么画不塑料？步摇簪钗提示词与材质拆解](https://www.flowpixai.com/ai-art/ai-hair-ornament.html)
- [gjgagvg/tiangong-image-prompt-generator：东方天宫世界观生成规约](https://github.com/gjgagvg/tiangong-image-prompt-generator)（第 5 章规则来源）
- [Hailuo AI 官方：Prompting Specular Highlights for Luxury](https://hailuoai.video/pages/knowledge/specular-highlights-luxury-ai-video-guide)
- [Runway Gen-4 Video Prompting Guide](https://help.runwayml.com/hc/en-us/articles/39789879462419-Gen-4-Video-Prompting-Guide)
- [shyman159/seedance-prompts-skill：提示词工程底层机制与去 AI 感技巧库](https://github.com/shyman159/seedance-prompts-skill/blob/main/skills/seedance-prompts-skill/references/prompt-craft-and-realism.md)
- [Wayhhow/ai-video-shot-prompt-skill：关键词库](https://github.com/Wayhhow/ai-video-shot-prompt-skill/blob/main/references/keyword-library.md)
- [liyue-aigc/female-outfit-director：女性换装导演技能规范](https://github.com/liyue-aigc/female-outfit-director/blob/main/skill/SKILL.md)
- [火星时代：AI 短剧角色一致性的 7 种方案](https://www.hxsd.com/content/59418/)
- [器灵科技：Seedance 出的片总觉得"怪怪的"？可能是少了这三步](https://segmentfault.com/a/1190000048034626)
- [青虎AI：电影级古风美人 4K 视频提示词](https://prompts.iqinghu.com/zh-CN/video-prompts/youmind-ancient-chinese-beauty-4k-video)

**国外链路**
- [Midjourney 官方更新：V8.1 Alpha](https://updates.midjourney.com/v8-1-alpha/)、[V8.2](https://updates.midjourney.com/version-8-2/)
- [Modellix：Kling AI Pricing Per Month (2026)](https://www.modellix.ai/blog/kling-ai-pricing-per-month/)
- [YouTube Shorts 算法 2026](https://dev.to/kyle_clipspeedai/youtube-shorts-algorithm-in-2026-what-actually-determines-whether-your-clip-gets-pushed)
- [Kompas：TikTok AI 汉服变装教程（Chinamaxxing 趋势）](https://www.kompas.com/tren/copy/2026/01/26/120000765/cara-edit-foto-ai-pakai-hanfu-ala-drama-china-yang-viral-di-tiktok)

**市场与成本**
- [澎湃/娱乐资本论：即梦为何敢单月三次调价？](https://m.thepaper.cn/newsDetail_forward_32940440)
- [器灵科技：AI 短剧能赚钱吗？一个真实的变现复盘](https://segmentfault.com/a/1190000047955112)
- [BenchmarkList / Artificial Analysis 文生视频榜（2026-09-02 快照）](https://benchmarklist.com/arenas/artificial_analysis_text_to_video/)
- [澎湃/雷科技：Sora 为何"暴毙"？](https://m.thepaper.cn/newsDetail_forward_32829843)
- [VentureBeat：OpenAI is shutting down Sora](https://venturebeat.com/technology/openai-is-shutting-down-sora-its-powerful-ai-video-app)

**音频与合规**
- [谱乐AI：Suno 国风提示词指南](https://yourmusic.fun/blog/suno-chinese-style-prompts)
- [抖音黑板报：事关 AI 合成内容标识，抖音发布最新公告](https://api.app.anhuinews.com/content/9545386.html)
- [ElevenLabs：为 AI 视频添加音效](https://elevenlabs.io/zh/blog/how-to-add-sound-effects-to-your-video-with-elevenlabs-video-to-sound-generator)
