# D 部分：标杆案例 + 仙宫/古风美女核心技法（DSH 主调研员）

> 本部分为自查证内容，来源均为公开报道与创作者本人的拆解，URL 附在各节。

## D1 标杆案例：这波内容的钱和人在哪

### D1.1 「中式天庭」——栖光（陈爱军），眼镜店老板的意外出海

来源：[封面新闻/网易转载](https://www.163.com/dy/article/L3RIHBEN0514D3UH.html)、[四川新闻网](https://scnews.newssc.org/system/20260808/001632696.html)

| 维度 | 事实 |
|---|---|
| 作者身份 | 陈爱军，1991 年生，成都眼镜店老板，非设计科班，"纯小白"自学 AI 近两年 |
| 工作流 | **Midjourney 出图 → 可灵 / 即梦 转视频**（两句原话，没有更复杂的链路） |
| 爆款 | 一条 **33 秒**无台词无字幕短视频，被网友搬运至海外平台，**不到 4 天播放破 500 万**、4.8 万赞、转发 9700+ |
| 二次放大 | 外交部发言人毛宁在个人账号转发，配文"中式天堂长什么样"（[数艺社报道](https://www.163.com/dy/article/L5LO75TN05340TH8.html)） |
| 产量 | 抖音 50 万+ 粉丝，200+ 条作品，接近**日更**；单条制作 **4–5 小时**（状态好 2–3 小时） |
| 成本 | 画质要求不高 **50–60 元/条**；4K 画质 **100–300 元/条**；200 多条累计投入"数万元" |
| 变现 | 只靠抖音平台流量收益，未做商业授权；收支基本打平 |
| 下一步 | 计划 2026 年底/2027 年初做**中国风修仙向 AI 短剧** |

**读出来的三个关键结论：**
1. **链路极简也能出爆款。** MJ + 可灵/即梦 就够，爆的是**审美选题**（云海、白玉长廊、飞檐、红衣小人物），不是技术栈。
2. **"没有人"反而更安全。** 无台词、无字幕、人物极小，规避了 AI 最弱的三件事：口型、微表情、手部。
3. **出海是被动的。** 他没有海外号，是搬运带来的自然流量——说明这类中式审美在海外存在**未被满足的供给缺口**。

### D1.2 《斩仙台 AI 真人版》——AI 仙侠短剧的工业化基线

来源：[红星新闻/搜狐](https://news.sohu.com/a/1000949480_116237)（2026-03-25，对话可梦智能 CEO 熊昺辉）

| 维度 | 事实 |
|---|---|
| 体量 | 81 集，单集平均 **40 个镜头**；上线 **6 天播放破亿** |
| 团队 | **12 人**，"AI + 人工"模式 |
| 周期 | 分镜 20 多天完成，整体制作约 **30 天**（真人剧前期动辄数月） |
| 成本 | 算力成本约 **10 万元**；真人短剧同体量 30–100 万元 |
| 流程 | 剧本 → 分镜 → 角色设定 → 场景设定 → 文生图 → 图生视频 → 剪辑 → 配音 |
| 已知短板 | ① 高速运动（御剑飞行、打斗）大场面边缘细节精度掉；② **复杂情绪**（"隐忍的愤怒""克制的喜悦""悲喜交加"）还原不了，要么夸张要么平淡；③ 微表情（嘴角微颤、眼神闪烁、眉头轻蹙）不可控 |
| 补救体系 | "AI 生成 + 人工精准优化 + 专业指导"三层；用**镜头语言兜底**——慢镜头突出情绪、特写聚焦眼睛/面部、BGM 和音效强化氛围；剧本层面**避免让 AI 承担超出能力的表演要求** |

**这段访谈里最值钱的一句话是最后那句**：不要去卷 AI 做不到的微表情，而是**改剧本和分镜去避开它**。这是所有 AI 视频项目能不能落地的分水岭。

---

## D2 「仙宫/天宫」专项打法——一份可抄的拆解

来源：行者AI视频（@joshesye）《折腾 48 小时，我把神话里的天宫做成了 AI 视频》，经[觉醒AI知识库转载](https://www.jxxy.net/ai/articles/joshesye-2087709684719292687/)。这是目前公开资料里**最实操**的一份天宫拆解。

### D2.1 出图：先构图，再空间，再镜头，最后主次

作者的定序是：**先看构图 → 再拆空间层次 → 然后决定镜头位置 → 最后处理建筑和人物的主次**。
只对着参考图抄词（"看到云海写云海"）只能撞运气。

**四个最容易崩的地方（原文四条铁律）：**

1. **人物要小。** 远景里把人物压到画面的 **3%–5%**。再大一点，天宫就变成人像写真的背景板。
2. **建筑要有轴线。** 白玉阶、南天门、主殿、远山尽量落在**同一条视觉线**上，观众视线有路可走，画面才不会像"几栋楼随手贴在云里"。
3. **建筑要写具体构件。** 柱、斗拱、抬梁、飞檐、白玉基座、云龙浮雕——写清楚构件，模型才知道东西该放哪。
4. **云海要分层。** 前景薄雾 / 中景翻涌云海 / 远景空气透视 + 虚化山体拉开距离。

**配色公式：白玉 + 冷青灰打底，暖金光只照重点，加一点朱红压细节。**

### D2.2 动起来：画面越大，能交给模型的运动就越少

作者的核心洞察：

> **画面越大，建筑越复杂，能交给模型的运动就越少。**

第一版成片的问题是要么像动态 PPT，要么镜头晃动大、宫殿融化、远处人物崩掉。解决办法是**"每次哪里崩了，就补一条限制"**，最终把一张静图拆成五个可写字段：**时间轴 / 镜头 / 人物动作 / 环境动态 / 连续性约束**。

各字段的具体要求：

- **先锁首帧。** 建筑位置、人物站位、光源方向、栏杆柱子与云海的关系全部沿用原图。"首帧锁不住，后面写再多动作也没用。"
- **只写看得见的动作。** 云往哪边飘、薄雾怎么进长廊、衣袖摆动多少、人物抬头还是迈步。
- **镜头收着写。** 慢推、轻移、缓慢抬升基本够用；"穿云、俯冲、环绕宫殿"提示词看着爽、成片不能看。
- **远景人物别太忙。** 抬头、拢袖、侧身、向前走一步 > 奔跑和转圈。
- **该钉住的直接点名。** 柱子、飞檐、门板、栏杆、长廊**全程静止**；云、雾、衣服、头发、水流负责动。

**可抄的 5 秒运镜提示词模板（原文简化版）：**

> 严格保持首帧构图与建筑结构。0 至 2 秒，镜头极慢速向前推进，云海从右向左缓缓流动，人物衣袖与发丝轻微摆动。2 至 5 秒，镜头轻微抬升，远处金色天光穿过云层，人物缓慢抬头。白玉阶、南天门、飞檐、立柱和栏杆全程固定，不变形，不位移。保持人物身份、服装和比例一致，不新增物体，不出现字幕与水印。环境声以高空风声和轻微衣袂声为主。

### D2.3 进阶：把远景做成第一人称 Vlog

远景跑通后，作者做了一版"小师妹带我逛天宫"的 POV Vlog，**关键工程是素材拆包**：

- **7 张图**：1 张人物主图（锁脸、发型、衣服）+ 6 张场景图（白玉广场、云阶、月门、云桥、云廊、茶席）。
- **"人物归人物，地点归地点"**——生成时不用每到一处重新猜。
- 60 秒 Vlog 只选 3 个片段，每段给明确秒级区间和动作。

**片段示例（可直接套格式）：**

> 17 至 27 秒，月门望仙台。小师妹牵着镜头穿过月门，在栏杆旁停下。她抬手召出一只小云兽，云兽从掌边的薄雾里探出头，绕着她缓慢飞半圈。月门、栏杆与远处宫殿保持稳定。

**作者的 6 条经验（原文照录）：**
1. 远景，建筑宏伟，大景深，用朱红色
2. 大场景，让观众看得很细：天阙、白玉京、仙鹤、银河
3. 东方美学建筑：柱、斗拱、抬梁、飞檐和白玉基座
4. 人物在建筑内部要小
5. 有动态效果：白云飘、人物走、树叶动、仙鹤飞、瀑布流水
6. 小尺度运镜，缓慢拉镜头

**他还把这两套规则做成了开源 Skill（Codex/Claude Skill 格式）：**
- 生图：[github.com/joshesye/design-xianxia-celestial-shots](https://github.com/joshesye/design-xianxia-celestial-shots)
- 运镜：[github.com/joshesye/design-seedance-celestial-motion](https://github.com/joshesye/design-seedance-celestial-motion)

### D2.4 「零提示词」复现路线（适合完全不想写提示词的人）

来源：[数艺社/网易](https://www.163.com/dy/article/L5LO75TN05340TH8.html)（2026-08-31）

两个 GitHub 开源技能包，装上就是"视觉导演 + 运镜导演"：

- `Xianxia Visual Director`（仙侠单帧画面视觉导演，负责出图）
- `Xianxia Cinematic Video Director`（仙侠多镜头视频运镜导演，负责出视频）
- 仓库：[liyue-aigc/xianxia-visual-director](https://github.com/liyue-aigc/xianxia-visual-director)、[liyue-aigc/xianxia-cinematic-video-director](https://github.com/liyue-aigc/xianxia-cinematic-video-director)

**三步复刻法：**
1. 在豆包"工作任务"里发一句"安装这两个技能：<GitHub 链接>"，等提示安装完成；
2. 出图：有参考图就图生图（更稳），没有就词生图，**点名用 Seedream 4.5 模型**；
3. 出视频：附上满意的图，说"根据这张图片生成视频，使用 Seedance 2.5"。

技能内部会先"看清"素材图关键元素（汉白玉柱廊、红衣小人、远处重檐宫殿、侧逆光长影），再设计叙事运镜，**而不是简单让图片动起来**。

作者实测的构图输出值得记：*一点透视柱廊引导视线延伸；右侧留 40%–60% 云海呼吸空间；暖金色晨光斜射；红衣人物立在画面约 3% 位置作为视觉锚点*——和爆款参考图风格高度接近。**这组数字就是"天宫感"的可量化配方。**

> 同作者还有 [liyue-aigc/female-outfit-director](https://github.com/liyue-aigc/female-outfit-director)（女性换装导演），做**古风卡点换装**的完整规范，见 D4。

---

## D3 「珠光宝气古风美女」专项打法

### D3.1 去塑料感：形制词 + 材质词 + 光影词三板斧

来源：[FlowPix《AI绘画古风发饰怎么画不塑料？》](https://www.flowpixai.com/ai-art/ai-hair-ornament.html)（2026-07-14）

**第一板斧——形制必须写准。** 只写 "hairpin" / "hair accessory"，形态全凭运气。正确写法是把形制和英文一起写死：

| 形制 | 正确写法 |
|---|---|
| 簪（单股） | `zan, single-prong hairpin` |
| 钗（双股） | `chai, double-prong hairpin` |
| 步摇（带坠流苏会动） | `buyao, hairpin with dangling pendants that sway` |
| 钿（花形片状） | `dian, floral inlaid hair ornament` |

> 作者建议新手从**步摇**入手：流苏坠子辨识度高，AI 容错率大。钗和钿细节多，画崩概率高。

**第二板斧——材质词要写出工艺和透感**（塑料感的根子在材质词太笼统）：

| 目标 | 关键词 |
|---|---|
| 金 → 不要亮闪塑料金 | `aged gold with subtle matte finish, fine filigree work, granulation texture`（filigree=花丝，granulation=炸珠，两个古代金工技法词一加立刻有工艺感） |
| 玉 → 温润透 | `translucent nephrite jade, soft inner glow, pale celadon tone` |
| 珍珠 | `lustrous freshwater pearls, soft iridescent sheen` |
| 宝石火彩 | `gemstone with light passing through, facet reflections` |

**第三板斧——光影让发饰立体：**
`soft directional light from upper left, specular highlights on metal edges, subsurface scattering on jade, gentle shadow under ornaments`

- `specular highlights` 管金属锐利反光，`subsurface scattering` 管光透进玉石内部——这两个一搭配，金属和玉的质感就区分开了。
- **绝对不要写** `flat lighting` / `even lighting`，那种光下发饰必扁。
- **背景压暗**（`dark blurred background`，深褐或墨绿）才衬得出高光；浅背景会把发饰吃掉。

**第四板斧——朝代锁调性：**

| 朝代 | 调性 | 关键词 |
|---|---|---|
| 唐 | 华丽、金灿灿大体量 | `tang dynasty style, large gold buyao, ornate, rich` |
| 宋 | 清雅、素银镶小玉 | `song dynasty style, slender silver hairpin, minimalist, refined` |
| 明 | 繁复、宝石堆镶 | `ming dynasty style, gemstone inlaid dian, elaborate` |
| 清 | 点翠烧蓝堆砌 | `qing dynasty style, kingfisher feather inlay, turquoise enamel` |

**两条硬数据 / 硬经验：**
- Civitai 社区模型能力评测：主流模型生成**精细金属花丝工艺**类图像时，**结构正确率不足三成**，崩点在细线条连贯性和对称性——"十张里能挑出两张结构没崩的就算运气好"。**AI 画首饰的崩坏率比画脸还高。**
- 所以：**出图分辨率至少 1024 起步，有条件放大到 2048**；并且**喂博物馆藏品/实物参考图做图生图**，崩坏率能降一半。
- 流苏画成一坨的解法：拉高分辨率 + 拆开写 `dangling chains with individual pearl drops, separated strands, not tangled`。
- 发饰"长歪"（簪子插到耳朵上面、步摇垂到肩膀外）用**局部重绘框住发饰区域单独修**，别整张重来。

### D3.2 古风换装的完整工程规范（female-outfit-director 技能摘读）

来源：[liyue-aigc/female-outfit-director SKILL.md](https://github.com/liyue-aigc/female-outfit-director/blob/main/skill/SKILL.md)

这是"一张图 → 卡点换装短视频"这类**极高播放**内容的工业级写法，几个可直接迁移的要点：

- **图片是视频的结构母图。** 视频必须继承图片中的人物身份、服装、四周小人物位置、画面布局和摄影质感——**先有合格首帧，再谈视频**。
- **默认五人拼贴版式**：中央偏右主体人物占画面宽 60%–65%，左上/右上/左中/左下各一个小人物，右下留白；5 人必须是同一角色；小人物是**沿真实身体轮廓裁切的完整人物抠像** + 各自独立白色虚线描边；中央人物不加虚线；禁止第六个人物；禁止用矩形缩略图替代抠像。
- **为视频兼容优化首帧**（这条最容易被忽略）：小人物不要极端扭曲姿势；头肩腰臂结构清晰；小人物与中央人物的**身体拓扑尽量兼容**，便于重合换装；袖摆裙摆披帛尽量完整不裁切；五个版本的脸/发型/发色/头饰/耳饰统一。
- **换装机制按题材选**：汉服大袖/披帛 → 优先"长袖/袖摆遮镜"；古风贵女 → 优先"团扇/折扇遮挡"；东方幻想/神女 → 可用披帛、花瓣、云纹、水墨；强拼贴设计 → 贴纸翻页/剪影翻转。
- **8 秒 5 套造型的卡点**：1.25s / 2.95s / 4.40s / 6.55s（最后一次换装后必须留最终造型展示时间）。
- **动作连续性**：换装前后重心、旋转方向、手臂轨迹、头部朝向全部连续，**不因换衣重置姿势**。
- **衣料物理**：汉服长裙长袖披帛流苏必须有自然重力、转身时轻微惯性延迟、停止后逐渐回落，不僵硬漂浮、不穿模、不粘连身体。
- **镜头**：默认固定高位俯拍（前上方，向下 30–35°），全程不推拉摇移变焦。**短时长中不要同时叠加复杂运镜与复杂换装机制。**

> 这份规范的价值不在具体参数，而在它示范了**把"感觉"翻译成可执行约束清单**的方法论——这正是业余和专业的分界线。

---

## D4 去 AI 味：最实用的一套工程化技巧库

来源：[shyman159/seedance-prompts-skill · prompt-craft-and-realism.md](https://github.com/shyman159/seedance-prompts-skill/blob/main/skills/seedance-prompts-skill/references/prompt-craft-and-realism.md)（由抖音"刺猬星球superi"37 集合集蒸馏）

**核心理念：AI 图/视频"一眼假"的根因不是模型弱、也不是提示词不够长，而是你在"许愿"而不是用视觉语言下指令。**

### D4.1 五板块结构（保持结构完整才有可控性）

`情绪 + 主体 + 光线 + 镜头 + 细节`

**词序就是优先级：**
- **主体词放最前**——AI 优先解析靠前的词，重点不跑偏。
- **光影词放中段**——放末尾 AI 会"不分主体随便补光"。
- **抽象词放末尾**——放前面会被当全局指令破坏主体与光影，放末尾只做整体微调。

### D4.2 误解机制：把抽象词翻译成可量化视觉动作

写"梦幻"它加烟雾，写"高级"它塞光斑，写"干净"它加纹理，写"自然"它加锐化。

| 你想说的 | 要写的 |
|---|---|
| 梦幻 | 低饱和 + 软光源 + 长焦压缩 |
| 高级 | 强光线对比 + 部分留白 |
| 质感 | 微弱侧光 + 高阴影对比 |

**并直接告诉 AI 不要什么**：`无纹理、无锐化`。

### D4.3 光线控制（AI 最容易露馅的地方）

- **基础三步**：① 光的方向/来源/阴影布局（别只写"摄影灯光"）；② **光比**（明确哪里亮哪里暗）；③ **色温**（偏冷=清晨雾，偏暖=傍晚风）。
- **进阶三步**：① **体积光**（光穿过什么介质→变成怎样的光束）；② **反光与反射色**（反射来源点/反射到哪/反射光颜色）；③ **补光层次**（主光在哪、补光保留多少）。

### D4.4 去 AI 感（"AI 最大的问题不是不真实，而是太干净"）

**去摆拍感（视频），摆拍感来自镜头与画面关系不真实，与提示词无关**，三因三解：
1. 取景起点完成度过高 → 让画面从**不完整视角**开始（前景遮挡/构图偏移），再用运镜去"找"画面；
2. 运动轨迹过度平滑 → 引入减速/停顿等**人为操作痕迹**；
3. 主体动作与镜头完全同步 → 让**人物动作早于镜头反应**，制造"被进入的瞬间"。

**前景遮挡去 AI 味：**
- **物理遮挡**：树叶/柱子/人物背影 + 低角度 + 前景虚化。注意——AI 遵循顺序机制，**不写"虚化"它会把前景画清楚**而失去景深。
- **氛围遮挡**：让空气里有东西（雪花/雾气/颗粒感），给画面厚度。

**电影感 = 摄影约束先于美学**：先写镜头类型/拍摄距离/光线结构，再写风格——90% 的人上来就写氛围，AI 只停在"图像渲染"而非"真实摄影"。

**减法审美 + 剪词（让画面显贵）：**
- 剪情绪词（"高级感/电影感"对 AI 不是有效控制信息，本质还是抽卡）
- 剪重复词（同义反复只会分散权重，每个信息只出现一次）
- 剪人类句式（别写成讲故事的整句，拆成元素：谁在动 / 怎么动 / 镜头固定还是跟随）

### D4.5 调色数据化

- 三步法：把审美**叫为数据**（拆成色相分布/明暗比例/色温倾向）→ 用 JSON 控色 → 与参考图对比验证。
- **Hex 自动调色法**：上传几张参考图让模型扫描提取 Hex 色值生成专属调色板，生成时选用该色板——**把颜色控制从"后期"提前到"生成之前"**。

### D4.6 动作崩坏与一致性

**避免动作崩坏**：AI 眼里动词是"目标状态"不是"进行态"。
- **减动词、增方式词**：保留一个核心动作，用"犹豫的/持续的/重心转移"限定节奏。
- **单一主动作锁身体结构**：同一时刻只给一个主动作（走路的主动作是 walking，"回头看"是朝向变化）。
- **别用"然后/接着/同时"**——深层模型不可靠地执行时间轴；改描述"动作发生时角色处于什么状态"。

**人物一致性（视频）**——注意这句反直觉的结论：
> **参考图不是"参考人物"，只是风格与结构输入。**

三招：
1. **人景拆分**：先生成人物多角度三视图成为稳定可复用对象，别和场景一起生成；
2. **先动作、再进场景**：先让人物完成指定动作再与场景合成，避免叠加场景时重推人物结构；
3. **拆镜头降时间维度**：连续帧每多一帧多一次偏移，**尽量一个动作一段视频**。

**声音一致性**（AI 视频最易露馅的是声音）：建角色声音参考库（把满意片段的音频抽出来存成独立文件，每次生成上传作参考）+ 独立配音模型设计音色 + 情绪声音库（同一角色"正常/愤怒/伤心"样本，按剧情选用）。

---

## D5 关键词库速查（可直接拼接）

来源：[Wayhhow/ai-video-shot-prompt-skill · keyword-library.md](https://github.com/Wayhhow/ai-video-shot-prompt-skill/blob/main/references/keyword-library.md)

### D5.1 去 AI 味核心词（强制，至少选 2 个组合）

`超写实`、`极致逼真`、`真人实景拍摄`（含人物场景，减少 CG 感）、`电影动作捕捉`（动作戏，真实物理感）、`复古胶片质感`

### D5.2 限制词（反向约束，选 3–5 个最相关的，过多反而分散注意力）

- 动作类：`杜绝动作僵硬`、`杜绝人物畸形手指`、`杜绝穿模`、`杜绝肢体扭曲`、`杜绝人物漂浮`、`杜绝关节反向`
- 质感类：`杜绝游戏CG感`、`杜绝塑料皮肤`、`杜绝过度磨皮`、`杜绝镜头漂移`、`杜绝水印`、`杜绝低分辨率`
- 物理一致性：`杜绝光影不一致`、`杜绝影子方向错误`、`杜绝重力失真`

### D5.3 古风/国风风格词

`古风`、`青瓦白墙`、`红灯笼`、`青砖`、`油纸伞`、`丝绸`、`工笔重彩`、`水墨写意`、`黛青`、`朱红`、`宫墙`、`飞檐`、`长街雨巷`
仙侠向：`水墨`、`烟雨`、`竹林`、`剑光`、`留白`、`白衣`

### D5.4 视觉基调（设备模拟——"Cinema Studio 思路"）

选一台**真实存在的电影摄影机**，按真实物理逻辑决定虚化/光斑/反射，而非随机拼凑：

- 数字电影机：`ARRI Alexa 65 拍摄`、`ARRI Alexa Mini LF`、`RED V-Raptor 8K`、`Sony Venice 2`
- 胶片：`Kodak Vision3 500T 胶片拍摄`、`Kodak Portra 400 色彩`、`Fuji Eterna Vivid 500`
- 特殊：`iPhone 15 Pro 竖屏拍摄`、`大疆 DJI Mavic 3 航拍`

### D5.5 色彩影调与光线

- 暖：`暖黄高光`、`金色阳光`、`琥珀色调`；冷：`青蓝冷调`、`去饱和冷调`、`深青阴影`
- 双色对比：`青橙对比（teal & orange）`（电影最常用）、`红青互补`
- 时间光：`黄金时刻光线（magic hour）`、`蓝调时刻（blue hour）`、`黄昏侧逆光`、`黎明破晓光`
- 戏剧光：`伦勃朗光（Rembrandt lighting）`、`轮廓光（rim light）`、`蝴蝶光`

### D5.6 使用建议（原文）

1. 风格核心选 3–5 个；2. 去 AI 味关键词选 2–3 个（强制）；3. 限制词选 3–5 个；4. 视觉基调选 1 个设备；5. 色彩影调选 1 个；6. 氛围情绪选 1–2 个；7. 光线选 1 个。
**总关键词控制在 15–25 个之间为佳，过多会分散注意力。**

---

## D6 从案例反推的四条通用原则

1. **爆款靠审美选题，不靠技术栈。** 栖光只用 MJ + 可灵/即梦；《斩仙台》用的是商业化平台。两者共同点是**视觉母题极度清晰**（云海白玉长廊 / 仙门大殿雕梁画栋）。
2. **绕开 AI 的弱项，而不是硬刚。** 无台词、小人物、慢运镜、不拍手、不做复杂微表情——**把剧本和分镜改到 AI 的能力圈内**。
3. **把"感觉"翻译成约束清单。** 3%–5% 人物占比、一条视觉轴线、云海三层、柱子飞檐全程静止、卡点在 1.25/2.95/4.40/6.55 秒——可复用的从来是这些数字和规则，不是那句"唯美震撼"。
4. **物料拆包是效率的核心。** 人物主图 + 分场景图分开生成（7 张图法），人物归人物、地点归地点；废片不做负面情绪，拆出有效信息（满意的人物/色彩）单独复用 + 局部重塑。
