D-案例与核心技法.md

D 部分:标杆案例 + 仙宫/古风美女核心技法(DSH 主调研员)

本部分为自查证内容,来源均为公开报道与创作者本人的拆解,URL 附在各节。

D1 标杆案例:这波内容的钱和人在哪

D1.1 「中式天庭」——栖光(陈爱军),眼镜店老板的意外出海

来源:封面新闻/网易转载、四川新闻网

维度事实
作者身份陈爱军,1991 年生,成都眼镜店老板,非设计科班,"纯小白"自学 AI 近两年
工作流Midjourney 出图 → 可灵 / 即梦 转视频(两句原话,没有更复杂的链路)
爆款一条 33 秒无台词无字幕短视频,被网友搬运至海外平台,不到 4 天播放破 500 万、4.8 万赞、转发 9700+
二次放大外交部发言人毛宁在个人账号转发,配文"中式天堂长什么样"(数艺社报道)
产量抖音 50 万+ 粉丝,200+ 条作品,接近日更;单条制作 4–5 小时(状态好 2–3 小时)
成本画质要求不高 50–60 元/条;4K 画质 100–300 元/条;200 多条累计投入"数万元"
变现只靠抖音平台流量收益,未做商业授权;收支基本打平
下一步计划 2026 年底/2027 年初做中国风修仙向 AI 短剧

读出来的三个关键结论:

  1. 链路极简也能出爆款。 MJ + 可灵/即梦 就够,爆的是审美选题(云海、白玉长廊、飞檐、红衣小人物),不是技术栈。
  2. "没有人"反而更安全。 无台词、无字幕、人物极小,规避了 AI 最弱的三件事:口型、微表情、手部。
  3. 出海是被动的。 他没有海外号,是搬运带来的自然流量——说明这类中式审美在海外存在未被满足的供给缺口。

D1.2 《斩仙台 AI 真人版》——AI 仙侠短剧的工业化基线

来源:红星新闻/搜狐(2026-03-25,对话可梦智能 CEO 熊昺辉)

维度事实
体量81 集,单集平均 40 个镜头;上线 6 天播放破亿
团队12 人,"AI + 人工"模式
周期分镜 20 多天完成,整体制作约 30 天(真人剧前期动辄数月)
成本算力成本约 10 万元;真人短剧同体量 30–100 万元
流程剧本 → 分镜 → 角色设定 → 场景设定 → 文生图 → 图生视频 → 剪辑 → 配音
已知短板① 高速运动(御剑飞行、打斗)大场面边缘细节精度掉;② 复杂情绪("隐忍的愤怒""克制的喜悦""悲喜交加")还原不了,要么夸张要么平淡;③ 微表情(嘴角微颤、眼神闪烁、眉头轻蹙)不可控
补救体系"AI 生成 + 人工精准优化 + 专业指导"三层;用镜头语言兜底——慢镜头突出情绪、特写聚焦眼睛/面部、BGM 和音效强化氛围;剧本层面避免让 AI 承担超出能力的表演要求

这段访谈里最值钱的一句话是最后那句:不要去卷 AI 做不到的微表情,而是改剧本和分镜去避开它。这是所有 AI 视频项目能不能落地的分水岭。


D2 「仙宫/天宫」专项打法——一份可抄的拆解

来源:行者AI视频(@joshesye)《折腾 48 小时,我把神话里的天宫做成了 AI 视频》,经觉醒AI知识库转载。这是目前公开资料里最实操的一份天宫拆解。

D2.1 出图:先构图,再空间,再镜头,最后主次

作者的定序是:先看构图 → 再拆空间层次 → 然后决定镜头位置 → 最后处理建筑和人物的主次。 只对着参考图抄词("看到云海写云海")只能撞运气。

四个最容易崩的地方(原文四条铁律):

  1. 人物要小。 远景里把人物压到画面的 3%–5%。再大一点,天宫就变成人像写真的背景板。
  2. 建筑要有轴线。 白玉阶、南天门、主殿、远山尽量落在同一条视觉线上,观众视线有路可走,画面才不会像"几栋楼随手贴在云里"。
  3. 建筑要写具体构件。 柱、斗拱、抬梁、飞檐、白玉基座、云龙浮雕——写清楚构件,模型才知道东西该放哪。
  4. 云海要分层。 前景薄雾 / 中景翻涌云海 / 远景空气透视 + 虚化山体拉开距离。

配色公式:白玉 + 冷青灰打底,暖金光只照重点,加一点朱红压细节。

D2.2 动起来:画面越大,能交给模型的运动就越少

作者的核心洞察:

画面越大,建筑越复杂,能交给模型的运动就越少。

第一版成片的问题是要么像动态 PPT,要么镜头晃动大、宫殿融化、远处人物崩掉。解决办法是"每次哪里崩了,就补一条限制",最终把一张静图拆成五个可写字段:时间轴 / 镜头 / 人物动作 / 环境动态 / 连续性约束。

各字段的具体要求:

可抄的 5 秒运镜提示词模板(原文简化版):

严格保持首帧构图与建筑结构。0 至 2 秒,镜头极慢速向前推进,云海从右向左缓缓流动,人物衣袖与发丝轻微摆动。2 至 5 秒,镜头轻微抬升,远处金色天光穿过云层,人物缓慢抬头。白玉阶、南天门、飞檐、立柱和栏杆全程固定,不变形,不位移。保持人物身份、服装和比例一致,不新增物体,不出现字幕与水印。环境声以高空风声和轻微衣袂声为主。

D2.3 进阶:把远景做成第一人称 Vlog

远景跑通后,作者做了一版"小师妹带我逛天宫"的 POV Vlog,关键工程是素材拆包:

片段示例(可直接套格式):

17 至 27 秒,月门望仙台。小师妹牵着镜头穿过月门,在栏杆旁停下。她抬手召出一只小云兽,云兽从掌边的薄雾里探出头,绕着她缓慢飞半圈。月门、栏杆与远处宫殿保持稳定。

作者的 6 条经验(原文照录):

  1. 远景,建筑宏伟,大景深,用朱红色
  2. 大场景,让观众看得很细:天阙、白玉京、仙鹤、银河
  3. 东方美学建筑:柱、斗拱、抬梁、飞檐和白玉基座
  4. 人物在建筑内部要小
  5. 有动态效果:白云飘、人物走、树叶动、仙鹤飞、瀑布流水
  6. 小尺度运镜,缓慢拉镜头

他还把这两套规则做成了开源 Skill(Codex/Claude Skill 格式):

D2.4 「零提示词」复现路线(适合完全不想写提示词的人)

来源:数艺社/网易(2026-08-31)

两个 GitHub 开源技能包,装上就是"视觉导演 + 运镜导演":

三步复刻法:

  1. 在豆包"工作任务"里发一句"安装这两个技能:<GitHub 链接>",等提示安装完成;
  2. 出图:有参考图就图生图(更稳),没有就词生图,点名用 Seedream 4.5 模型;
  3. 出视频:附上满意的图,说"根据这张图片生成视频,使用 Seedance 2.5"。

技能内部会先"看清"素材图关键元素(汉白玉柱廊、红衣小人、远处重檐宫殿、侧逆光长影),再设计叙事运镜,而不是简单让图片动起来。

作者实测的构图输出值得记:一点透视柱廊引导视线延伸;右侧留 40%–60% 云海呼吸空间;暖金色晨光斜射;红衣人物立在画面约 3% 位置作为视觉锚点——和爆款参考图风格高度接近。这组数字就是"天宫感"的可量化配方。

同作者还有 liyue-aigc/female-outfit-director(女性换装导演),做古风卡点换装的完整规范,见 D4。


D3 「珠光宝气古风美女」专项打法

D3.1 去塑料感:形制词 + 材质词 + 光影词三板斧

来源:FlowPix《AI绘画古风发饰怎么画不塑料?》(2026-07-14)

第一板斧——形制必须写准。 只写 "hairpin" / "hair accessory",形态全凭运气。正确写法是把形制和英文一起写死:

形制正确写法
簪(单股)zan, single-prong hairpin
钗(双股)chai, double-prong hairpin
步摇(带坠流苏会动)buyao, hairpin with dangling pendants that sway
钿(花形片状)dian, floral inlaid hair ornament

作者建议新手从步摇入手:流苏坠子辨识度高,AI 容错率大。钗和钿细节多,画崩概率高。

第二板斧——材质词要写出工艺和透感(塑料感的根子在材质词太笼统):

目标关键词
金 → 不要亮闪塑料金aged gold with subtle matte finish, fine filigree work, granulation texture(filigree=花丝,granulation=炸珠,两个古代金工技法词一加立刻有工艺感)
玉 → 温润透translucent nephrite jade, soft inner glow, pale celadon tone
珍珠lustrous freshwater pearls, soft iridescent sheen
宝石火彩gemstone with light passing through, facet reflections

第三板斧——光影让发饰立体: soft directional light from upper left, specular highlights on metal edges, subsurface scattering on jade, gentle shadow under ornaments

第四板斧——朝代锁调性:

朝代调性关键词
唐华丽、金灿灿大体量tang dynasty style, large gold buyao, ornate, rich
宋清雅、素银镶小玉song dynasty style, slender silver hairpin, minimalist, refined
明繁复、宝石堆镶ming dynasty style, gemstone inlaid dian, elaborate
清点翠烧蓝堆砌qing dynasty style, kingfisher feather inlay, turquoise enamel

两条硬数据 / 硬经验:

D3.2 古风换装的完整工程规范(female-outfit-director 技能摘读)

来源:liyue-aigc/female-outfit-director SKILL.md

这是"一张图 → 卡点换装短视频"这类极高播放内容的工业级写法,几个可直接迁移的要点:

这份规范的价值不在具体参数,而在它示范了把"感觉"翻译成可执行约束清单的方法论——这正是业余和专业的分界线。


D4 去 AI 味:最实用的一套工程化技巧库

来源:shyman159/seedance-prompts-skill · prompt-craft-and-realism.md(由抖音"刺猬星球superi"37 集合集蒸馏)

核心理念:AI 图/视频"一眼假"的根因不是模型弱、也不是提示词不够长,而是你在"许愿"而不是用视觉语言下指令。

D4.1 五板块结构(保持结构完整才有可控性)

情绪 + 主体 + 光线 + 镜头 + 细节

词序就是优先级:

D4.2 误解机制:把抽象词翻译成可量化视觉动作

写"梦幻"它加烟雾,写"高级"它塞光斑,写"干净"它加纹理,写"自然"它加锐化。

你想说的要写的
梦幻低饱和 + 软光源 + 长焦压缩
高级强光线对比 + 部分留白
质感微弱侧光 + 高阴影对比

并直接告诉 AI 不要什么:无纹理、无锐化。

D4.3 光线控制(AI 最容易露馅的地方)

D4.4 去 AI 感("AI 最大的问题不是不真实,而是太干净")

去摆拍感(视频),摆拍感来自镜头与画面关系不真实,与提示词无关,三因三解:

  1. 取景起点完成度过高 → 让画面从不完整视角开始(前景遮挡/构图偏移),再用运镜去"找"画面;
  2. 运动轨迹过度平滑 → 引入减速/停顿等人为操作痕迹;
  3. 主体动作与镜头完全同步 → 让人物动作早于镜头反应,制造"被进入的瞬间"。

前景遮挡去 AI 味:

电影感 = 摄影约束先于美学:先写镜头类型/拍摄距离/光线结构,再写风格——90% 的人上来就写氛围,AI 只停在"图像渲染"而非"真实摄影"。

减法审美 + 剪词(让画面显贵):

D4.5 调色数据化

D4.6 动作崩坏与一致性

避免动作崩坏:AI 眼里动词是"目标状态"不是"进行态"。

人物一致性(视频)——注意这句反直觉的结论:

参考图不是"参考人物",只是风格与结构输入。

三招:

  1. 人景拆分:先生成人物多角度三视图成为稳定可复用对象,别和场景一起生成;
  2. 先动作、再进场景:先让人物完成指定动作再与场景合成,避免叠加场景时重推人物结构;
  3. 拆镜头降时间维度:连续帧每多一帧多一次偏移,尽量一个动作一段视频。

声音一致性(AI 视频最易露馅的是声音):建角色声音参考库(把满意片段的音频抽出来存成独立文件,每次生成上传作参考)+ 独立配音模型设计音色 + 情绪声音库(同一角色"正常/愤怒/伤心"样本,按剧情选用)。


D5 关键词库速查(可直接拼接)

来源:Wayhhow/ai-video-shot-prompt-skill · keyword-library.md

D5.1 去 AI 味核心词(强制,至少选 2 个组合)

超写实、极致逼真、真人实景拍摄(含人物场景,减少 CG 感)、电影动作捕捉(动作戏,真实物理感)、复古胶片质感

D5.2 限制词(反向约束,选 3–5 个最相关的,过多反而分散注意力)

D5.3 古风/国风风格词

古风、青瓦白墙、红灯笼、青砖、油纸伞、丝绸、工笔重彩、水墨写意、黛青、朱红、宫墙、飞檐、长街雨巷 仙侠向:水墨、烟雨、竹林、剑光、留白、白衣

D5.4 视觉基调(设备模拟——"Cinema Studio 思路")

选一台真实存在的电影摄影机,按真实物理逻辑决定虚化/光斑/反射,而非随机拼凑:

D5.5 色彩影调与光线

D5.6 使用建议(原文)

  1. 风格核心选 3–5 个;2. 去 AI 味关键词选 2–3 个(强制);3. 限制词选 3–5 个;4. 视觉基调选 1 个设备;5. 色彩影调选 1 个;6. 氛围情绪选 1–2 个;7. 光线选 1 个。 总关键词控制在 15–25 个之间为佳,过多会分散注意力。

D6 从案例反推的四条通用原则

  1. 爆款靠审美选题,不靠技术栈。 栖光只用 MJ + 可灵/即梦;《斩仙台》用的是商业化平台。两者共同点是视觉母题极度清晰(云海白玉长廊 / 仙门大殿雕梁画栋)。
  2. 绕开 AI 的弱项,而不是硬刚。 无台词、小人物、慢运镜、不拍手、不做复杂微表情——把剧本和分镜改到 AI 的能力圈内。
  3. 把"感觉"翻译成约束清单。 3%–5% 人物占比、一条视觉轴线、云海三层、柱子飞檐全程静止、卡点在 1.25/2.95/4.40/6.55 秒——可复用的从来是这些数字和规则,不是那句"唯美震撼"。
  4. 物料拆包是效率的核心。 人物主图 + 分场景图分开生成(7 张图法),人物归人物、地点归地点;废片不做负面情绪,拆出有效信息(满意的人物/色彩)单独复用 + 局部重塑。
下载此文件