AI仙宫与古风美女视频制作调研.md

AI 仙宫 / 珠光宝气古风美女视频:国内外制作方法调研报告

调研时间:2026-09 | 调研方式:公开报道 + 创作者本人拆解 + 开源技能包 + 平台官方公告 所有关键数据均附来源链接;无法交叉印证的内容已标注"未证实"


0 一页速览

这两类视频的核心结论(先看这五条):

  1. 爆款靠审美母题,不靠技术栈。 海外破 500 万播放的"中式天庭",作者只用 Midjourney 出图 + 可灵/即梦转视频,一条 33 秒、无台词、无字幕。
  2. 绕开 AI 的弱项,而不是硬刚。 无台词、人物占画面高度远景 1%–4% / 中景 5%–8%、小尺度运镜、不拍手、不做复杂微表情——把剧本和分镜改到 AI 的能力圈内。AI 短剧团队的原话是:"通过剧情铺垫避免让 AI 承担超出其能力的表演要求。"
  3. 把"感觉"翻译成约束清单。 可复用的一直是数字和规则:人物占画面高度远景 1%–4%、一条视觉轴线、云海分三层、柱子飞檐全程静止、换装卡点在 1.25/2.95/4.40/6.55 秒——不是"仙侠天宫,唯美震撼"这八个字。
  4. 仙宫吃"空间一致性",古风美女吃"角色一致性"——这是两条完全不同的技术路线。 仙宫纯空镜 + 大景小人 + 无台词,绕开 AI 最弱的人脸与口型;古风美女必须锁脸锁服装,成本是仙宫空镜的 3–5 倍。用错力气是最常见的浪费。
  5. 两类题材的共同最优解都是"静态图 → 图生视频",不是文生视频。 先出 20–50 张图选 1 张,再让视频模型做微动(云飘、衣摆、鹤飞、光移),比 T2V 一次成片成功率高一个量级。

两类题材的难度与打法差异:

仙宫 / 天宫珠光宝气古风美女
核心难点建筑稳定(不融化、不变形)、云海动态、镜头幅度人物一致(不换脸)、首饰质感(不塑料)、衣料物理
制胜关键首帧锁死 + 小尺度运镜 + 构件写具体形制词 + 材质词 + 光影 + 参考图
典型失败动态 PPT 感 / 宫殿晃动 / 远景人物崩义乌小商品塑料感 / 簪子插歪 / 手指畸形
成本档位50–300 元/条(个人号);国外链路约 $3–4.5约 3–5 倍于仙宫空镜(国外口径 $6–$15)

1 现象:这波内容是怎么起来的

2026 年 8 月,一条没有台词、没有字幕的 33 秒 AI 短视频从国内被搬运到海外平台,不到 4 天播放量突破 500 万,收获 4.8 万点赞、转发超 9700 次。画面内容是:白玉长廊延伸向云海深处,南天门巍峨耸立,仙鹤穿梭于层层叠叠的飞檐琼楼之间。

随后外交部发言人毛宁在个人账号转发了这条视频,配文"中式天堂长什么样"——等于给这波内容做了一次官方背书,热度持续了不止一周。

为什么是这两类题材:

来源:封面新闻/网易、数艺社/网易、四川新闻网

1.1 海外侧:不止是仙宫,"中式审美"整体在起量

来源:Kompas 教程、Kapwing Chinamaxxing trend、网易号报道


2 标杆案例(两档完全不同的做法)

2.1 个人号天花板:栖光(陈爱军)——"中式天庭"

维度事实
身份1991 年生,成都眼镜店老板,非设计科班,"纯小白"自学 AI 近两年
工作流Midjourney 出图 → 可灵 / 即梦 转视频
爆款33 秒无台词无字幕,海外 不到 4 天破 500 万播放
产量抖音 50 万+ 粉丝、200+ 条作品、接近日更;单条 4–5 小时
成本一般画质 50–60 元/条;4K 画质 100–300 元/条
变现仅靠平台流量收益,收支基本打平;下一步计划做修仙向 AI 短剧

这个案例最大的信息量是"链路可以有多简单"。 他没有用复杂的 ComfyUI 工作流,没有自训 LoRA,没有多模型分流。他做对的是两件事:选题精准 + 日更坚持。

2.2 工业化基线:《斩仙台 AI 真人版》——AI 仙侠短剧

来源:红星新闻/搜狐

维度事实
体量81 集,单集平均 40 个镜头,上线 6 天播放破亿
团队12 人(真人剧动辄几十人)
周期分镜 20 多天,整体约 30 天
成本算力约 10 万元(真人剧同体量 30–100 万元)≈ 31 元/镜头
流程剧本 → 分镜 → 角色设定 → 场景设定 → 文生图 → 图生视频 → 剪辑 → 配音

已知短板(这决定了所有 AI 仙侠内容的剧本边界):

  1. 高速运动(御剑飞行、激烈打斗)大场面边缘细节精度掉,人工微调成本高;
  2. 复杂情绪("隐忍的愤怒""克制的喜悦""悲喜交加")还原不了,要么夸张要么平淡;
  3. 微表情(嘴角微颤、眼神闪烁、眉头轻蹙)不可控。

补救体系:AI 生成 + 人工精准优化 + 专业指导三层;用镜头语言兜底(慢镜头突出情绪、特写聚焦眼睛/面部、BGM 与音效强化氛围);剧本层面主动避开 AI 做不到的表演。

这一节是给所有想做 AI 仙侠内容的人的最重要提醒:不要在文本阶段就写满微表情和高速武打,那是给自己挖坑。把镜头语言当"表演替身"。

2.3 拆解级案例:行者AI视频的天宫 48 小时实验

这是公开资料里最实操的一份天宫拆解,方法论部分见第 5 章。来源:觉醒AI知识库转载

核心洞察一句话:"画面越大,建筑越复杂,能交给模型的运动就越少。"


3 当前工具格局(2026-09 快照)

3.1 文生视频盲测榜单(Artificial Analysis,抓取于 2026-09-02)

排名模型开发者Elo距榜首
1Gemini Omni FlashGoogle1238—
2Wan 3.0Alibaba1237−1
3MiniMax H3 Max(fal 后训练)Fal1235−3
4MiniMax H3MiniMax1227−11
5Dreamina Seedance 2.0 720pByteDance Seed1221−17
—(此处断层 60+ 分)
6Wan2.7-260612Alibaba1157−81
7HappyHorse-1.1Alibaba-ATH1145−93
9Kling 3.0 1080p (Pro)KlingAI1108−130
11SkyReels V4Skywork AI1103−135
13Veo 3.1Google1092−146
19Vidu Q3 ProVidu1075−163
20PixVerse V6PixVerse1074−164
21grok-imagine-videoxAI1062−176

来源:BenchmarkList 收录的 Artificial Analysis 文生视频榜(榜单为"含音频视角"的盲测对比)

读榜要点:

3.2 一个必须知道的重大变动:Sora 已经关停

OpenAI 已于 2026 年 3 月 25 日宣布关停 Sora:App/网页于 2026-04-26 关停,开发者 API 于 2026-09-24 下线。

来源:VentureBeat、澎湃/雷科技《Sora为何"暴毙"?》、封面新闻

关停数据与原因:

对做内容的人意味着什么:别再参考任何把 Sora 当首选的教程了。同时这也预示一个更大的趋势——视频生成的算力正在被 Agent 抢走,涨价和排队是长期趋势,不是短期波动。这与第 11 章"即梦一年三次调价""Seedance 2.0 首日排队 8–10 小时"完全同源。

3.3 工具链:各自在链路中承担什么

工具链路中的角色关键评价
即梦 Dreamina(字节)主力出图 + 图生视频 + 首尾帧 + 智能参考转绘中文语义强,AI 漫剧/玄幻题材首选;内置 Seedream(图)/Seedance(视频)、角色锁定、局部重绘、三视图模板
可灵 Kling(快手)图生视频、首尾帧、原生音频镜头叙事感强、电影级画质,适合影视短片
海螺 AI / MiniMax人物表现、镜头生成、原生声音常做镜头间过渡段;其官方 specular highlights 指南是"珠光宝气"最好的公开方法论(见 6.1.1)
Vidu(生数)多参考图生视频(多主体一致性)用于"图一中的女人立于空中,图二中的飞剑刺中她"这类多素材合成
通义万相 Wan(阿里)网页创作入口 + Model Studio API 双路径⚠️ 网页版本名与 API model 字符串不能互相推断(如网页展示万相 3.0,国际区 API 文档仍以 Wan 2.7 为主)
腾讯混元图生视频 + 首尾帧已开源图生视频模型,可自部署
PixVerse(爱诗)社媒特效、模板、快速迭代同质化风险最高——"模板越强,作品越容易出现相似构图"
剪映成片总装:拼接、卡点、智能字幕、BGM、调色几乎所有教程的最后一步;"图文成片/智能画布"的细节未找到权威拆解(未证实)
Liblib 哩布 / 无界AI / 堆友国风模型与 LoRA 社区 + 在线工作流,负责出图侧风格化与一致性无界AI 有独立"2.5D 国风"模型,公开参数:DPM++ SDE Karras、9:16、CFG 7、精绘 1.5 倍强度 50%。堆友的链路位置未证实

两条被验证的实战组合:

逐环节对应关系:

环节主流选择
出图Seedream 4.5/5.0、Nano Banana Pro、Midjourney、即梦、Flux 系
图生视频Seedance 2.x、可灵 3.0 系、MiniMax H3 系、Wan 3.0
换装/卡点即梦、可灵 + 换装技能规范(见 6.2)
配音/BGMTTS + Suno 国风 + ElevenLabs 音效(见第 12 章)
放大/精修Topaz Video AI、ComfyUI 放大链
剪辑剪映

3.4 国外链路:2026-09 的实际主力(两条时效校正)

⚠️ 必须先知道的两件事(截至 2026-09):

  1. Sora 2 已停服——App/网页 2026-04-26 关停,API 2026-09-24 下线。任何仍以 Sora 2 为主力的方案已过期。
  2. Veo 4 从未发布——2026 Google I/O 只发了 Gemini Omni;官方 Veo 系列仍是 Veo 3.1(1080p / 原生音频 / 8s 可续接)。
环节国外实际主力
出图Midjourney V8.1/V8.2(alpha)、FLUX 3 / FLUX.1 Krea、Ideogram 4.0、Nano Banana Pro、Seedream 5.0、SDXL 生态(Pony/Illustrious/NoobAI)
出视频Veo 3.1、Kling 3.0 / 3.0 Omni、Runway Gen-4.5、Seedance 2.5、Hailuo 3(MiniMax H3)、Grok Imagine Video 1.5、Higgsfield(聚合层)
一致性Kling Elements、Runway Gen-4 References、Veo Flow Ingredients、Seedance 多参考(30 图)、Higgsfield Soul ID
音频模型原生音频(Kling 3.0 Omni / Veo 3.1 / Hailuo 3)、ElevenLabs、Suno v6
后期Topaz Video AI(2025-10 起改订阅制)、DaVinci Resolve
分发竖屏 9:16、8–15s、前 1–2 秒定生死

各视频模型在仙宫题材上的实际差异:

模型单次时长最强项仙宫题材表现
Veo 3.14/6/8s 可续接原生音频 + 提示词遵循 + 4K 质感 + Ingredients 参考云海/建筑质感最"贵",光很"电影";缺点是贵、单段短
Kling 3.0 / 3.0 Omni3–15s 可续到 3 分钟一次生成 6 镜头故事板 + 原生 4K 60fps + Omni Audio(对白/音效/配乐同帧生成)+ Elements 角色锁定仙宫"巡游式多镜头"最强;多角色同场也能锁
Runway Gen-4.52–10sReferences(≤3 张)+ Motion Brush 逐区域控制 + Director Mode适合"先定角色板再动"的精修流程;纯空镜性价比一般
Seedance 2.54–30s 任意整秒首尾帧 + 最多 30 图/10 视频/10 音频参考 + 编辑式局部改720p 上限,但长镜头一次成最省事;竖屏短剧首选
Hailuo 3 / MiniMax H35–15s4K 原生 + 便宜($0.06/s @768p、$0.16/s @4K)+ 32kHz 立体声;H3-Base 已开源仙宫大景"清晰又便宜";但该端点不吃关键帧/参考图
Grok Imagine 1.51–15s极快、便宜($0.08/s @480p)用于快速试运镜与构图(草稿),成片仍需换模型
Higgsfield聚合层Soul ID(20+ 张图训练持久身份)+ Cinema Studio 运镜做"同一仙女跨几十条视频"最省事的商业化方案

3.5 国外打法的四条结构性差异

  1. 仙宫题材吃"空间一致性",不吃"角色一致性"。 这是 B 报告最有价值的判断,与栖光案例完全吻合:纯空镜 + 大景小人 + 无台词无字幕,绕开 AI 最弱的人脸/口型,只压最强的建筑/云雾/体积光。这是该题材能低成本跑通的根本原因。
  2. 古风美人题材恰好相反,必须有稳定的脸和服装,必须走参考图/身份训练路线,成本约为仙宫空镜的 3–5 倍。
  3. 两个题材的共同最优解是"静态图 → 图生视频",而不是文生视频。 先出 20–50 张图选 1 张,再让视频模型做微动(云飘、衣摆、鹤飞、光移),比 T2V 一次成片成功率高一个量级。
  4. 国外信的是"账号级资产",不是"单条提示词":Midjourney 的 moodboard(风格板) + 角色四联表(character sheet)+ 身份训练(Soul ID),都是为了把一次成功变成可复用资产。

Midjourney 古风调参四件套(可直接用):

一致性方案的四套主流做法:

  1. 参考图锁脸:Kling Elements(角色 2–4 张不同角度图,官方建议 5–10 张含正面/3-4/侧面/不同光照/一张特写);Runway Gen-4 References(最多 3 张生效,官方建议中性均匀打光素材);Veo 3.1 Flow Ingredients(1–3 张;注意 Quality 档不支持 Ingredients,只有 Lite/Fast 支持);Seedance 2.5 参考预算最大(30 图 + 10 视频 + 10 音频)。
  2. 角色表(character sheet):一次出"正面全身 + 3/4 侧 + 侧面 + 特写 + 服装平铺"四联图,作为项目固定资产。国外短剧团队把它当"选角照"用,任何镜头都从这张表出发,而不是从文字描述出发。
  3. 首尾帧插值:最实用的仙宫玩法是——同一张图的"未加光"与"加光"两个版本做首尾帧,让光在镜头里生长。
  4. 身份训练(Soul ID 类):20+ 张图训练持久身份,之后在平台内所有模型(Seedance / Kling / WAN / Veo / Gemini Omni)复用,不必每次重传参考。

多镜头同一角色的实操纪律:把身份/服装/场景写在固定段,把动作/景别/机位写在变化段;每条镜头只用一个变化点(换机位就不换服装);逐镜头按"身份 / 服装道具 / 场景连续性 / 动作连续性"四维评分——耳环、发际线、手、眼珠颜色是最常崩的细节。

分发与算法偏好(国外):

国外单条成本折算(15 秒 5 镜头,含 4 次重试):

路线单条成本
纯仙宫空镜(Kling 720p 无音频 + MJ 摊薄)≈ $3;加原生音频 ≈ $4.5
纯仙宫空镜(Hailuo 3 @768p)≈ $3.6(最便宜)
古风美人路线(角色表 + 参考锁定,生成量翻倍)$6–$15
古风美人 + Higgsfield Soul ID 锁脸$5–$12

⚠️ 成本口径提醒:不同来源的 Veo 3.1"每有效秒"差异极大($0.17 ~ $5.5/秒),差异来自是否计入重试、是否用 Vertex 计费、Resolution/音频档位混算。报价前务必用「有效秒 × 重试系数」自算,不要直接引用博客的单秒数字。 另注意:Kling 订阅 credits 不滚存、失败任务仍扣(API 侧失败不扣)。


4 通用生产链路(六步法)

不管国内还是国外、个人还是团队,能跑通的链路都可以归到这六步:

① 创意/选题  →  ② 关键帧出图  →  ③ 图生视频(锁首帧 + 小运镜)
                     ↓                        ↓
              ④ 一致性处理            ⑤ 音频(配音/BGM/音效)
                     ↓                        ↓
              ⑥ 放大精修 + 剪辑 → 发布(含 AI 标识声明)

每一步的核心原则:

步骤原则典型翻车
① 选题视觉母题必须一句话说清("云海白玉长廊通向天门")选题模糊 → 提示词只能"许愿"
② 出图图片是视频的结构母图;先构图 → 再空间层次 → 再镜头位置 → 最后主次一上来就写氛围词,AI 停在"图像渲染"
③ 视频锁首帧 + 只写看得见的动作 + 小尺度运镜镜头幅度大 → 建筑融化、人物换脸
④ 一致性人景拆分(人物三视图单独做)+ 物料拆包(人物图 / 场景图分开)把参考图当"参考人物",其实只是风格与结构输入
⑤ 音频声音克制,画面才显得大堆 BGM 和音效 → 廉价感
⑥ 后期放大 + 调色数据化(Hex 色板)+ 剪词过度磨皮、过度锐化 = AI 味

5 仙宫 / 天宫 专项打法

来源:行者AI视频拆解(同 2.3)+ gjgagvg/tiangong-image-prompt-generator(目前最系统的公开"仙宫提示词规约",已逐条核实)

5.0 巨物尺度分级(把"宏伟"变成可量化数字)

这是整个仙宫题材最重要的一组数字。人物占画面高度比按景别分级:

景别人物占画面高度
远景1%–4%
中景5%–8%
近景12%–20%

除非明确要求,人物不抢占建筑主体。 同时必须至少保留两级尺度参照(人物、仙鹤、灯火、栏杆、门洞、云层、远山任选)。以遮挡、透视收缩、空气透视和重复结构表达体量,不只依赖"巨大、宏伟"这类形容词。

常见错误:门窗与人物比例冲突;远近物体同等清晰;重复柱网失真;无承重逻辑的结构。

5.1 出图的四条铁律

  1. 人物要小。 远景把人物压到画面 3%–5%。再大一点,天宫就变成人像写真的背景板。
  2. 建筑要有轴线。 白玉阶、南天门、主殿、远山落在同一条视觉线上,观众视线有路可走。
  3. 建筑要写具体构件。 柱、斗拱、抬梁、飞檐、白玉基座、云龙浮雕——写清楚构件,模型才知道东西该放哪。
  4. 云海要分层。 前景薄雾 / 中景翻涌云海 / 远景空气透视 + 虚化山体。

配色公式:白玉 + 冷青灰打底,暖金光只照重点,加一点朱红压细节。

构图量化配方(实测输出):一点透视柱廊引导视线延伸;右侧留 40%–60% 云海呼吸空间;暖金色晨光斜射;红衣人物立在画面约 3% 位置作为视觉锚点。

5.2 动起来的五个字段

把一张静图拆成:时间轴 / 镜头 / 人物动作 / 环境动态 / 连续性约束。

5.3 进阶:第一人称 Vlog(把远景变成能看 60 秒的内容)

工程关键:物料拆包。 用 7 张图:1 张人物主图(锁脸/发型/衣服)+ 6 张场景图(白玉广场、云阶、月门、云桥、云廊、茶席)。"人物归人物,地点归地点"——生成时不用每到一处重新猜。

60 秒 Vlog 选 3 个片段,每段给秒级区间 + 明确动作,让人物把镜头带到下一个地方(穿过月门、纱幔掠过镜头)。

5.4 材质要写出物理差异(同一画面里玉、木、瓦、金、云、水必须能区分)

材质要写的要避免的
白玉温润、微透光、细微矿物纹理、边缘磨损塑料感、均匀自发光
木构可见古木纹理、榫卯关系、朱红漆面与岁月痕迹光滑玩具质感
琉璃瓦沿曲面反射天光,粗糙度有变化镜面金属屋顶
金属只用于节点和礼器,氧化/拉丝/锤纹,不大面积铺金满铺金饰、廉价"国潮"贴图
云雾有密度梯度、受光面和阴影面棉花状重复纹理
水体反射、波纹、折射、表面张力,与重力方向一致完整镜像、镜面水
废墟断口、灰尘、苔痕与结构受力相互吻合随机裂纹贴图

构图三层:前景框架 / 中景叙事主体 / 远景世界延伸。 每幅最多一个主奇观 + 两个辅助奇观(这是"画面不堆砌"的硬约束)。 仪式场景优先对称与中轴;探索场景优先偏心、遮挡、负空间;危机场景用斜线、断裂、逆向动势。 画面要能一眼回答:人物在哪里、要去哪里、世界有多大、此刻发生什么。

5.5 九组差异化生成策略(做系列号直接照抄)

做天宫系列号最怕"每条都一样"。这套九组策略保证世界观和角色连续,同时让叙事、空间、镜头、时段或动态中至少两项显著不同:

#策略要点
1天门初见|建立世界超远景/越肩;人物首次抵达巨型天门;门框套景、云海、尺度震撼
2中轴朝圣|秩序仪式正面对称、低机位、长玉阶;少量仪仗沿中轴前行
3云廊漫游|空间纵深侧向长廊、重复柱网、消失点;平视跟拍或缓慢横移
4月宫静夜|诗性孤寂冷色夜景、巨月、白玉平台;单人小比例;负空间与静止感
5星河祭坛|宇宙神圣高台/俯瞰,天河环绕;圆形秩序、星轨、可读光源
6浮城全貌|体系规模极高机位/航拍推进;多层宫群与悬桥构成城市体系
7云瀑奇境|自然共生垂直构图;宫殿嵌入神山,云瀑穿越桥下
8战争遗迹|历史创伤破碎天桥、倾塌殿宇、熄灭宫灯;偏心构图与逆光
9神迹降临|叙事高潮光柱/天门开启/神兽掠过,只保留一个核心神迹

连续九镜的叙事映射:建立世界 → 抵达 → 深入 → 发现 → 仪式 → 全貌 → 异变 → 遗迹真相 → 神迹高潮。

5.6 分平台提示词写法(别把多个平台的语法混进同一条)

平台写法要点
Midjourney紧凑自然语言,顺序:主体→环境→构图→光线→材质→风格;--ar 指定画幅;无独立负面栏时用 --no 放少量明确对象
Flux完整描述句,明确空间关系、材质、光源;避免大量逗号标签与互相矛盾的风格词;把限制写成可观察的正向约束
SDXL正负分离;按主体/环境/摄影/质量组织;写实模型要减少引擎名和冲突的艺术家风格词
即梦清晰中文:主体、景别、动作、环境、光影、画幅、风格;视频任务补镜头运动、主体运动、环境运动与稳定性限制
可灵按"首帧场景—主体动作—镜头运动—环境响应—结尾状态"描述视频;控制单镜头动作数量,写清速度/方向/幅度/前后景视差
Runway只写视觉可见、可拍摄的运动;区分镜头运动与主体运动;多写"如何移动",少写抽象审美标签
AI 漫剧分镜每镜输出:镜号、时长、景别、画面、角色动作、台词、音效、转场、连续性锚点;相邻镜头遵守视线/运动方向/轴线连续;每镜只承载一个主要叙事动作

5.7 镜头运动的四条硬规则

来源:Runway Gen-4 官方指南 + AI漫剧提示词写法

  1. 一段只保留一个主运镜。 不要在同一小段同时写推近、横移、升高、环绕、俯冲、变焦——过多冲突指令会让模型"尝试调和矛盾"。
  2. "缓慢推进"必须是摄像机空间位移。 近景视差快、中景适中、远景最慢;禁止用数码放大冒充推进。
  3. 追逐镜头要分开写三种方向:主体运动 / 摄影机运动 / 场景相对运动。只写"高速追逐",模型会自行发明方向。
  4. 用时钟方位描述光源("11 点方向低角度逆光")比"侧逆光"更可控;时间轴用 2–4 个阶段组织,不必逐秒切碎。

首尾帧衔接的判据(这条很关键): 首尾帧差异必须能由真实摄影机路径解释——先判断摄像机能否从首帧位置物理到达尾帧位置、两者是否同侧轴线、门/墙/道路内外关系是否一致。不能解释时应改首帧或尾帧,而不是用复杂运镜硬接。 最常见的续接方式是直接导出上一镜尾帧当下一镜首帧。

5.8 零提示词路线(不想写提示词的人)

两个开源技能包,装上就是"视觉导演 + 运镜导演":

三步复刻法(来源:数艺社实测):

  1. 在豆包"工作任务"里发"安装这两个技能:<GitHub 链接>";
  2. 出图:有参考图用图生图(更稳),没有就词生图,点名 Seedream 4.5;
  3. 出视频:附上满意的图,说"根据这张图片生成视频,使用 Seedance 2.5"。

同类可参考的还有 joshesye/design-xianxia-celestial-shots(生图)与 joshesye/design-seedance-celestial-motion(运镜)。

⚠️ 可信度提示:liyue-aigc/xianxia-visual-director 与 xianxia-cinematic-video-director 两个仓库的 SKILL.md 在实测中返回 404,其内部规则未能直接核实("安装即用"的效果描述来自第三方测评)。已逐条核实、可直接使用的是 gjgagvg/tiangong-image-prompt-generator——本报告第 5 章的尺度分级、九组策略、材质规则、分平台写法、质量检查清单均取自该规约。建议优先用它。


6 珠光宝气古风美女 专项打法

6.1 去塑料感:四板斧

来源:FlowPix《AI绘画古风发饰怎么画不塑料?》

第一板斧——形制写准。 只写 "hairpin" / "hair accessory",形态全凭运气:

形制正确写法
簪(单股)zan, single-prong hairpin
钗(双股)chai, double-prong hairpin
步摇(带坠流苏会动)buyao, hairpin with dangling pendants that sway
钿(花形片状)dian, floral inlaid hair ornament

新手建议从步摇入手:流苏坠子辨识度高,AI 容错率大。

第二板斧——材质写出工艺和透感(塑料感的根子在材质词太笼统)。见第 7 章模板。

第三板斧——光影让发饰立体。 soft directional light from upper left, specular highlights on metal edges, subsurface scattering on jade, gentle shadow under ornaments 绝对不要写 flat lighting / even lighting——那种光下发饰必扁。背景要压暗(深褐或墨绿)才衬得出高光。

第四板斧——朝代锁调性。 唐华丽 / 宋清雅 / 明繁复 / 清点翠(关键词见第 7 章)。

两条硬数据:

局部修复优先于整张重来:发饰"长歪"(簪子插到耳朵上面、步摇垂到肩膀外)用局部重绘框住发饰区域单独修。

6.1.1 金属与宝石的物理关键词体系(来自海螺 AI 官方指南)

来源:Hailuo AI《Prompting Specular Highlights for Luxury》(2026-07-27)——目前"珠光宝气"质感最权威的公开方法论。

关键词作用
anisotropic highlights各向异性高光——拉丝金属的关键
specular roll-off高光滚降(高光到暗部的过渡)
warm metallic luster暖金属光泽
internal refractions内部折射(宝石/玉石)
caustics焦散(光线透过宝石投下的光斑)
prismatic glints棱面闪彩(火彩)
Fresnel effect菲涅尔效应(掠射角反射增强)
iridescent overtone虹彩泛色(珍珠)

三条反直觉的核心原则:

  1. 优先描述光源与材质物理,而不是直接描述高光位置。 让模型自己算高光。
  2. 用 soft glow 搭配 specular,比单写 extremely shiny 更物理可信。 "极致闪亮"会导致高光溢出、细节被吃掉。
  3. 金属必须有东西可反射才像金属。 金属在纯黑背景里会"融"进去——必须用 rim lighting 勾边,或给它环境反射源。

珍珠的四层光学写法(来源:FlowPix《AI珍珠首饰绘画》):

珍珠 = ① body color(底色,暖奶油白带象牙底)
     + ② 表面虹彩晕彩(soft pink → pale green,边缘掠射光处最明显)
     + ③ 镜面高光(柔和扩散光斑,而非锐利白点——"像一片月光而不是激光点")
     + ④ 内部微弱内发光(光被封在层叠半透明结构里)

必须分层描述。正面直射光会压掉晕彩;CFG 建议 5–7。 反面教训:只写 pearl necklace on a black velvet background 会得到"乒乓球串";负面词若包含 plastic / glossy / shiny / reflective,会把珍珠高光一并压低——这是很多人生搬硬套负面词反而翻车的原因。

⚠️ "人物 + 首饰"同时生成会牺牲首饰精度:必须用 Inpaint 单独重绘首饰区域,或干脆分开出图再合成。

6.1.2 人物资产前置:三个记忆点 + 别堆头饰

来源:刺猬星球/FlowPix(2026-06-17)

6.2 换装类内容:工业级规范

来源:liyue-aigc/female-outfit-director

项目规范
画幅/时长9:16,8 秒 = 初始造型 + 4 次换装
卡点1.25s / 2.95s / 4.40s / 6.55s(最后一段必须留最终造型展示时间)
机位固定高位俯拍(前上方,向下 30–35°),全程不推拉摇移变焦
换装机制汉服大袖/披帛 → 袖摆遮镜;古风贵女 → 团扇/折扇遮挡;东方幻想/神女 → 披帛、花瓣、云纹、水墨
首帧版式中央主体占画面宽 60%–65%,四周 4 个小人物(同一角色,白色虚线轮廓抠像)
硬性约束同一张脸、同一成年年龄感、同一族裔外观、同一肤色、同发型发色、同头饰耳饰、同身材比例;只改变穿搭,不重做人物
衣料物理自然重力、转身轻微惯性延迟、停止后逐渐回落;不僵硬漂浮、不穿模、不粘连身体

最容易被忽略、也最重要的两条:

  1. 首帧要为视频兼容而优化——小人物避免极端扭曲姿势,头肩腰臂结构清晰,小人物与中央人物身体拓扑尽量兼容(便于重合换装),袖摆裙摆披帛完整不裁切。图片是视频的结构母图,首帧不合格后面全废。
  2. 短时长中不要同时叠加复杂运镜与复杂换装机制。

6.3 古风美人视频的六段式结构

见第 7 章 G4 模板。值得单独强调的是它的分工:首帧锁定 → 人物表情动作 → 台词 → 镜头 → 氛围光线 → 约束。 仙宫类只需把"台词"段换成"环境动态"、把"人物"段缩到最小——结构完全通用。


7 提示词模板

完整可抄的模板(仙宫中文/英文、古风美女中文/英文、头面特写、朝代切换、换装规范、负面词速查)见附录: → _parts/G-提示词模板合集.md


8 去 AI 味:这套工程化技巧库比提示词本身更重要

来源:shyman159/seedance-prompts-skill · prompt-craft-and-realism.md(由抖音"刺猬星球superi"37 集合集蒸馏)

核心理念:AI 图/视频"一眼假"的根因不是模型弱、也不是提示词不够长,而是你在"许愿"而不是用视觉语言下指令。

8.1 五板块结构 + 词序就是优先级

情绪 + 主体 + 光线 + 镜头 + 细节

8.2 把抽象词翻译成可量化视觉动作

你想说的要写的
梦幻低饱和 + 软光源 + 长焦压缩
高级强光线对比 + 部分留白
质感微弱侧光 + 高阴影对比

并直接告诉 AI 不要什么:无纹理、无锐化。

8.3 光线控制(AI 最容易露馅的地方)

8.4 去 AI 感:"AI 最大的问题不是不真实,而是太干净"

去摆拍感,摆拍感来自镜头与画面关系不真实,与提示词无关,三因三解:

病因解法
取景起点完成度过高让画面从不完整视角开始(前景遮挡/构图偏移),再用运镜去"找"画面
运动轨迹过度平滑引入减速/停顿等人为操作痕迹
主体动作与镜头完全同步让人物动作早于镜头反应,制造"被进入的瞬间"

前景遮挡去 AI 味:物理遮挡(树叶/柱子/人物背影 + 低角度 + 前景虚化;注意 AI 遵循顺序机制,不写"虚化"它会把前景画清楚而失去景深)+ 氛围遮挡(空气里有雪花/雾气/颗粒感)。

电影感 = 摄影约束先于美学:先写镜头类型/拍摄距离/光线结构,再写风格。90% 的人上来就写氛围,AI 只停在"图像渲染"而非"真实摄影"。

剪词(让画面显贵):

8.5 动作崩坏的三条规则

AI 眼里动词是"目标状态"不是"进行态"。

  1. 减动词、增方式词——保留一个核心动作,用"犹豫的/持续的/重心转移"限定节奏。
  2. 单一主动作锁身体结构——走路的主动作是 walking,"回头看"只是朝向变化。
  3. 别用"然后/接着/同时"——深层模型不可靠地执行时间轴;改描述"动作发生时角色处于什么状态"。

8.6 调色数据化

8.7 后期去 AI 味三步(带具体参数,可直接照做)

来源:器灵科技《Seedance出的片总觉得"怪怪的"?可能是少了这三步》(2026-07-16)

第一步:拉反差

第二步:锐化但别狠

第三步:三个藏味细节(这才是拉开差距的地方)

  1. 加胶片颗粒(35mm 400T,强度 15–20%)——"塑料感立刻消退",最快见效;
  2. 补运动模糊(物理快门有曝光时间,AI 运动太丝滑;沿运动方向模糊 3–5 像素);
  3. 帧混合过渡(分镜衔接处加 1–2 帧交叉溶解,透明度 80%→20%)。

作者的总结很到位:"不是参数,是你愿不愿意多花半小时。"

8.8 手指与脸崩的修复参数

问题处理
手指提示词末尾加 perfect hands, detailed fingers, five fingers, anatomically correct;配合手部修复/OpenPose 固定骨骼;仍崩就裁掉手部用局部重绘
脸面部关键词权重 1.3–1.4,CFG 降到 5–6,步数提到 30 以上;"脸崩多半是过度优化或权重打架"
权重纪律1.1–1.3 最稳妥;超过 1.5 会让发丝变钢丝、眼睛高光变成大白点

通用负面词:

low quality, blurry, pixelated, noise, text, subtitles, watermark, logo,
deformed, bad anatomy, extra limbs, extra fingers, oversaturated, overexposed

人像另加:bad face, asymmetrical eyes, weird teeth

⚠️ 但注意 6.1.1 的反面教训:做珠宝/珍珠题材时,plastic / glossy / shiny / reflective 这几个词会误伤材质表现,需按题材裁剪负面词,不要机械照搬。


9 一致性工程(古风美女类内容的生死线)

来源:同 8;以及 2018 年前的经典做法 + 当前技能规范

一句反直觉但极关键的结论:

参考图不是"参考人物",只是风格与结构输入。

三招保一致性:

  1. 人景拆分——先生成人物多角度三视图,成为稳定可复用对象;别和场景一起生成。
  2. 先动作、再进场景——先让人物完成指定动作再与场景合成,避免叠加场景时重推人物结构。
  3. 拆镜头降时间维度——连续帧每多一帧多一次偏移,尽量一个动作一段视频。

物料层面:远景/中景用"人物主图 + 分场景图"拆包;特写/近景人脸崩时用 FaceRefine 类修复后处理。

9.1 角色一致性的七条路径(按门槛从低到高)

来源:火星时代《AI短剧角色一致性的7种方案》(2026-08-11)

有文章称 76% 的 AI 短剧创作者把"镜头一切就换人"列为第一大痛点。七条路径:

#路径门槛 / 效果
1图生视频 + 参考图驱动(先出定妆照,后续只写动作)最低;但侧面/远景匹配度约 55%
2角色卡片 + 外貌锚点(固定文字段每镜原样粘贴)低;对提示词纪律要求极高
3固定 seed低;同场景有效,跨场景仍漂移
4AI 换脸后期(ReActor / InstantID)中;救急用
5LoRA 训练(20–50 张多角度,rank 32–64,strength 0.7–1.0)高;每角色 5–8 小时
6ComfyUI IP-Adapter FaceID + LoRA + ControlNet 三重锁定最高天花板;需 12GB+ 显存
7全流程角色引擎(项目级角色档案,跨集引用)团队级

四个低成本辅助技巧:服装锚点法、快速剪辑法(每镜 2–4 秒,观众来不及看脸)、统一调色法、剪辑过渡法。

核心纪律:先把角色锁定,再开拍。

外貌锚点串的写法(每一镜原样粘贴,不要改写):

角色C01:25岁亚洲女性,鹅蛋脸,杏仁眼,右眼下方浅色小痣,
黑色齐肩直发,三七侧分,银色圆形耳环。

纪律原话:"不要把'齐肩直发'改成'中长发',不要交替使用'清秀''妩媚'等主观词——每个词都会导致模型重新推断面部。"

声音一致性(AI 视频最易露馅的是声音):建角色声音参考库(把满意片段的音频抽出来存独立文件,每次生成上传作参考)+ 独立配音模型锁定音色 + 情绪声音库(同一角色"正常/愤怒/伤心"样本按剧情选用)。


10 本地复现(RTX 5060 Ti 16GB / Blackwell sm_120)

完整方案(量化档位、50+ 个可验证的 Civitai 资源、三套节点级工作流、显存与耗时表)见附录: → _parts/C-本地ComfyUI复现方案.md

10.1 本卡实测数据(照抄即可,不用再试错)

出图:

模型配置耗时
FLUX.1 Krea devfp8_e4m3fn 或 GGUF Q8,992×1440 / 20 步≈53 秒(冷启含加载 121.7s)
FLUX.1 Krea dev+ DyPE,1440×2560≈94 秒
Qwen-ImageQ4_K_S(12.14GB),Lightning 4 步,1080×1360≈21~23 秒
FLUX.2 devfp8 33GB(需 83GB 总内存)/ GGUF Q5 992×1440>4 分钟 → ❌ 本机不实用

结论:写实古风首选 FLUX.1 Krea dev;中文提示词、画面内题字、换镜头首选 Qwen-Image(4 步版)——同样时间里 Qwen-Image 能出 5~8 张。FLUX.2 dev 明确不推荐(官方 fp8 20.43GB 的 Qwen-Image 同样必 OOM,必须走 GGUF Q4_K_S)。

视频(这是最硬的一组数据):

模型分辨率 / 帧耗时
Wan2.2 I2V 14B(High Q8 + Low Q6 + BlockSwap + Sage + TorchPatch)496×720 / 81f冷启 222.8s → 热启 133.2s
同上496×720 / 97f158.6s
HunyuanVideo 1.5(720p i2v cfg-distilled fp8)496×720 / 97f198.0s(慢些但更省显存、物理更真)
LTX-2.5 22B(Q3_K_M GGUF,10.73GB)1920×1088 / 97f183.1s,峰值 14.1–15.5GB,带同步音频
MiniMax H3(已有)864×480 / 5.17s / 20 步 + EasyCache194s;无 EasyCache 是 633s

10.2 这块卡上最大的提速杠杆:EasyCache

ComfyUI 原生 EasyCache 在 H3 上把 633s → 194s(3.3×),在 FLUX.2 GGUF 上把 20 步 181s → 91s。同一张 5060 Ti 的两篇公开实测差异全部来自它。 开它比换模型更有效。

10.3 sm_120 的四个必踩坑

坑现象处理
PyTorch CUDA 版本低于 cu128 的轮子无 sm_120 kernel → no kernel image is available必须装 cu130(或 cu128)轮子
requirements 顺序torch 未 pin,在装完 CUDA13 栈后再跑 requirements.txt 会静默覆盖回默认源、失去加速顺序固定:requirements.txt 先,CUDA 13 栈最后装;启动日志必须看到 +cu130 与 comfy-kitchen CUDA backend available: True
Triton / SageAttentionsm_120 的 triton 支持滞后不强求 triton;SageAttention 走源码编译(--no-build-isolation 必须,否则 pip 会拉第二份 torch)。sm_120 上所有显式模式都崩,只留 auto
32GB 内存 + pinned memoryH3 这类大模型被 OOM-killer 杀启动加 --disable-pinned-memory(实测:默认 29,866MB 被杀 → 7,508MB 跑通)

ComfyUI 版本地板:MiniMax H3 核心节点自 v0.30.0,LTX-2.5 自 v0.32.0,Krea 2 自 0.25.0。建议直接跟 master。

10.4 古风资源:老生态最全,Flux 侧靠组合

关键发现:汉服、仙侠、古建类 LoRA 绝大多数是 SD1.5 / SDXL / Illustrious 底模,Flux 侧资源较少,需要靠"通用古风 LoRA + 光影 LoRA + 提示词"补。

可直接检索到的资源(均经 Civitai API 逐条验证,下载量附后):

类别代表条目底模 / 下载量
仙侠风格仙侠道/xianxia/taoist/法天象地SD1.5 / 5,099
PAseer 的仙侠之境SD1.5 / 6,613
xianxiaFlux.1 D / 304
ChineseXianxiaStyleLTXV 2.3 / 447 ← 可直接进视频侧
国风底模国风3 GuoFeng3SD1.5 / 160,805
国风4 GuoFeng4 XLSDXL / 27,357
汉服hanfu 汉服SD1.5 / 106,378
汉服合集 [Flux.1] Hanfu Collection [Female]Flux.1 D / 4,867
hanfu tang / song / mingSD1.5
古建Ancient Chinese architectural styleSD1.5 / 11,191
珠宝jewelry SliderPony / 4,105
GemstoneAI - konyconiSD1.5 / 9,081
打光Backlight (Hair light) cinematic lightingFlux.1 D + SDXL / 3,901 ← 轮廓光/发丝光
Cinematic "Warm Light" 3200k多底模 / 12,361
Cinematic Volumetric (God Rays)多底模 / 6,233
降 AI 味NL2 | film grain & chromatic aberrationIllustrious
FilmGrain.Redmond多底模

「云海」没有专门的 LoRA——Civitai 无有效结果,走提示词 + 体积光 LoRA: sea of clouds, cloud ocean, aerial view above clouds, volumetric god rays, mist, atmospheric perspective, ethereal

⚠️ Civitai 官方域名在本网被 DNS 污染,实际下载走 civitai.red 镜像(API key 见 ~/Downloads/civitai_api_key.txt)。LiblibAI 站点可达但搜索 API 返回 500,需手工站内搜。

推荐权重组合(Flux Krea dev 基准):

古风底味:     风格 LoRA (xianxia/古风)         0.5 ~ 0.7
服装:         汉服 Collection [Flux.1]         0.7 ~ 0.9
配饰:         Jewelry Gemstone Pearl Diamond   0.6 ~ 0.8
打光:         Backlight (Hair light)           0.6 ~ 0.8   ← 轮廓光/发丝光
               Cinematic Warm Light 3200k       0.5 ~ 0.7
氛围:         Volumetric God Rays              0.4 ~ 0.6
质感:         film grain & chromatic aberration 0.3 ~ 0.5  ← 最后加
加速:         Flux Lightning 8step             0.6 ~ 0.8
换脸:         BFS 换脸 LoRA                    0.8         (1.0 会出画面问题)

经验规则:风格类 ≤0.8、材质/光照类 ≤0.8、加速类 0.6~0.8、颗粒类 ≤0.5。 总 LoRA 数超过 4 个时 Flux 会掉细节 → 串成两级采样(第一级只放风格+服装,第二级只放打光+颗粒)。

10.5 本地一致性技术(这块本地比云端有优势)

方案16GB 可行性用途
三视图 + ref2v(已有 H3 工作流)✅ 已在用最强的身份锚定;配 h3-turnaround-autoprep 技能先裁出正面图
Qwen-Image-Edit 2509 + BFS 换脸 LoRA(0.8)✅ 4 步加速后 20~35s/张把已定妆的脸批量贴到不同镜头/角度(v1 保脸型、v2 换整头)
PuLID for FLUX✅(约 +2~3GB)单张参考图锁脸,比 InstantID 轻
FLUX Redux✅保风格/构图/服装,不保脸;权重 0.4~0.6
FLUX.1 Kontext dev✅指令式编辑:"同一个人换到侧脸/换背景"
InstantID / IP-Adapter FaceID⚠️ 需 insightface,Py3.13 编译常失败SDXL 老工作流

跨镜头配方:① 出定妆照锁 seed → ② Qwen-Image-Edit 2509 + BFS(0.8) 生成 3~5 个角度 → ③ 每镜头 参考图 + 服装 LoRA 0.8 + 打光 LoRA 0.7 + Redux 0.5 → ④ 视频阶段统一用同一参考图走 Wan2.2 I2V 或 H3 ref2v。

⚠️ 注意:LTX-2.5 上身份漂移与分辨率绑死——640×320 会明显漂,768×448 以上才稳。

10.6 本地 vs 云:怎么分工

单条 5 秒 720p 成品本地链路:关键帧 60s + 放大 30s + I2V 150s ≈ 4 分钟/条;一天 8 小时名义可出 100~120 条,含试错打 5~8 折 → 实际 15~30 条可用。电费不到 1 分钱/条。

云价对照(2026 公开价):Kling 2.1 Standard $0.07/5s、Pro $0.28/5s、Seedance 2.0 $0.30、Veo3 $0.50。

⚠️ 但云价的真实成本要乘 2.5× 以上:失败率 10~15% + 平均需 2~3 次迭代,行业实测"一条能用的 AI 视频,实际成本是标价的 5~20 倍"。

环节放哪理由
概念探索、构图、风格试错本地秒级反馈,零边际成本
古风 LoRA 调权重、打光试错本地需要几十次快速迭代
关键帧定稿 + 放大本地2K 出图本地已够用
人物一致性镜头(同一人多角度)本地云端无对应开源级控脸能力
纯场景/运镜镜头(仙宫航拍、云海)本地 Wan2.2 / LTX-2.5130~200s/条可接受
带对白/音效的镜头本地 MiniMax H3(已有)唯一本地同步音频方案
复杂多人交互、需 1080p 物理正确上云 Kling Pro / Veo3本地 16GB 做不到稳定
商业终稿、客户交付素材上云质量与一致性上限更高

一句话策略:本地承担 80% 的迭代 + 所有关键帧 + 所有身份一致性工作;云端只买"复杂动作 + 1080p 终稿"这两个本地做不到的能力。

与本机已有 H3 工作的分工建议:H3 出"有人物 + 要说话/有音效"的镜头,Wan2.2 出纯场景/运镜镜头。


11 成本与变现(这段最容易被忽略,也最容易亏钱)

11.1 真实成本结构

栖光口径(个人号):一般画质 50–60 元/条,4K 100–300 元/条。

即梦价目表口径(蓝鲸财经/东方财富 + 娱乐资本论/澎湃,2026-04-10)

档位年费(原价)首充优惠月积分变化
基础659 元/年5 折 → 6 折1080 → 725
标准1899 元/年5 折 → 6 折4000 → 2210(砍半)
高级5199 元/年5 折 → 6 折15000 → 6160(另一来源记为 5870)

两个来源的价格看起来不同(329/949/2599 vs 659/1899/5199),实际是首充五折价 vs 原价的关系:659×0.5≈329、5199×0.5≈2599。改六折后即 395/1139/3119,每档每年多交约 500 元。

可灵价目表口径(Modellix 引官方页,2026-08-14)

档位首月 / 续费Credits
Standard$6.99 / $8.80660
Pro$25.99 / $32.563000
Premier$64.99 / $80.968000
Ultra$127.99 / $159.9926000

免费 66 credits/天、24 小时过期。VIDEO 3.0 每秒消耗:720p 无音频 6 / 1080p 无音频 8 / 1080p 原生音频 12 / 4K 30 credits。

(国内"黑金连续包月 169 元/月"来自第三方测评文,未证实。)

工业化口径:《斩仙台》算力约 10 万元 / 约 3240 个镜头 ≈ 31 元/镜头。

11.1.1 失败率:价目表上的钱要除以 3–5

11.2 完整成本公式

总成本 ≈ 单位成本 × 镜头数 × (1 + 返工率)

返工率的实际差距(器灵科技复盘):

按镜头类型分流模型的策略:

特写 / 近景  → 面部保持最好的模型(保证角色不出戏)
全景 / 场景  → 场景还原度高的模型(保证氛围)
运动镜头    → 动态流畅的模型(保证过渡自然)

11.2.1 云价的"真实成本"要乘 2.5× 以上

标价单秒数字不能直接用来报价:

这条与 C 部分的本地电费对照(4 分钟/条,电费不到 1 分钱)结合起来,就是"本地做迭代、云端买终稿"这个策略的全部理由。

11.3 变现:靠平台分成基本不可能回本

平台模式实际收入参考
抖音中视频计划 + 广告分成10 万播放 ≈ 30–80 元;百万播放 ≈ 300–800 元
红果短剧独家签约或播放分成相对稳定,但对更新频率与剧集质量要求高
快手光合计划 + 流量分成新手扶持期后播放量断崖式下降很常见

两个残酷数字:

但这与栖光"靠流量收益基本打平"并不矛盾:奇观流(33 秒无台词)的完播率天然高于剧情流,且他有日更 + 50 万粉的规模效应。个人号做奇观流可以打平;做剧情流靠分成必亏。

真正赚钱的是商单:新人单条定制 500–2000 元,有粉丝基础可报 3000–8000 元。真实项目:一条净亏 95 元的短剧,因被品牌看中做 3 条定制 @1500 元,进账 4500 元。

值得试的方向:品牌剧情类短剧 / 悬疑恐怖科幻垂类(观众对画面真实感要求低、对创意氛围要求高;有账号做到 90 秒内、前 5 秒抛钩子,完播率稳定 45%+)/ 素材批量销售。


12 音频与配乐(仙宫类的高级感有一半来自声音)

12.1 声音克制,画面才显得大

天宫类视频普遍采用极简声音设计:高空风声 + 轻微衣袂声 + 远处鹤唳 + 编钟余韵。行者AI视频的 5 秒提示词里明确写了"环境声以高空风声和轻微衣袂声为主"。

12.2 Suno 国风:把"国风"拆成乐器 + 演奏法 + 情绪 + 场景

来源:谱乐AI《Suno 国风提示词指南》

黄金三角结构:

主旋律乐器(1件)+ 和声/衬托乐器(1件)+ 打击/节奏乐器(1件)
例:古筝(主旋律)+ 洞箫(衬托)+ 大鼓(节奏)

仙宫/天庭直接可用:

Chinese court music, pentatonic scale, pipa and yangqin and small drum, elegant, bpm-88,
refined ornamentation, silk and bamboo ensemble, palace hall with lanterns, instrumental

苍凉空镜可用:

Chinese folk, pentatonic scale, xiao and guqin, desolate, bpm-65, slow and sparse,
wind effect, horse bell in distance, desert outpost atmosphere, instrumental

搭配逻辑:情绪相近、音色互补(古琴+洞箫 = 一弦一气;琵琶武曲+大鼓 = 一旋律一节奏)。情绪相悖要慎重(洞箫+唢呐、古琴+快速打击乐、葫芦丝+编钟)。

⚠️ 已知坑:Suno 生成古风音乐容易带电子味,需加抑制词。

12.3 音效与原生音频

12.4 工具与授权(2026 时点)

工具价格关键限制
Suno v6(2026-09-11 发布)免费档 v6-mini;Pro $8/月;Premier $24/月首个用正版授权音乐训练的版本(华纳、BMG、Believe/TuneCore),支持段落级编辑与混音;⚠️ 索尼、环球版权诉讼仍在进行,授权尚未全覆盖
ElevenLabsStarter $5/月(有商用权 + 即时克隆)、Creator $22(专业克隆、192kbps)、Pro $99、Scale $330、Business $1,320Free 档无商用权——做付费内容至少 Starter
Topaz Video AI2025-10 起订阅制:Personal $299/年、Pro $699/年价格来自竞品博客,建议官网复核;典型链:Starlight/Astra 生成式放大 → Proteus 细修 → Apollo/RIFE 补帧 → 稳定

12.5 仙宫环境音清单(直接写进提示词的 audio block)

high-altitude wind, distant bronze bell, crane calls, waterfall,
temple chime, fabric rustle, stone footsteps

Suno 国风关键词串:

guqin, guzheng, dizi bamboo flute, pipa, bianzhong bronze bells,
pentatonic, guofeng, cinematic Chinese fantasy score, sparse, 60 BPM, no vocals

"中式天庭"类爆款的共同点是:无台词、无字幕,只靠画面 + 环境音。 这恰恰规避了 AI 口型与配音的短板,也让它无需翻译即可跨国传播。

12.6 调色的一个专业细节

国外团队在 DaVinci 里调 AI 生成的仙宫片时的重点不是加饱和,而是降饱和 + 分离色相——AI 出图常见"全局橙金滤镜"和"灰雾吞色",需要把白玉/云层/皮肤拉回中性,只让朱红与暖金保持高纯。这与第 8 章"减法审美"是同一件事。


13 合规:AI 标识是硬性要求

来源:抖音黑板报公告

平台能力(可识别、可提示、可追溯):AI 内容标识功能 + 元数据标识读写(可识别并写入,用于溯源)+ AI 内容检测模型矩阵。

平台会自己加标识的情况:核验/检测站内未主动标识的内容是否由 AI 生成,对疑似 AI 内容或元数据含 AI 标识的作品补充添加显式标识;通过抖音账号直接制作发布的 AI 内容,平台主动添加显式标识;所有 AI 内容同步添加/更新隐式标识。

风险:平台对故意规避 AI 标识、滥用 AI 内容开展主动治理,并排查历史投稿的"标识缺失、标识不规范、漏标识"。

落地建议:把"发布时勾选 AI 声明"写进 SOP。不要试图靠去元数据、二次转码规避。 另外注意:海外平台(YouTube/TikTok)同样要求 AI 内容披露,跨平台分发时两边都要声明。


14 上手路线(三档,按投入选)

档位 A:零基础验证(1 天,几十元)

  1. 装两个技能包(xianxia-visual-director + xianxia-cinematic-video-director)到豆包;
  2. 出图(Seedream 4.5)→ 挑最好的 1–2 张;
  3. 图生视频(Seedance 2.5),用 5.4 的三步法;
  4. 配 Suno 国风 BGM + 极简环境音;
  5. 剪映合成 9:16,发布并勾选 AI 声明。

目标:先跑通链路,看看自己脑子里的画面能不能做出来。

档位 B:稳定出片(1–2 周,日产 1 条)

  1. 建自己的提示词 Skill——把第 5 章天宫规则、第 6 章头面规则固化成清单(行者AI视频的做法:把规则写成 Skill,下次换题材只改主体和构图元素);
  2. 出图侧用 Midjourney/Seedream 批量抽卡,一次出 30–50 张挑 5 张;
  3. 视频侧严格锁首帧 + 小尺度运镜,单镜头 5 秒,一条 33 秒 = 6–7 个镜头;
  4. 物料拆包:人物主图 1 张 + 场景图 5–6 张;
  5. 按镜头类型分流模型 + 双 seed 取优,压返工率;
  6. 建立声音参考库与情绪声音库。

目标:把单条成本压到 50–100 元、返工率压到 20% 以下、做到日更。

档位 C:本地流水线(1 个月,硬件已就位)

  1. 先把底座修对:装 cu130 轮子(requirements.txt 必须先跑)、启动加 --disable-pinned-memory、SageAttention 只选 auto、打开 EasyCache(本卡 3.3× 提速);
  2. 图像侧本地化:FLUX.1 Krea dev fp8(992×1440/20 步 ≈53s)出关键帧;快速迭代用 Qwen-Image Q4_K_S 4 步版(≈21–23s/张);中文题字/换镜头用 Qwen-Image-Edit 2509 + BFS 换脸 LoRA(0.8);
  3. 按第 10.4 节的权重组合配 LoRA(风格 ≤0.8、材质/光照 ≤0.8、加速 0.6–0.8、颗粒 ≤0.5;超 4 个 LoRA 要串两级采样);
  4. 视频侧本地补位:纯场景/运镜走 Wan2.2 I2V 14B(496×720/97f ≈159s);要音频走已有 MiniMax H3(≈194s);长镜头草稿可用 LTX-2.5(1080p/4s ≈183s,带音频);
  5. 云端只留两个口子:复杂多人交互 + 1080p 商业终稿。

目标:图像成本归零,把省下的钱全部投给视频算力。

档位 D:出海(在档位 B 基础上加三步)

  1. 先建 Moodboard:MJ 跑 30–50 张仙宫图建风格板,固定 --sref --sw,确定"一个主色 + 一个点缀色"(例:月白 + 朱红鎏金);
  2. 换分发逻辑:Shorts 首要信号是 swipe-away rate,前 1–2 秒直接给最大景别,封面用最贵的那一帧,标题用提问式(What Chinese people imagine heaven looks like),话题带 #ChineseHeaven / #Chinamaxxing;
  3. 音画一体:把 audio block 直接写进视频提示词(Kling 3.0 Omni / Veo 3.1 / Hailuo 3 都支持),省掉配音环节——无台词无字幕反而是优势,跨国传播零损耗。

出海专属的一条纪律:不要把"角色一致性"当成仙宫题材的必做项。仙宫要的是空间一致性;只有做古风美人时才需要投入身份训练(Soul ID / 参考图包),而那会把成本推高 3–5 倍。


15 避坑清单(按血泪值排序)

#坑正确做法
1一上来就写"唯美震撼、电影感、高级感"五板块结构 + 把抽象词翻译成可量化视觉动作(8.2)
2跑大运镜(穿云、俯冲、环绕宫殿)慢推/轻移/缓慢抬升三选一;画面越大越要少动
3远景人物画太大远景压到 1%–4%(中景 5%–8%,近景 12%–20%)
3b用一个主运镜以外的第二、第三个运动指令一段只保留一个主运镜;"缓慢推进"必须是摄像机空间位移,禁止数码放大冒充
3c首尾帧用复杂运镜硬接首尾帧差异必须能由真实摄影机路径解释,否则改首帧或尾帧
3d给珠宝/珍珠题材照搬通用负面词plastic / glossy / shiny / reflective 会误伤珍珠高光,需按题材裁剪
4没锁首帧就直接写动作先锁首帧,再写"看得见的动作"
5把参考图当"参考人物"参考图只是风格与结构输入;人物一致性靠人景拆分 + 三视图
6发饰材质只写 gold / jade写工艺(filigree/granulation)+ 透感(translucent/inner glow)
7用 flat lighting / even lighting明确主光方向 + 金属镜面高光 + 玉石次表面散射
8用矩形缩略图替代人物抠像(换装)必须沿真实身体轮廓裁切的完整抠像
9短时长里同时堆复杂运镜和复杂换装二选一
10剧本写满微表情和高速武打改剧本避开;用镜头语言兜底
11提示词堆 40+ 个关键词控制在 15–25 个,过多分散注意力
12负向限制词写十几条选 3–5 个最相关的
13全部镜头用同一个模型死磕按镜头类型分流(特写/全景/运动)
14靠平台分成指望回本奇观流可打平;真钱在商单,把片子当作品集
15发布不勾 AI 声明硬性要求,且平台会追溯历史投稿
16还照着 Sora 的教程做Sora App/网页 2026-04-26 已关停、API 2026-09-24 下线;换 Seedance/可灵/Wan/MiniMax
17以为 Veo 4 已发布Veo 4 从未发布,官方仍是 Veo 3.1;Google 转向 Gemini Omni
18直接把"角色一致性"套到仙宫题材上烧钱仙宫吃空间一致性;角色一致性成本是它的 3–5 倍,别用错力气
19每条提醒词都从零写建 Moodboard 风格板 + 角色四联表,把一次成功变成可复用资产
20封面上放小字 / 开场黑屏封面用最贵的那一帧;前 2 秒直接给最大景别

16 附录索引

文件内容
速查卡.md一页纸速查:开工前必记的 5 个数、六步链路、四板斧、去 AI 味三招、成本速算、发布前 8 项检查
_parts/A-国内平台链路.md国内平台(即梦/可灵/海螺/Vidu/万相/混元/PixVerse/剪映/Liblib)链路与 10 条可抄中文提示词
_parts/B-国外链路.md国外链路(Midjourney/FLUX/Veo 3.1/Kling 3.0/Runway Gen-4.5/Seedance 2.5/Hailuo 3/Higgsfield)与 15 条英文提示词、完整价格表、3 个海外案例
_parts/C-本地ComfyUI复现方案.mdRTX 5060 Ti 16GB 本地 ComfyUI 完整复现方案
_parts/D-案例与核心技法.md标杆案例细读 + 仙宫/古风美女技法原始素材
_parts/E-成本合规与分发.md成本数据、算力排队现实、AI 标识合规、分发约束
_parts/F-变现与音画.md变现复盘、Suno 国风配乐、降返工率策略
_parts/G-提示词模板合集.md全部可直接抄用的提示词模板(含天宫规约完整示例与 14 项质量检查清单)

17 主要来源

案例与报道

技法

国外链路

市场与成本

音频与合规

下载此文件