调研时间:2026-09 | 调研方式:公开报道 + 创作者本人拆解 + 开源技能包 + 平台官方公告 所有关键数据均附来源链接;无法交叉印证的内容已标注"未证实"
这两类视频的核心结论(先看这五条):
两类题材的难度与打法差异:
| 仙宫 / 天宫 | 珠光宝气古风美女 | |
|---|---|---|
| 核心难点 | 建筑稳定(不融化、不变形)、云海动态、镜头幅度 | 人物一致(不换脸)、首饰质感(不塑料)、衣料物理 |
| 制胜关键 | 首帧锁死 + 小尺度运镜 + 构件写具体 | 形制词 + 材质词 + 光影 + 参考图 |
| 典型失败 | 动态 PPT 感 / 宫殿晃动 / 远景人物崩 | 义乌小商品塑料感 / 簪子插歪 / 手指畸形 |
| 成本档位 | 50–300 元/条(个人号);国外链路约 $3–4.5 | 约 3–5 倍于仙宫空镜(国外口径 $6–$15) |
2026 年 8 月,一条没有台词、没有字幕的 33 秒 AI 短视频从国内被搬运到海外平台,不到 4 天播放量突破 500 万,收获 4.8 万点赞、转发超 9700 次。画面内容是:白玉长廊延伸向云海深处,南天门巍峨耸立,仙鹤穿梭于层层叠叠的飞檐琼楼之间。
随后外交部发言人毛宁在个人账号转发了这条视频,配文"中式天堂长什么样"——等于给这波内容做了一次官方背书,热度持续了不止一周。
为什么是这两类题材:
#Chinamaxxing("极致中国化")在海外累计浏览量已破 40 亿次——这是一个现成的流量池,仙宫/汉服/古风美人内容可以直接蹭这个话题标签。这个案例的可复制点非常重要:"审美定位"比技术更重要——在同质化的 AI 美女赛道靠一套差异化审美(体态、色调、场景)建立辨识度;而静态轮播的算力成本几乎为零,是冷启动账号验证审美的极低成本做法。先验证审美,再投算力做视频。
来源:Kompas 教程、Kapwing Chinamaxxing trend、网易号报道
| 维度 | 事实 |
|---|---|
| 身份 | 1991 年生,成都眼镜店老板,非设计科班,"纯小白"自学 AI 近两年 |
| 工作流 | Midjourney 出图 → 可灵 / 即梦 转视频 |
| 爆款 | 33 秒无台词无字幕,海外 不到 4 天破 500 万播放 |
| 产量 | 抖音 50 万+ 粉丝、200+ 条作品、接近日更;单条 4–5 小时 |
| 成本 | 一般画质 50–60 元/条;4K 画质 100–300 元/条 |
| 变现 | 仅靠平台流量收益,收支基本打平;下一步计划做修仙向 AI 短剧 |
这个案例最大的信息量是"链路可以有多简单"。 他没有用复杂的 ComfyUI 工作流,没有自训 LoRA,没有多模型分流。他做对的是两件事:选题精准 + 日更坚持。
来源:红星新闻/搜狐
| 维度 | 事实 |
|---|---|
| 体量 | 81 集,单集平均 40 个镜头,上线 6 天播放破亿 |
| 团队 | 12 人(真人剧动辄几十人) |
| 周期 | 分镜 20 多天,整体约 30 天 |
| 成本 | 算力约 10 万元(真人剧同体量 30–100 万元)≈ 31 元/镜头 |
| 流程 | 剧本 → 分镜 → 角色设定 → 场景设定 → 文生图 → 图生视频 → 剪辑 → 配音 |
已知短板(这决定了所有 AI 仙侠内容的剧本边界):
补救体系:AI 生成 + 人工精准优化 + 专业指导三层;用镜头语言兜底(慢镜头突出情绪、特写聚焦眼睛/面部、BGM 与音效强化氛围);剧本层面主动避开 AI 做不到的表演。
这一节是给所有想做 AI 仙侠内容的人的最重要提醒:不要在文本阶段就写满微表情和高速武打,那是给自己挖坑。把镜头语言当"表演替身"。
这是公开资料里最实操的一份天宫拆解,方法论部分见第 5 章。来源:觉醒AI知识库转载
核心洞察一句话:"画面越大,建筑越复杂,能交给模型的运动就越少。"
| 排名 | 模型 | 开发者 | Elo | 距榜首 |
|---|---|---|---|---|
| 1 | Gemini Omni Flash | 1238 | — | |
| 2 | Wan 3.0 | Alibaba | 1237 | −1 |
| 3 | MiniMax H3 Max(fal 后训练) | Fal | 1235 | −3 |
| 4 | MiniMax H3 | MiniMax | 1227 | −11 |
| 5 | Dreamina Seedance 2.0 720p | ByteDance Seed | 1221 | −17 |
| — | (此处断层 60+ 分) | |||
| 6 | Wan2.7-260612 | Alibaba | 1157 | −81 |
| 7 | HappyHorse-1.1 | Alibaba-ATH | 1145 | −93 |
| 9 | Kling 3.0 1080p (Pro) | KlingAI | 1108 | −130 |
| 11 | SkyReels V4 | Skywork AI | 1103 | −135 |
| 13 | Veo 3.1 | 1092 | −146 | |
| 19 | Vidu Q3 Pro | Vidu | 1075 | −163 |
| 20 | PixVerse V6 | PixVerse | 1074 | −164 |
| 21 | grok-imagine-video | xAI | 1062 | −176 |
来源:BenchmarkList 收录的 Artificial Analysis 文生视频榜(榜单为"含音频视角"的盲测对比)
读榜要点:
OpenAI 已于 2026 年 3 月 25 日宣布关停 Sora:App/网页于 2026-04-26 关停,开发者 API 于 2026-09-24 下线。
来源:VentureBeat、澎湃/雷科技《Sora为何"暴毙"?》、封面新闻
关停数据与原因:
对做内容的人意味着什么:别再参考任何把 Sora 当首选的教程了。同时这也预示一个更大的趋势——视频生成的算力正在被 Agent 抢走,涨价和排队是长期趋势,不是短期波动。这与第 11 章"即梦一年三次调价""Seedance 2.0 首日排队 8–10 小时"完全同源。
| 工具 | 链路中的角色 | 关键评价 |
|---|---|---|
| 即梦 Dreamina(字节) | 主力出图 + 图生视频 + 首尾帧 + 智能参考转绘 | 中文语义强,AI 漫剧/玄幻题材首选;内置 Seedream(图)/Seedance(视频)、角色锁定、局部重绘、三视图模板 |
| 可灵 Kling(快手) | 图生视频、首尾帧、原生音频 | 镜头叙事感强、电影级画质,适合影视短片 |
| 海螺 AI / MiniMax | 人物表现、镜头生成、原生声音 | 常做镜头间过渡段;其官方 specular highlights 指南是"珠光宝气"最好的公开方法论(见 6.1.1) |
| Vidu(生数) | 多参考图生视频(多主体一致性) | 用于"图一中的女人立于空中,图二中的飞剑刺中她"这类多素材合成 |
| 通义万相 Wan(阿里) | 网页创作入口 + Model Studio API 双路径 | ⚠️ 网页版本名与 API model 字符串不能互相推断(如网页展示万相 3.0,国际区 API 文档仍以 Wan 2.7 为主) |
| 腾讯混元 | 图生视频 + 首尾帧 | 已开源图生视频模型,可自部署 |
| PixVerse(爱诗) | 社媒特效、模板、快速迭代 | 同质化风险最高——"模板越强,作品越容易出现相似构图" |
| 剪映 | 成片总装:拼接、卡点、智能字幕、BGM、调色 | 几乎所有教程的最后一步;"图文成片/智能画布"的细节未找到权威拆解(未证实) |
| Liblib 哩布 / 无界AI / 堆友 | 国风模型与 LoRA 社区 + 在线工作流,负责出图侧风格化与一致性 | 无界AI 有独立"2.5D 国风"模型,公开参数:DPM++ SDE Karras、9:16、CFG 7、精绘 1.5 倍强度 50%。堆友的链路位置未证实 |
两条被验证的实战组合:
Midjourney 出图 → 可灵/即梦 图生视频 → 剪映(栖光,最简)即梦3.0 出图 → 即梦/可灵首尾帧 → 海螺补图生视频 → Vidu 多参合成 → 剪映(多主体仙侠片)逐环节对应关系:
| 环节 | 主流选择 |
|---|---|
| 出图 | Seedream 4.5/5.0、Nano Banana Pro、Midjourney、即梦、Flux 系 |
| 图生视频 | Seedance 2.x、可灵 3.0 系、MiniMax H3 系、Wan 3.0 |
| 换装/卡点 | 即梦、可灵 + 换装技能规范(见 6.2) |
| 配音/BGM | TTS + Suno 国风 + ElevenLabs 音效(见第 12 章) |
| 放大/精修 | Topaz Video AI、ComfyUI 放大链 |
| 剪辑 | 剪映 |
⚠️ 必须先知道的两件事(截至 2026-09):
- Sora 2 已停服——App/网页 2026-04-26 关停,API 2026-09-24 下线。任何仍以 Sora 2 为主力的方案已过期。
- Veo 4 从未发布——2026 Google I/O 只发了 Gemini Omni;官方 Veo 系列仍是 Veo 3.1(1080p / 原生音频 / 8s 可续接)。
| 环节 | 国外实际主力 |
|---|---|
| 出图 | Midjourney V8.1/V8.2(alpha)、FLUX 3 / FLUX.1 Krea、Ideogram 4.0、Nano Banana Pro、Seedream 5.0、SDXL 生态(Pony/Illustrious/NoobAI) |
| 出视频 | Veo 3.1、Kling 3.0 / 3.0 Omni、Runway Gen-4.5、Seedance 2.5、Hailuo 3(MiniMax H3)、Grok Imagine Video 1.5、Higgsfield(聚合层) |
| 一致性 | Kling Elements、Runway Gen-4 References、Veo Flow Ingredients、Seedance 多参考(30 图)、Higgsfield Soul ID |
| 音频 | 模型原生音频(Kling 3.0 Omni / Veo 3.1 / Hailuo 3)、ElevenLabs、Suno v6 |
| 后期 | Topaz Video AI(2025-10 起改订阅制)、DaVinci Resolve |
| 分发 | 竖屏 9:16、8–15s、前 1–2 秒定生死 |
各视频模型在仙宫题材上的实际差异:
| 模型 | 单次时长 | 最强项 | 仙宫题材表现 |
|---|---|---|---|
| Veo 3.1 | 4/6/8s 可续接 | 原生音频 + 提示词遵循 + 4K 质感 + Ingredients 参考 | 云海/建筑质感最"贵",光很"电影";缺点是贵、单段短 |
| Kling 3.0 / 3.0 Omni | 3–15s 可续到 3 分钟 | 一次生成 6 镜头故事板 + 原生 4K 60fps + Omni Audio(对白/音效/配乐同帧生成)+ Elements 角色锁定 | 仙宫"巡游式多镜头"最强;多角色同场也能锁 |
| Runway Gen-4.5 | 2–10s | References(≤3 张)+ Motion Brush 逐区域控制 + Director Mode | 适合"先定角色板再动"的精修流程;纯空镜性价比一般 |
| Seedance 2.5 | 4–30s 任意整秒 | 首尾帧 + 最多 30 图/10 视频/10 音频参考 + 编辑式局部改 | 720p 上限,但长镜头一次成最省事;竖屏短剧首选 |
| Hailuo 3 / MiniMax H3 | 5–15s | 4K 原生 + 便宜($0.06/s @768p、$0.16/s @4K)+ 32kHz 立体声;H3-Base 已开源 | 仙宫大景"清晰又便宜";但该端点不吃关键帧/参考图 |
| Grok Imagine 1.5 | 1–15s | 极快、便宜($0.08/s @480p) | 用于快速试运镜与构图(草稿),成片仍需换模型 |
| Higgsfield | 聚合层 | Soul ID(20+ 张图训练持久身份)+ Cinema Studio 运镜 | 做"同一仙女跨几十条视频"最省事的商业化方案 |
Midjourney 古风调参四件套(可直接用):
--sref 锁整体画风;--sw(0–1000)古风场景建议 150–350,太高会把建筑细节糊成插画;--oref + --ow(0–1000)锁人物/器物,古风美人正式图建议 400–700:低于 200 脸会漂,高于 800 会僵化、姿态锁死;一致性方案的四套主流做法:
多镜头同一角色的实操纪律:把身份/服装/场景写在固定段,把动作/景别/机位写在变化段;每条镜头只用一个变化点(换机位就不换服装);逐镜头按"身份 / 服装道具 / 场景连续性 / 动作连续性"四维评分——耳环、发际线、手、眼珠颜色是最常崩的细节。
分发与算法偏好(国外):
Chinese Heaven / What Chinese people imagine heaven looks like / Xianxia in 4K;#ChineseHeaven、#Chinamaxxing、#BecomingChinese、#hanfu、#xianxia。2026 年 "Chinamaxxing" 在海外累计浏览量已破 40 亿次——这是个现成的流量池。国外单条成本折算(15 秒 5 镜头,含 4 次重试):
| 路线 | 单条成本 |
|---|---|
| 纯仙宫空镜(Kling 720p 无音频 + MJ 摊薄) | ≈ $3;加原生音频 ≈ $4.5 |
| 纯仙宫空镜(Hailuo 3 @768p) | ≈ $3.6(最便宜) |
| 古风美人路线(角色表 + 参考锁定,生成量翻倍) | $6–$15 |
| 古风美人 + Higgsfield Soul ID 锁脸 | $5–$12 |
⚠️ 成本口径提醒:不同来源的 Veo 3.1"每有效秒"差异极大($0.17 ~ $5.5/秒),差异来自是否计入重试、是否用 Vertex 计费、Resolution/音频档位混算。报价前务必用「有效秒 × 重试系数」自算,不要直接引用博客的单秒数字。 另注意:Kling 订阅 credits 不滚存、失败任务仍扣(API 侧失败不扣)。
不管国内还是国外、个人还是团队,能跑通的链路都可以归到这六步:
① 创意/选题 → ② 关键帧出图 → ③ 图生视频(锁首帧 + 小运镜)
↓ ↓
④ 一致性处理 ⑤ 音频(配音/BGM/音效)
↓ ↓
⑥ 放大精修 + 剪辑 → 发布(含 AI 标识声明)
每一步的核心原则:
| 步骤 | 原则 | 典型翻车 |
|---|---|---|
| ① 选题 | 视觉母题必须一句话说清("云海白玉长廊通向天门") | 选题模糊 → 提示词只能"许愿" |
| ② 出图 | 图片是视频的结构母图;先构图 → 再空间层次 → 再镜头位置 → 最后主次 | 一上来就写氛围词,AI 停在"图像渲染" |
| ③ 视频 | 锁首帧 + 只写看得见的动作 + 小尺度运镜 | 镜头幅度大 → 建筑融化、人物换脸 |
| ④ 一致性 | 人景拆分(人物三视图单独做)+ 物料拆包(人物图 / 场景图分开) | 把参考图当"参考人物",其实只是风格与结构输入 |
| ⑤ 音频 | 声音克制,画面才显得大 | 堆 BGM 和音效 → 廉价感 |
| ⑥ 后期 | 放大 + 调色数据化(Hex 色板)+ 剪词 | 过度磨皮、过度锐化 = AI 味 |
来源:行者AI视频拆解(同 2.3)+ gjgagvg/tiangong-image-prompt-generator(目前最系统的公开"仙宫提示词规约",已逐条核实)
这是整个仙宫题材最重要的一组数字。人物占画面高度比按景别分级:
| 景别 | 人物占画面高度 |
|---|---|
| 远景 | 1%–4% |
| 中景 | 5%–8% |
| 近景 | 12%–20% |
除非明确要求,人物不抢占建筑主体。 同时必须至少保留两级尺度参照(人物、仙鹤、灯火、栏杆、门洞、云层、远山任选)。以遮挡、透视收缩、空气透视和重复结构表达体量,不只依赖"巨大、宏伟"这类形容词。
常见错误:门窗与人物比例冲突;远近物体同等清晰;重复柱网失真;无承重逻辑的结构。
配色公式:白玉 + 冷青灰打底,暖金光只照重点,加一点朱红压细节。
构图量化配方(实测输出):一点透视柱廊引导视线延伸;右侧留 40%–60% 云海呼吸空间;暖金色晨光斜射;红衣人物立在画面约 3% 位置作为视觉锚点。
把一张静图拆成:时间轴 / 镜头 / 人物动作 / 环境动态 / 连续性约束。
工程关键:物料拆包。 用 7 张图:1 张人物主图(锁脸/发型/衣服)+ 6 张场景图(白玉广场、云阶、月门、云桥、云廊、茶席)。"人物归人物,地点归地点"——生成时不用每到一处重新猜。
60 秒 Vlog 选 3 个片段,每段给秒级区间 + 明确动作,让人物把镜头带到下一个地方(穿过月门、纱幔掠过镜头)。
| 材质 | 要写的 | 要避免的 |
|---|---|---|
| 白玉 | 温润、微透光、细微矿物纹理、边缘磨损 | 塑料感、均匀自发光 |
| 木构 | 可见古木纹理、榫卯关系、朱红漆面与岁月痕迹 | 光滑玩具质感 |
| 琉璃瓦 | 沿曲面反射天光,粗糙度有变化 | 镜面金属屋顶 |
| 金属 | 只用于节点和礼器,氧化/拉丝/锤纹,不大面积铺金 | 满铺金饰、廉价"国潮"贴图 |
| 云雾 | 有密度梯度、受光面和阴影面 | 棉花状重复纹理 |
| 水体 | 反射、波纹、折射、表面张力,与重力方向一致 | 完整镜像、镜面水 |
| 废墟 | 断口、灰尘、苔痕与结构受力相互吻合 | 随机裂纹贴图 |
构图三层:前景框架 / 中景叙事主体 / 远景世界延伸。 每幅最多一个主奇观 + 两个辅助奇观(这是"画面不堆砌"的硬约束)。 仪式场景优先对称与中轴;探索场景优先偏心、遮挡、负空间;危机场景用斜线、断裂、逆向动势。 画面要能一眼回答:人物在哪里、要去哪里、世界有多大、此刻发生什么。
做天宫系列号最怕"每条都一样"。这套九组策略保证世界观和角色连续,同时让叙事、空间、镜头、时段或动态中至少两项显著不同:
| # | 策略 | 要点 |
|---|---|---|
| 1 | 天门初见|建立世界 | 超远景/越肩;人物首次抵达巨型天门;门框套景、云海、尺度震撼 |
| 2 | 中轴朝圣|秩序仪式 | 正面对称、低机位、长玉阶;少量仪仗沿中轴前行 |
| 3 | 云廊漫游|空间纵深 | 侧向长廊、重复柱网、消失点;平视跟拍或缓慢横移 |
| 4 | 月宫静夜|诗性孤寂 | 冷色夜景、巨月、白玉平台;单人小比例;负空间与静止感 |
| 5 | 星河祭坛|宇宙神圣 | 高台/俯瞰,天河环绕;圆形秩序、星轨、可读光源 |
| 6 | 浮城全貌|体系规模 | 极高机位/航拍推进;多层宫群与悬桥构成城市体系 |
| 7 | 云瀑奇境|自然共生 | 垂直构图;宫殿嵌入神山,云瀑穿越桥下 |
| 8 | 战争遗迹|历史创伤 | 破碎天桥、倾塌殿宇、熄灭宫灯;偏心构图与逆光 |
| 9 | 神迹降临|叙事高潮 | 光柱/天门开启/神兽掠过,只保留一个核心神迹 |
连续九镜的叙事映射:建立世界 → 抵达 → 深入 → 发现 → 仪式 → 全貌 → 异变 → 遗迹真相 → 神迹高潮。
| 平台 | 写法要点 |
|---|---|
| Midjourney | 紧凑自然语言,顺序:主体→环境→构图→光线→材质→风格;--ar 指定画幅;无独立负面栏时用 --no 放少量明确对象 |
| Flux | 完整描述句,明确空间关系、材质、光源;避免大量逗号标签与互相矛盾的风格词;把限制写成可观察的正向约束 |
| SDXL | 正负分离;按主体/环境/摄影/质量组织;写实模型要减少引擎名和冲突的艺术家风格词 |
| 即梦 | 清晰中文:主体、景别、动作、环境、光影、画幅、风格;视频任务补镜头运动、主体运动、环境运动与稳定性限制 |
| 可灵 | 按"首帧场景—主体动作—镜头运动—环境响应—结尾状态"描述视频;控制单镜头动作数量,写清速度/方向/幅度/前后景视差 |
| Runway | 只写视觉可见、可拍摄的运动;区分镜头运动与主体运动;多写"如何移动",少写抽象审美标签 |
| AI 漫剧分镜 | 每镜输出:镜号、时长、景别、画面、角色动作、台词、音效、转场、连续性锚点;相邻镜头遵守视线/运动方向/轴线连续;每镜只承载一个主要叙事动作 |
来源:Runway Gen-4 官方指南 + AI漫剧提示词写法
首尾帧衔接的判据(这条很关键): 首尾帧差异必须能由真实摄影机路径解释——先判断摄像机能否从首帧位置物理到达尾帧位置、两者是否同侧轴线、门/墙/道路内外关系是否一致。不能解释时应改首帧或尾帧,而不是用复杂运镜硬接。 最常见的续接方式是直接导出上一镜尾帧当下一镜首帧。
两个开源技能包,装上就是"视觉导演 + 运镜导演":
三步复刻法(来源:数艺社实测):
同类可参考的还有 joshesye/design-xianxia-celestial-shots(生图)与 joshesye/design-seedance-celestial-motion(运镜)。
⚠️ 可信度提示:
liyue-aigc/xianxia-visual-director与xianxia-cinematic-video-director两个仓库的 SKILL.md 在实测中返回 404,其内部规则未能直接核实("安装即用"的效果描述来自第三方测评)。已逐条核实、可直接使用的是 gjgagvg/tiangong-image-prompt-generator——本报告第 5 章的尺度分级、九组策略、材质规则、分平台写法、质量检查清单均取自该规约。建议优先用它。
第一板斧——形制写准。 只写 "hairpin" / "hair accessory",形态全凭运气:
| 形制 | 正确写法 |
|---|---|
| 簪(单股) | zan, single-prong hairpin |
| 钗(双股) | chai, double-prong hairpin |
| 步摇(带坠流苏会动) | buyao, hairpin with dangling pendants that sway |
| 钿(花形片状) | dian, floral inlaid hair ornament |
新手建议从步摇入手:流苏坠子辨识度高,AI 容错率大。
第二板斧——材质写出工艺和透感(塑料感的根子在材质词太笼统)。见第 7 章模板。
第三板斧——光影让发饰立体。 soft directional light from upper left, specular highlights on metal edges, subsurface scattering on jade, gentle shadow under ornaments 绝对不要写 flat lighting / even lighting——那种光下发饰必扁。背景要压暗(深褐或墨绿)才衬得出高光。
第四板斧——朝代锁调性。 唐华丽 / 宋清雅 / 明繁复 / 清点翠(关键词见第 7 章)。
两条硬数据:
局部修复优先于整张重来:发饰"长歪"(簪子插到耳朵上面、步摇垂到肩膀外)用局部重绘框住发饰区域单独修。
来源:Hailuo AI《Prompting Specular Highlights for Luxury》(2026-07-27)——目前"珠光宝气"质感最权威的公开方法论。
| 关键词 | 作用 |
|---|---|
anisotropic highlights | 各向异性高光——拉丝金属的关键 |
specular roll-off | 高光滚降(高光到暗部的过渡) |
warm metallic luster | 暖金属光泽 |
internal refractions | 内部折射(宝石/玉石) |
caustics | 焦散(光线透过宝石投下的光斑) |
prismatic glints | 棱面闪彩(火彩) |
Fresnel effect | 菲涅尔效应(掠射角反射增强) |
iridescent overtone | 虹彩泛色(珍珠) |
三条反直觉的核心原则:
soft glow 搭配 specular,比单写 extremely shiny 更物理可信。 "极致闪亮"会导致高光溢出、细节被吃掉。珍珠的四层光学写法(来源:FlowPix《AI珍珠首饰绘画》):
珍珠 = ① body color(底色,暖奶油白带象牙底)
+ ② 表面虹彩晕彩(soft pink → pale green,边缘掠射光处最明显)
+ ③ 镜面高光(柔和扩散光斑,而非锐利白点——"像一片月光而不是激光点")
+ ④ 内部微弱内发光(光被封在层叠半透明结构里)
必须分层描述。正面直射光会压掉晕彩;CFG 建议 5–7。 反面教训:只写 pearl necklace on a black velvet background 会得到"乒乓球串";负面词若包含 plastic / glossy / shiny / reflective,会把珍珠高光一并压低——这是很多人生搬硬套负面词反而翻车的原因。
⚠️ "人物 + 首饰"同时生成会牺牲首饰精度:必须用 Inpaint 单独重绘首饰区域,或干脆分开出图再合成。
来源:刺猬星球/FlowPix(2026-06-17)
来源:liyue-aigc/female-outfit-director
| 项目 | 规范 |
|---|---|
| 画幅/时长 | 9:16,8 秒 = 初始造型 + 4 次换装 |
| 卡点 | 1.25s / 2.95s / 4.40s / 6.55s(最后一段必须留最终造型展示时间) |
| 机位 | 固定高位俯拍(前上方,向下 30–35°),全程不推拉摇移变焦 |
| 换装机制 | 汉服大袖/披帛 → 袖摆遮镜;古风贵女 → 团扇/折扇遮挡;东方幻想/神女 → 披帛、花瓣、云纹、水墨 |
| 首帧版式 | 中央主体占画面宽 60%–65%,四周 4 个小人物(同一角色,白色虚线轮廓抠像) |
| 硬性约束 | 同一张脸、同一成年年龄感、同一族裔外观、同一肤色、同发型发色、同头饰耳饰、同身材比例;只改变穿搭,不重做人物 |
| 衣料物理 | 自然重力、转身轻微惯性延迟、停止后逐渐回落;不僵硬漂浮、不穿模、不粘连身体 |
最容易被忽略、也最重要的两条:
见第 7 章 G4 模板。值得单独强调的是它的分工:首帧锁定 → 人物表情动作 → 台词 → 镜头 → 氛围光线 → 约束。 仙宫类只需把"台词"段换成"环境动态"、把"人物"段缩到最小——结构完全通用。
完整可抄的模板(仙宫中文/英文、古风美女中文/英文、头面特写、朝代切换、换装规范、负面词速查)见附录: → _parts/G-提示词模板合集.md
来源:shyman159/seedance-prompts-skill · prompt-craft-and-realism.md(由抖音"刺猬星球superi"37 集合集蒸馏)
核心理念:AI 图/视频"一眼假"的根因不是模型弱、也不是提示词不够长,而是你在"许愿"而不是用视觉语言下指令。
情绪 + 主体 + 光线 + 镜头 + 细节
| 你想说的 | 要写的 |
|---|---|
| 梦幻 | 低饱和 + 软光源 + 长焦压缩 |
| 高级 | 强光线对比 + 部分留白 |
| 质感 | 微弱侧光 + 高阴影对比 |
并直接告诉 AI 不要什么:无纹理、无锐化。
去摆拍感,摆拍感来自镜头与画面关系不真实,与提示词无关,三因三解:
| 病因 | 解法 |
|---|---|
| 取景起点完成度过高 | 让画面从不完整视角开始(前景遮挡/构图偏移),再用运镜去"找"画面 |
| 运动轨迹过度平滑 | 引入减速/停顿等人为操作痕迹 |
| 主体动作与镜头完全同步 | 让人物动作早于镜头反应,制造"被进入的瞬间" |
前景遮挡去 AI 味:物理遮挡(树叶/柱子/人物背影 + 低角度 + 前景虚化;注意 AI 遵循顺序机制,不写"虚化"它会把前景画清楚而失去景深)+ 氛围遮挡(空气里有雪花/雾气/颗粒感)。
电影感 = 摄影约束先于美学:先写镜头类型/拍摄距离/光线结构,再写风格。90% 的人上来就写氛围,AI 只停在"图像渲染"而非"真实摄影"。
剪词(让画面显贵):
AI 眼里动词是"目标状态"不是"进行态"。
来源:器灵科技《Seedance出的片总觉得"怪怪的"?可能是少了这三步》(2026-07-16)
第一步:拉反差
第二步:锐化但别狠
第三步:三个藏味细节(这才是拉开差距的地方)
作者的总结很到位:"不是参数,是你愿不愿意多花半小时。"
| 问题 | 处理 |
|---|---|
| 手指 | 提示词末尾加 perfect hands, detailed fingers, five fingers, anatomically correct;配合手部修复/OpenPose 固定骨骼;仍崩就裁掉手部用局部重绘 |
| 脸 | 面部关键词权重 1.3–1.4,CFG 降到 5–6,步数提到 30 以上;"脸崩多半是过度优化或权重打架" |
| 权重纪律 | 1.1–1.3 最稳妥;超过 1.5 会让发丝变钢丝、眼睛高光变成大白点 |
通用负面词:
low quality, blurry, pixelated, noise, text, subtitles, watermark, logo,
deformed, bad anatomy, extra limbs, extra fingers, oversaturated, overexposed
人像另加:bad face, asymmetrical eyes, weird teeth
⚠️ 但注意 6.1.1 的反面教训:做珠宝/珍珠题材时,plastic / glossy / shiny / reflective 这几个词会误伤材质表现,需按题材裁剪负面词,不要机械照搬。
来源:同 8;以及 2018 年前的经典做法 + 当前技能规范
一句反直觉但极关键的结论:
参考图不是"参考人物",只是风格与结构输入。
三招保一致性:
物料层面:远景/中景用"人物主图 + 分场景图"拆包;特写/近景人脸崩时用 FaceRefine 类修复后处理。
来源:火星时代《AI短剧角色一致性的7种方案》(2026-08-11)
有文章称 76% 的 AI 短剧创作者把"镜头一切就换人"列为第一大痛点。七条路径:
| # | 路径 | 门槛 / 效果 |
|---|---|---|
| 1 | 图生视频 + 参考图驱动(先出定妆照,后续只写动作) | 最低;但侧面/远景匹配度约 55% |
| 2 | 角色卡片 + 外貌锚点(固定文字段每镜原样粘贴) | 低;对提示词纪律要求极高 |
| 3 | 固定 seed | 低;同场景有效,跨场景仍漂移 |
| 4 | AI 换脸后期(ReActor / InstantID) | 中;救急用 |
| 5 | LoRA 训练(20–50 张多角度,rank 32–64,strength 0.7–1.0) | 高;每角色 5–8 小时 |
| 6 | ComfyUI IP-Adapter FaceID + LoRA + ControlNet 三重锁定 | 最高天花板;需 12GB+ 显存 |
| 7 | 全流程角色引擎(项目级角色档案,跨集引用) | 团队级 |
四个低成本辅助技巧:服装锚点法、快速剪辑法(每镜 2–4 秒,观众来不及看脸)、统一调色法、剪辑过渡法。
核心纪律:先把角色锁定,再开拍。
外貌锚点串的写法(每一镜原样粘贴,不要改写):
角色C01:25岁亚洲女性,鹅蛋脸,杏仁眼,右眼下方浅色小痣,
黑色齐肩直发,三七侧分,银色圆形耳环。
纪律原话:"不要把'齐肩直发'改成'中长发',不要交替使用'清秀''妩媚'等主观词——每个词都会导致模型重新推断面部。"
声音一致性(AI 视频最易露馅的是声音):建角色声音参考库(把满意片段的音频抽出来存独立文件,每次生成上传作参考)+ 独立配音模型锁定音色 + 情绪声音库(同一角色"正常/愤怒/伤心"样本按剧情选用)。
完整方案(量化档位、50+ 个可验证的 Civitai 资源、三套节点级工作流、显存与耗时表)见附录: → _parts/C-本地ComfyUI复现方案.md
出图:
| 模型 | 配置 | 耗时 |
|---|---|---|
| FLUX.1 Krea dev | fp8_e4m3fn 或 GGUF Q8,992×1440 / 20 步 | ≈53 秒(冷启含加载 121.7s) |
| FLUX.1 Krea dev | + DyPE,1440×2560 | ≈94 秒 |
| Qwen-Image | Q4_K_S(12.14GB),Lightning 4 步,1080×1360 | ≈21~23 秒 |
| FLUX.2 dev | fp8 33GB(需 83GB 总内存)/ GGUF Q5 992×1440 | >4 分钟 → ❌ 本机不实用 |
结论:写实古风首选 FLUX.1 Krea dev;中文提示词、画面内题字、换镜头首选 Qwen-Image(4 步版)——同样时间里 Qwen-Image 能出 5~8 张。FLUX.2 dev 明确不推荐(官方 fp8 20.43GB 的 Qwen-Image 同样必 OOM,必须走 GGUF Q4_K_S)。
视频(这是最硬的一组数据):
| 模型 | 分辨率 / 帧 | 耗时 |
|---|---|---|
| Wan2.2 I2V 14B(High Q8 + Low Q6 + BlockSwap + Sage + TorchPatch) | 496×720 / 81f | 冷启 222.8s → 热启 133.2s |
| 同上 | 496×720 / 97f | 158.6s |
| HunyuanVideo 1.5(720p i2v cfg-distilled fp8) | 496×720 / 97f | 198.0s(慢些但更省显存、物理更真) |
| LTX-2.5 22B(Q3_K_M GGUF,10.73GB) | 1920×1088 / 97f | 183.1s,峰值 14.1–15.5GB,带同步音频 |
| MiniMax H3(已有) | 864×480 / 5.17s / 20 步 + EasyCache | 194s;无 EasyCache 是 633s |
ComfyUI 原生 EasyCache 在 H3 上把 633s → 194s(3.3×),在 FLUX.2 GGUF 上把 20 步 181s → 91s。同一张 5060 Ti 的两篇公开实测差异全部来自它。 开它比换模型更有效。
| 坑 | 现象 | 处理 |
|---|---|---|
| PyTorch CUDA 版本 | 低于 cu128 的轮子无 sm_120 kernel → no kernel image is available | 必须装 cu130(或 cu128)轮子 |
| requirements 顺序 | torch 未 pin,在装完 CUDA13 栈后再跑 requirements.txt 会静默覆盖回默认源、失去加速 | 顺序固定:requirements.txt 先,CUDA 13 栈最后装;启动日志必须看到 +cu130 与 comfy-kitchen CUDA backend available: True |
| Triton / SageAttention | sm_120 的 triton 支持滞后 | 不强求 triton;SageAttention 走源码编译(--no-build-isolation 必须,否则 pip 会拉第二份 torch)。sm_120 上所有显式模式都崩,只留 auto |
| 32GB 内存 + pinned memory | H3 这类大模型被 OOM-killer 杀 | 启动加 --disable-pinned-memory(实测:默认 29,866MB 被杀 → 7,508MB 跑通) |
ComfyUI 版本地板:MiniMax H3 核心节点自 v0.30.0,LTX-2.5 自 v0.32.0,Krea 2 自 0.25.0。建议直接跟 master。
关键发现:汉服、仙侠、古建类 LoRA 绝大多数是 SD1.5 / SDXL / Illustrious 底模,Flux 侧资源较少,需要靠"通用古风 LoRA + 光影 LoRA + 提示词"补。
可直接检索到的资源(均经 Civitai API 逐条验证,下载量附后):
| 类别 | 代表条目 | 底模 / 下载量 |
|---|---|---|
| 仙侠风格 | 仙侠道/xianxia/taoist/法天象地 | SD1.5 / 5,099 |
PAseer 的仙侠之境 | SD1.5 / 6,613 | |
xianxia | Flux.1 D / 304 | |
ChineseXianxiaStyle | LTXV 2.3 / 447 ← 可直接进视频侧 | |
| 国风底模 | 国风3 GuoFeng3 | SD1.5 / 160,805 |
国风4 GuoFeng4 XL | SDXL / 27,357 | |
| 汉服 | hanfu 汉服 | SD1.5 / 106,378 |
汉服合集 [Flux.1] Hanfu Collection [Female] | Flux.1 D / 4,867 | |
hanfu tang / song / ming | SD1.5 | |
| 古建 | Ancient Chinese architectural style | SD1.5 / 11,191 |
| 珠宝 | jewelry Slider | Pony / 4,105 |
GemstoneAI - konyconi | SD1.5 / 9,081 | |
| 打光 | Backlight (Hair light) cinematic lighting | Flux.1 D + SDXL / 3,901 ← 轮廓光/发丝光 |
Cinematic "Warm Light" 3200k | 多底模 / 12,361 | |
Cinematic Volumetric (God Rays) | 多底模 / 6,233 | |
| 降 AI 味 | NL2 | film grain & chromatic aberration | Illustrious |
FilmGrain.Redmond | 多底模 |
「云海」没有专门的 LoRA——Civitai 无有效结果,走提示词 + 体积光 LoRA:
sea of clouds, cloud ocean, aerial view above clouds, volumetric god rays, mist, atmospheric perspective, ethereal⚠️ Civitai 官方域名在本网被 DNS 污染,实际下载走
civitai.red镜像(API key 见~/Downloads/civitai_api_key.txt)。LiblibAI 站点可达但搜索 API 返回 500,需手工站内搜。
推荐权重组合(Flux Krea dev 基准):
古风底味: 风格 LoRA (xianxia/古风) 0.5 ~ 0.7
服装: 汉服 Collection [Flux.1] 0.7 ~ 0.9
配饰: Jewelry Gemstone Pearl Diamond 0.6 ~ 0.8
打光: Backlight (Hair light) 0.6 ~ 0.8 ← 轮廓光/发丝光
Cinematic Warm Light 3200k 0.5 ~ 0.7
氛围: Volumetric God Rays 0.4 ~ 0.6
质感: film grain & chromatic aberration 0.3 ~ 0.5 ← 最后加
加速: Flux Lightning 8step 0.6 ~ 0.8
换脸: BFS 换脸 LoRA 0.8 (1.0 会出画面问题)
经验规则:风格类 ≤0.8、材质/光照类 ≤0.8、加速类 0.6~0.8、颗粒类 ≤0.5。 总 LoRA 数超过 4 个时 Flux 会掉细节 → 串成两级采样(第一级只放风格+服装,第二级只放打光+颗粒)。
| 方案 | 16GB 可行性 | 用途 |
|---|---|---|
| 三视图 + ref2v(已有 H3 工作流) | ✅ 已在用 | 最强的身份锚定;配 h3-turnaround-autoprep 技能先裁出正面图 |
| Qwen-Image-Edit 2509 + BFS 换脸 LoRA(0.8) | ✅ 4 步加速后 20~35s/张 | 把已定妆的脸批量贴到不同镜头/角度(v1 保脸型、v2 换整头) |
| PuLID for FLUX | ✅(约 +2~3GB) | 单张参考图锁脸,比 InstantID 轻 |
| FLUX Redux | ✅ | 保风格/构图/服装,不保脸;权重 0.4~0.6 |
| FLUX.1 Kontext dev | ✅ | 指令式编辑:"同一个人换到侧脸/换背景" |
| InstantID / IP-Adapter FaceID | ⚠️ 需 insightface,Py3.13 编译常失败 | SDXL 老工作流 |
跨镜头配方:① 出定妆照锁 seed → ② Qwen-Image-Edit 2509 + BFS(0.8) 生成 3~5 个角度 → ③ 每镜头 参考图 + 服装 LoRA 0.8 + 打光 LoRA 0.7 + Redux 0.5 → ④ 视频阶段统一用同一参考图走 Wan2.2 I2V 或 H3 ref2v。
⚠️ 注意:LTX-2.5 上身份漂移与分辨率绑死——640×320 会明显漂,768×448 以上才稳。
单条 5 秒 720p 成品本地链路:关键帧 60s + 放大 30s + I2V 150s ≈ 4 分钟/条;一天 8 小时名义可出 100~120 条,含试错打 5~8 折 → 实际 15~30 条可用。电费不到 1 分钱/条。
云价对照(2026 公开价):Kling 2.1 Standard $0.07/5s、Pro $0.28/5s、Seedance 2.0 $0.30、Veo3 $0.50。
⚠️ 但云价的真实成本要乘 2.5× 以上:失败率 10~15% + 平均需 2~3 次迭代,行业实测"一条能用的 AI 视频,实际成本是标价的 5~20 倍"。
| 环节 | 放哪 | 理由 |
|---|---|---|
| 概念探索、构图、风格试错 | 本地 | 秒级反馈,零边际成本 |
| 古风 LoRA 调权重、打光试错 | 本地 | 需要几十次快速迭代 |
| 关键帧定稿 + 放大 | 本地 | 2K 出图本地已够用 |
| 人物一致性镜头(同一人多角度) | 本地 | 云端无对应开源级控脸能力 |
| 纯场景/运镜镜头(仙宫航拍、云海) | 本地 Wan2.2 / LTX-2.5 | 130~200s/条可接受 |
| 带对白/音效的镜头 | 本地 MiniMax H3(已有) | 唯一本地同步音频方案 |
| 复杂多人交互、需 1080p 物理正确 | 上云 Kling Pro / Veo3 | 本地 16GB 做不到稳定 |
| 商业终稿、客户交付素材 | 上云 | 质量与一致性上限更高 |
一句话策略:本地承担 80% 的迭代 + 所有关键帧 + 所有身份一致性工作;云端只买"复杂动作 + 1080p 终稿"这两个本地做不到的能力。
与本机已有 H3 工作的分工建议:H3 出"有人物 + 要说话/有音效"的镜头,Wan2.2 出纯场景/运镜镜头。
栖光口径(个人号):一般画质 50–60 元/条,4K 100–300 元/条。
即梦价目表口径(蓝鲸财经/东方财富 + 娱乐资本论/澎湃,2026-04-10)
| 档位 | 年费(原价) | 首充优惠 | 月积分变化 |
|---|---|---|---|
| 基础 | 659 元/年 | 5 折 → 6 折 | 1080 → 725 |
| 标准 | 1899 元/年 | 5 折 → 6 折 | 4000 → 2210(砍半) |
| 高级 | 5199 元/年 | 5 折 → 6 折 | 15000 → 6160(另一来源记为 5870) |
两个来源的价格看起来不同(329/949/2599 vs 659/1899/5199),实际是首充五折价 vs 原价的关系:659×0.5≈329、5199×0.5≈2599。改六折后即 395/1139/3119,每档每年多交约 500 元。
可灵价目表口径(Modellix 引官方页,2026-08-14)
| 档位 | 首月 / 续费 | Credits |
|---|---|---|
| Standard | $6.99 / $8.80 | 660 |
| Pro | $25.99 / $32.56 | 3000 |
| Premier | $64.99 / $80.96 | 8000 |
| Ultra | $127.99 / $159.99 | 26000 |
免费 66 credits/天、24 小时过期。VIDEO 3.0 每秒消耗:720p 无音频 6 / 1080p 无音频 8 / 1080p 原生音频 12 / 4K 30 credits。
(国内"黑金连续包月 169 元/月"来自第三方测评文,未证实。)
工业化口径:《斩仙台》算力约 10 万元 / 约 3240 个镜头 ≈ 31 元/镜头。
总成本 ≈ 单位成本 × 镜头数 × (1 + 返工率)
返工率的实际差距(器灵科技复盘):
按镜头类型分流模型的策略:
特写 / 近景 → 面部保持最好的模型(保证角色不出戏)
全景 / 场景 → 场景还原度高的模型(保证氛围)
运动镜头 → 动态流畅的模型(保证过渡自然)
标价单秒数字不能直接用来报价:
这条与 C 部分的本地电费对照(4 分钟/条,电费不到 1 分钱)结合起来,就是"本地做迭代、云端买终稿"这个策略的全部理由。
| 平台 | 模式 | 实际收入参考 |
|---|---|---|
| 抖音 | 中视频计划 + 广告分成 | 10 万播放 ≈ 30–80 元;百万播放 ≈ 300–800 元 |
| 红果短剧 | 独家签约或播放分成 | 相对稳定,但对更新频率与剧集质量要求高 |
| 快手 | 光合计划 + 流量分成 | 新手扶持期后播放量断崖式下降很常见 |
两个残酷数字:
但这与栖光"靠流量收益基本打平"并不矛盾:奇观流(33 秒无台词)的完播率天然高于剧情流,且他有日更 + 50 万粉的规模效应。个人号做奇观流可以打平;做剧情流靠分成必亏。
真正赚钱的是商单:新人单条定制 500–2000 元,有粉丝基础可报 3000–8000 元。真实项目:一条净亏 95 元的短剧,因被品牌看中做 3 条定制 @1500 元,进账 4500 元。
值得试的方向:品牌剧情类短剧 / 悬疑恐怖科幻垂类(观众对画面真实感要求低、对创意氛围要求高;有账号做到 90 秒内、前 5 秒抛钩子,完播率稳定 45%+)/ 素材批量销售。
天宫类视频普遍采用极简声音设计:高空风声 + 轻微衣袂声 + 远处鹤唳 + 编钟余韵。行者AI视频的 5 秒提示词里明确写了"环境声以高空风声和轻微衣袂声为主"。
黄金三角结构:
主旋律乐器(1件)+ 和声/衬托乐器(1件)+ 打击/节奏乐器(1件)
例:古筝(主旋律)+ 洞箫(衬托)+ 大鼓(节奏)
仙宫/天庭直接可用:
Chinese court music, pentatonic scale, pipa and yangqin and small drum, elegant, bpm-88,
refined ornamentation, silk and bamboo ensemble, palace hall with lanterns, instrumental
苍凉空镜可用:
Chinese folk, pentatonic scale, xiao and guqin, desolate, bpm-65, slow and sparse,
wind effect, horse bell in distance, desert outpost atmosphere, instrumental
搭配逻辑:情绪相近、音色互补(古琴+洞箫 = 一弦一气;琵琶武曲+大鼓 = 一旋律一节奏)。情绪相悖要慎重(洞箫+唢呐、古琴+快速打击乐、葫芦丝+编钟)。
⚠️ 已知坑:Suno 生成古风音乐容易带电子味,需加抑制词。
| 工具 | 价格 | 关键限制 |
|---|---|---|
| Suno v6(2026-09-11 发布) | 免费档 v6-mini;Pro $8/月;Premier $24/月 | 首个用正版授权音乐训练的版本(华纳、BMG、Believe/TuneCore),支持段落级编辑与混音;⚠️ 索尼、环球版权诉讼仍在进行,授权尚未全覆盖 |
| ElevenLabs | Starter $5/月(有商用权 + 即时克隆)、Creator $22(专业克隆、192kbps)、Pro $99、Scale $330、Business $1,320 | Free 档无商用权——做付费内容至少 Starter |
| Topaz Video AI | 2025-10 起订阅制:Personal $299/年、Pro $699/年 | 价格来自竞品博客,建议官网复核;典型链:Starlight/Astra 生成式放大 → Proteus 细修 → Apollo/RIFE 补帧 → 稳定 |
high-altitude wind, distant bronze bell, crane calls, waterfall,
temple chime, fabric rustle, stone footsteps
Suno 国风关键词串:
guqin, guzheng, dizi bamboo flute, pipa, bianzhong bronze bells,
pentatonic, guofeng, cinematic Chinese fantasy score, sparse, 60 BPM, no vocals
"中式天庭"类爆款的共同点是:无台词、无字幕,只靠画面 + 环境音。 这恰恰规避了 AI 口型与配音的短板,也让它无需翻译即可跨国传播。
国外团队在 DaVinci 里调 AI 生成的仙宫片时的重点不是加饱和,而是降饱和 + 分离色相——AI 出图常见"全局橙金滤镜"和"灰雾吞色",需要把白玉/云层/皮肤拉回中性,只让朱红与暖金保持高纯。这与第 8 章"减法审美"是同一件事。
来源:抖音黑板报公告
平台能力(可识别、可提示、可追溯):AI 内容标识功能 + 元数据标识读写(可识别并写入,用于溯源)+ AI 内容检测模型矩阵。
平台会自己加标识的情况:核验/检测站内未主动标识的内容是否由 AI 生成,对疑似 AI 内容或元数据含 AI 标识的作品补充添加显式标识;通过抖音账号直接制作发布的 AI 内容,平台主动添加显式标识;所有 AI 内容同步添加/更新隐式标识。
风险:平台对故意规避 AI 标识、滥用 AI 内容开展主动治理,并排查历史投稿的"标识缺失、标识不规范、漏标识"。
落地建议:把"发布时勾选 AI 声明"写进 SOP。不要试图靠去元数据、二次转码规避。 另外注意:海外平台(YouTube/TikTok)同样要求 AI 内容披露,跨平台分发时两边都要声明。
目标:先跑通链路,看看自己脑子里的画面能不能做出来。
目标:把单条成本压到 50–100 元、返工率压到 20% 以下、做到日更。
requirements.txt 必须先跑)、启动加 --disable-pinned-memory、SageAttention 只选 auto、打开 EasyCache(本卡 3.3× 提速);目标:图像成本归零,把省下的钱全部投给视频算力。
--sref --sw,确定"一个主色 + 一个点缀色"(例:月白 + 朱红鎏金);What Chinese people imagine heaven looks like),话题带 #ChineseHeaven / #Chinamaxxing;出海专属的一条纪律:不要把"角色一致性"当成仙宫题材的必做项。仙宫要的是空间一致性;只有做古风美人时才需要投入身份训练(Soul ID / 参考图包),而那会把成本推高 3–5 倍。
| # | 坑 | 正确做法 |
|---|---|---|
| 1 | 一上来就写"唯美震撼、电影感、高级感" | 五板块结构 + 把抽象词翻译成可量化视觉动作(8.2) |
| 2 | 跑大运镜(穿云、俯冲、环绕宫殿) | 慢推/轻移/缓慢抬升三选一;画面越大越要少动 |
| 3 | 远景人物画太大 | 远景压到 1%–4%(中景 5%–8%,近景 12%–20%) |
| 3b | 用一个主运镜以外的第二、第三个运动指令 | 一段只保留一个主运镜;"缓慢推进"必须是摄像机空间位移,禁止数码放大冒充 |
| 3c | 首尾帧用复杂运镜硬接 | 首尾帧差异必须能由真实摄影机路径解释,否则改首帧或尾帧 |
| 3d | 给珠宝/珍珠题材照搬通用负面词 | plastic / glossy / shiny / reflective 会误伤珍珠高光,需按题材裁剪 |
| 4 | 没锁首帧就直接写动作 | 先锁首帧,再写"看得见的动作" |
| 5 | 把参考图当"参考人物" | 参考图只是风格与结构输入;人物一致性靠人景拆分 + 三视图 |
| 6 | 发饰材质只写 gold / jade | 写工艺(filigree/granulation)+ 透感(translucent/inner glow) |
| 7 | 用 flat lighting / even lighting | 明确主光方向 + 金属镜面高光 + 玉石次表面散射 |
| 8 | 用矩形缩略图替代人物抠像(换装) | 必须沿真实身体轮廓裁切的完整抠像 |
| 9 | 短时长里同时堆复杂运镜和复杂换装 | 二选一 |
| 10 | 剧本写满微表情和高速武打 | 改剧本避开;用镜头语言兜底 |
| 11 | 提示词堆 40+ 个关键词 | 控制在 15–25 个,过多分散注意力 |
| 12 | 负向限制词写十几条 | 选 3–5 个最相关的 |
| 13 | 全部镜头用同一个模型死磕 | 按镜头类型分流(特写/全景/运动) |
| 14 | 靠平台分成指望回本 | 奇观流可打平;真钱在商单,把片子当作品集 |
| 15 | 发布不勾 AI 声明 | 硬性要求,且平台会追溯历史投稿 |
| 16 | 还照着 Sora 的教程做 | Sora App/网页 2026-04-26 已关停、API 2026-09-24 下线;换 Seedance/可灵/Wan/MiniMax |
| 17 | 以为 Veo 4 已发布 | Veo 4 从未发布,官方仍是 Veo 3.1;Google 转向 Gemini Omni |
| 18 | 直接把"角色一致性"套到仙宫题材上烧钱 | 仙宫吃空间一致性;角色一致性成本是它的 3–5 倍,别用错力气 |
| 19 | 每条提醒词都从零写 | 建 Moodboard 风格板 + 角色四联表,把一次成功变成可复用资产 |
| 20 | 封面上放小字 / 开场黑屏 | 封面用最贵的那一帧;前 2 秒直接给最大景别 |
| 文件 | 内容 |
|---|---|
速查卡.md | 一页纸速查:开工前必记的 5 个数、六步链路、四板斧、去 AI 味三招、成本速算、发布前 8 项检查 |
_parts/A-国内平台链路.md | 国内平台(即梦/可灵/海螺/Vidu/万相/混元/PixVerse/剪映/Liblib)链路与 10 条可抄中文提示词 |
_parts/B-国外链路.md | 国外链路(Midjourney/FLUX/Veo 3.1/Kling 3.0/Runway Gen-4.5/Seedance 2.5/Hailuo 3/Higgsfield)与 15 条英文提示词、完整价格表、3 个海外案例 |
_parts/C-本地ComfyUI复现方案.md | RTX 5060 Ti 16GB 本地 ComfyUI 完整复现方案 |
_parts/D-案例与核心技法.md | 标杆案例细读 + 仙宫/古风美女技法原始素材 |
_parts/E-成本合规与分发.md | 成本数据、算力排队现实、AI 标识合规、分发约束 |
_parts/F-变现与音画.md | 变现复盘、Suno 国风配乐、降返工率策略 |
_parts/G-提示词模板合集.md | 全部可直接抄用的提示词模板(含天宫规约完整示例与 14 项质量检查清单) |
案例与报道
技法
国外链路
市场与成本
音频与合规