SKILL.cn.md


name: music-video-subtitle-generator description: | 面向音乐人、视频创作者和社交媒体剪辑者,用于制作带歌词贴字的 AI MV 或情绪短片。用户提供音乐、歌词、参考图、角色、字体方向、情绪意图或发布平台。Skill 会分析节拍与人声时序,区分人物、场景和文字参考,设计随节奏变化的空间字幕,拆解长视频为可衔接镜头,审查提示词并路由 H3 等视频生成工具。最终输出 MV 概念、分镜提示词、歌词文字方案和拼接建议。适用于风格化音乐视觉和动态字幕 MV,不适用于普通字幕校对、照搬已有 IP 或完全手工后期剪辑。 trigger-words: [MV, music video, lyric typography, on-screen text, prompt audit, Trap MV, Gospel hip-hop, Dark-pop, Cyber-grunge, MV提示词, 歌词文字, 字幕MV, 贴字MV, 卡点MV, 多镜头拼接]


音乐美学MV

用途

当用户需要创建、修改、审查或生成音乐视频提示词、情绪短片提示词时使用本 Skill,尤其是音乐、歌词、贴字、参考图、节奏、人物表演和镜头语言需要统一设计的任务。本 Skill 将第三方 MV prompt 规则适配为 Hub 可执行流程:关键创意决策需要确认,锁定 prompt 写入画布文本节点,媒体生成交给对应 Hub agent。

不要用于普通字幕烧录、普通视频剪辑、非音乐类产品广告,或没有 MV 结构需求的单张图片 / 单段视频简单任务。

Hub 兼容规则

核心原则

  1. 先理解作品,再选择结构。模板是组织工具,不是必须填满的表格。
  2. 使用用户最新确认的创意意图。
  3. 无关字段直接省略,不填空占位。
  4. 不因为预设里有表演、文字、转场、运镜或角色行为,就机械添加到不适合的作品里。
  5. 屏幕文字是设计图层,不是普通字幕;除非用户明确要求普通字幕。
  6. 如果用户上传真实歌曲或 beat,它就是主音乐床,除非用户要求替换。
  7. 多镜头自然衔接原则(针对 >15s 视频):当视频时长超过模型单次生成上限(如 15 秒)时,必须采用“多镜头分镜拆解 + 首尾帧接续 + 鼓点硬切 + 全局主音轨对齐”的标准拼接工作流。所有分段镜头必须保持同一音乐 Groove、速度感、画幅、角色逻辑、视觉预设、光影美学和文字运动规则,确保人声、音乐、节奏、画风与场景自然无缝过渡。
  8. 当用户要完整音乐美学 MV 但没有提供歌词时,先生成并锁定原创歌词。最终 MV 必须同时参考人物卡、文字包装卡和场景卡生成。文字包装卡只控制文字包装样式、字体质感、图形设计、排版比例和动效语言。

STEP 1:前期锁定

写最终生产 prompt 前,先确认最小基础。用简洁选项给出推荐。

1.1 视频格式

提供固定选项:

使用场景画幅分辨率
TikTok / Reels / Shorts 竖屏9:161080×1920
YouTube / B站 横屏16:91920×1080
信息流方图 / Feed1:11080×1080
投流竖屏高密度9:16720×1280
电影感宽银幕 MV21:92560×1080

所选比例必须贯穿角色卡、场景卡、文字参考、shot prompt、视频片段和最终合成。

1.2 目标时长与多镜头拆解架构

写 prompt 或生成视频前,必须先确认目标 MV 时长。即使用户没有上传音乐或歌词,也不能静默使用模型默认时长来替代用户意图。

提供简洁时长选项卡:

  1. 10 秒测试版:单镜头/双镜头,最快验证人物、场景、文字和音频风格。
  2. 15 秒 hook 版:2~4 个短镜头组,更完整的副歌 / hook / performance 短句。
  3. 30 秒及以上完整 MV 版(多镜头拼接合成):由于模型存在 15 秒单次生成上限,系统将自动采用 “多分镜(Multi-Shot)拼接工作流”。先生成或锁定一首完整连续歌曲 / BGM,将 30 秒拆解为 4~8 个 2~5 秒的动态分镜头,通过卡拍(Beat-Sync)与首尾帧/场景连续性控制,拼接合成为无缝 MV。
  4. 自定义时长:用户输入目标时长;根据所选视频模型的单次生成上限(如 15 秒)规划多镜头分镜数量与拼接方案。

如果用户提供了上传音乐,确认的目标时长就是需要锁定的音乐窗口长度。

1.3 音乐窗口

如果上传或指定的音乐长于已确认目标时长,必须先锁定片段再写 prompt。

提供三种模式:

  1. 推荐窗口:assistant 判断最强副歌 / hook / 情绪转折,并请求确认。
  2. 用户时间戳:用户给出开始和结束秒数;检查时间落在音频内。
  3. 多变体:只用于投流钩子测试或多创意方向。

如果音乐短于目标时长,使用完整音频。除非用户明确要求,不拉伸、不补长。

1.3.0 歌词锁定与歌词先行补全

写最终视频 prompt 或生成视频前,必须先确定歌词归属:

  1. 如果用户提供了歌词,这份歌词就是锁定歌词。除非用户明确要求改词,否则不得再生成、添加、改写、扩写、翻译、转述或替换成其他歌词。
  2. 如果用户想要完整音乐美学 MV 但没有提供歌词,才生成与所选音乐风格、vocal 模式、目标时长、情绪温度和视觉预设匹配的短篇原创歌词,并将其锁定。
  3. 锁定歌词是人物说唱 / 演唱表演和可见文字包装内容的唯一源文本。
  4. 从锁定歌词拆出每个分镜头的 Rap line:、Vocal line:、Soft vocal line: 或 Spoken line:。
  5. 每个 Typography: 字段也必须来自同一份锁定歌词。有人声表演时,文字必须逐字匹配正在表演的词。
  6. 在最终贴字 MV 中,人物必须根据锁定歌词说唱 / 演唱:可见嘴型、下颌动作、呼吸、面部重音、点头和手势重音都应跟随歌词 phrasing 和 rhythm。

1.3.1 大于 15 秒视频的多镜头拼接默认流程

对于 >15 秒的 MV(如 30 秒),必须以“全局多镜头分镜 Prompt 脚本”作为权威生成来源:

  1. 锁定完整 Master 音频:先锁定一首完整连续的歌曲/BGM轨(包含完整的 Vocal 与 Groove),作为整个拼接流程的唯一音频基准。
  2. 构建多分镜时间轴(Shotlist Timeline):将 30 秒拆解为 4~8 个短镜头(每个镜头 2~5 秒),精确映射到歌词时间戳与鼓点(Snare/808/Drop)上。
  3. 首尾帧与场景接续控制:
    • 若镜头 A 与镜头 B 为同一场景的长镜头延续:将镜头 A 的最后一帧(Tail Frame)作为镜头 B 的起始首帧(Head Frame)输入模型生成。
    • 若镜头 A 与镜头 B 为硬切换景:保持相同的人物卡/服装/光影美学 Prompt,并使用同向运镜或视觉元素匹配切(Match Cut)。
  4. 生成与剪辑组装:视频 agent 按 Shotlist 生成各短片段,剪辑 agent 在全局 Master 音轨上根据拍子(Beat Grid)进行裁切、调速(Speed Ramping)与拼接,确保人声口型、鼓点卡拍与画面过渡完全自然。

STEP 2:Creative Contract

最终 prompt 前先建立简洁创意合约:

STEP 3:参考图分工与场景采样

每张参考图只分配一个窄任务:

3.1 近景场景切换与多镜头采样规则

对于 Trap、Dark-pop、Cyber-grunge 等快节奏 MV,全片应在多个近景场景之间快速切换:

STEP 4:预设语法(以 Dark-pop / Cyber-grunge & Trap 为例)

视觉与剪辑语言

文字包装规则

STEP 5:Prompt 结构模板

多镜头分镜脚本必须按镜头(Shot)进行模块化输出,每个 Shot 标注准确的时长与音频映射:

[Global Aesthetic & Character Lock]: (全局人物与美学锚点 Prompt)

Shot 1 (0.0s - 3.5s)
Vocal Line: "..."
Typography: "..."
Visual & Action: ...
Camera & Motion: ...
Transition Out: Bass-hit 上硬切至 Shot 2 / 同向甩镜

Shot 2 (3.5s - 7.0s)
Vocal Line: "..."
Typography: "..."
Visual & Action: ...
Camera & Motion: ...
Transition Out: ...

STEP 6:BGM 连续性与多镜头自然衔接系统

6.1 音频全局连续性

全片必须强绑定同一轨 Master Audio(完整歌曲/Beat)。在分段生成视频时,严禁使用独立、断裂的片段音轨。所有视频片段在剪辑合成阶段均对齐至 Master Audio 的对应时间戳(Timeline)。

6.2 多镜头自然衔接系统(Natural Stitching Protocol)

为保证 >15 秒视频拼接后的极其自然,必须在 Prompt 规划与后期合成中严格执行以下“五大衔接锁”:

人声与口型衔接锁(Vocal & Lip Continuity): 分镜切替点(Cut Point)必须落在歌词的句间停顿(Pause/Breath)或强鼓点(Snare/Drop)上。严禁在人物发出某个元音或唱词中途进行硬切,除非后一个镜头是极近特写且口型完全接续。

音乐与节奏衔接锁(Rhythm & Beat Matching): 剪辑点必须精准裁切在音乐的 1/4 或 1/8 拍(Beat Grid)上。利用画面动作的“加速/减速(Speed Ramping)”微调,使视频中人物的头点拍、手势或眨眼精准踩在鼓点上。

画面美学与色彩衔接锁(Aesthetic & Color Grading): 跨镜头生成必须携带相同的 Aesthetic Header Prompt(相同的胶片颗粒度、色调 LUT、光影方向)。最终合成时,全局叠加一层 35mm Film Grain Overlay 和统一调色 LUT,掩盖跨批次生成的微小色差。

空间与转场衔接锁(Transition & Motion Continuity): 长镜头延伸:使用上一镜头的末帧(Tail Frame)作为下一镜头的首帧(Head Frame)输入,Prompt 加上 continuation of action。镜头切换:采用动能延续转场(如 Shot 1 结尾向右快速 Pan,Shot 2 开头从左向右 Pan 入;或利用人物手势遮挡镜头完成 Match Cut)。

文字动态衔接锁(Typography Motion Stitching): 跨镜头的文字动效,前一镜头的文字在切替瞬间跟随 Bass Hit 执行“破碎/扫出/砸屏”,下一镜头的文字在重音上“砸入/展开”,形成视觉动能的连贯传递。

STEP 7:审查清单(Checklist)

交付前静默检查:

STEP 8:画布交付

完整 MV Prompt 脚本锁定后,必须写入专用画布文本节点,命名为 Complete MV Prompt 或 完整MV Prompt。节点内容必须是完整的多分镜 Prompt 脚本与衔接说明,后续修改时更新该节点。

STEP 9:最终 MV 生成与合成流程

  1. Prompt 锁死与画布写入:确认完整的多镜头 Prompt 脚本(包含时间戳、歌词映射、转场逻辑)已写入画布。
  2. 分镜素材并行生成:视频 Agent 根据 Shotlist 逐个生成 2~5 秒的短片段。需要长镜头接续的片段,提取上一片段末帧作为首帧图生视频(I2V)。
  3. 多轨剪辑与自然缝合(Editing & Stitching):剪辑 Agent 导入全局 Master Audio 轨,将生成的各 Shot 视频按时间戳对齐上轨,在鼓点(Beat Grid)上进行精细剪辑与速度曲线微调(Speed Ramping),确保人声口型与画面动作完美卡拍。检查镜头接缝处,应用同向运镜或闪切遮瑕。
  4. 全局调色与质感统一(Finishing):全局叠加统一的 Movie LUT 与 35mm 胶片颗粒 Overlay,消除 AI 塑料感并锁定画风一致性。
  5. 输出交付:输出无缝衔接的完整 MV 视频文件。
下载此文件