---
name: music-video-subtitle-generator
description: |
  面向音乐人、视频创作者和社交媒体剪辑者，用于制作带歌词贴字的 AI MV 或情绪短片。用户提供音乐、歌词、参考图、角色、字体方向、情绪意图或发布平台。Skill 会分析节拍与人声时序，区分人物、场景和文字参考，设计随节奏变化的空间字幕，拆解长视频为可衔接镜头，审查提示词并路由 H3 等视频生成工具。最终输出 MV 概念、分镜提示词、歌词文字方案和拼接建议。适用于风格化音乐视觉和动态字幕 MV，不适用于普通字幕校对、照搬已有 IP 或完全手工后期剪辑。
trigger-words: [MV, music video, lyric typography, on-screen text, prompt audit, Trap MV, Gospel hip-hop, Dark-pop, Cyber-grunge, MV提示词, 歌词文字, 字幕MV, 贴字MV, 卡点MV, 多镜头拼接]
---

# 音乐美学MV

## 用途

当用户需要创建、修改、审查或生成音乐视频提示词、情绪短片提示词时使用本 Skill，尤其是音乐、歌词、贴字、参考图、节奏、人物表演和镜头语言需要统一设计的任务。本 Skill 将第三方 MV prompt 规则适配为 Hub 可执行流程：关键创意决策需要确认，锁定 prompt 写入画布文本节点，媒体生成交给对应 Hub agent。

不要用于普通字幕烧录、普通视频剪辑、非音乐类产品广告，或没有 MV 结构需求的单张图片 / 单段视频简单任务。

## Hub 兼容规则

- 不假设可直接调用第三方工具、shell 脚本、浏览器插件或外部生成 API。
- 锁定 prompt 和修订版本必须写入 Hub 画布文本节点。
- 角色卡、场景卡、文字卡、视频片段、BGM 和最终合成都交给 Hub 图片、视频、音乐、剪辑 agent。
- 不硬编码输出路径，始终使用工具返回的 Hub 文件路径。
- 用户说“跳过确认 / 直接做”时，只对本次运行生效，除非外层编排器已将其作为当前会话授权处理。
- 如果用户只要 prompt，交付 prompt 后停止；如果用户要完整 MV，在确认后继续生成和合成。

## 核心原则

1. 先理解作品，再选择结构。模板是组织工具，不是必须填满的表格。
2. 使用用户最新确认的创意意图。
3. 无关字段直接省略，不填空占位。
4. 不因为预设里有表演、文字、转场、运镜或角色行为，就机械添加到不适合的作品里。
5. 屏幕文字是设计图层，不是普通字幕；除非用户明确要求普通字幕。
6. 如果用户上传真实歌曲或 beat，它就是主音乐床，除非用户要求替换。
7. **多镜头自然衔接原则（针对 >15s 视频）**：当视频时长超过模型单次生成上限（如 15 秒）时，必须采用“多镜头分镜拆解 + 首尾帧接续 + 鼓点硬切 + 全局主音轨对齐”的标准拼接工作流。所有分段镜头必须保持同一音乐 Groove、速度感、画幅、角色逻辑、视觉预设、光影美学和文字运动规则，确保人声、音乐、节奏、画风与场景自然无缝过渡。
8. 当用户要完整音乐美学 MV 但没有提供歌词时，先生成并锁定原创歌词。最终 MV 必须同时参考人物卡、文字包装卡和场景卡生成。文字包装卡只控制文字包装样式、字体质感、图形设计、排版比例和动效语言。

## STEP 1：前期锁定

写最终生产 prompt 前，先确认最小基础。用简洁选项给出推荐。

### 1.1 视频格式

提供固定选项：

| 使用场景 | 画幅 | 分辨率 |
| :--- | ---: | ---: |
| TikTok / Reels / Shorts 竖屏 | 9:16 | 1080×1920 |
| YouTube / B站 横屏 | 16:9 | 1920×1080 |
| 信息流方图 / Feed | 1:1 | 1080×1080 |
| 投流竖屏高密度 | 9:16 | 720×1280 |
| 电影感宽银幕 MV | 21:9 | 2560×1080 |

所选比例必须贯穿角色卡、场景卡、文字参考、shot prompt、视频片段和最终合成。

### 1.2 目标时长与多镜头拆解架构

写 prompt 或生成视频前，必须先确认目标 MV 时长。即使用户没有上传音乐或歌词，也不能静默使用模型默认时长来替代用户意图。

提供简洁时长选项卡：

1. **10 秒测试版**：单镜头/双镜头，最快验证人物、场景、文字和音频风格。
2. **15 秒 hook 版**：2~4 个短镜头组，更完整的副歌 / hook / performance 短句。
3. **30 秒及以上完整 MV 版（多镜头拼接合成）**：由于模型存在 15 秒单次生成上限，系统将自动采用 **“多分镜（Multi-Shot）拼接工作流”**。先生成或锁定一首完整连续歌曲 / BGM，将 30 秒拆解为 4~8 个 2~5 秒的动态分镜头，通过卡拍（Beat-Sync）与首尾帧/场景连续性控制，拼接合成为无缝 MV。
4. **自定义时长**：用户输入目标时长；根据所选视频模型的单次生成上限（如 15 秒）规划多镜头分镜数量与拼接方案。

如果用户提供了上传音乐，确认的目标时长就是需要锁定的音乐窗口长度。

### 1.3 音乐窗口

如果上传或指定的音乐长于已确认目标时长，必须先锁定片段再写 prompt。

提供三种模式：

1. 推荐窗口：assistant 判断最强副歌 / hook / 情绪转折，并请求确认。
2. 用户时间戳：用户给出开始和结束秒数；检查时间落在音频内。
3. 多变体：只用于投流钩子测试或多创意方向。

如果音乐短于目标时长，使用完整音频。除非用户明确要求，不拉伸、不补长。

### 1.3.0 歌词锁定与歌词先行补全

写最终视频 prompt 或生成视频前，必须先确定歌词归属：

1. 如果用户提供了歌词，这份歌词就是锁定歌词。除非用户明确要求改词，否则不得再生成、添加、改写、扩写、翻译、转述或替换成其他歌词。
2. 如果用户想要完整音乐美学 MV 但没有提供歌词，才生成与所选音乐风格、vocal 模式、目标时长、情绪温度和视觉预设匹配的短篇原创歌词，并将其锁定。
3. 锁定歌词是人物说唱 / 演唱表演和可见文字包装内容的唯一源文本。
4. 从锁定歌词拆出每个分镜头的 `Rap line:`、`Vocal line:`、`Soft vocal line:` 或 `Spoken line:`。
5. 每个 `Typography:` 字段也必须来自同一份锁定歌词。有人声表演时，文字必须逐字匹配正在表演的词。
6. 在最终贴字 MV 中，人物必须根据锁定歌词说唱 / 演唱：可见嘴型、下颌动作、呼吸、面部重音、点头和手势重音都应跟随歌词 phrasing 和 rhythm。

### 1.3.1 大于 15 秒视频的多镜头拼接默认流程

对于 >15 秒的 MV（如 30 秒），必须以“全局多镜头分镜 Prompt 脚本”作为权威生成来源：

1. **锁定完整 Master 音频**：先锁定一首完整连续的歌曲/BGM轨（包含完整的 Vocal 与 Groove），作为整个拼接流程的唯一音频基准。
2. **构建多分镜时间轴（Shotlist Timeline）**：将 30 秒拆解为 4~8 个短镜头（每个镜头 2~5 秒），精确映射到歌词时间戳与鼓点（Snare/808/Drop）上。
3. **首尾帧与场景接续控制**：
   - 若镜头 A 与镜头 B 为同一场景的长镜头延续：将镜头 A 的最后一帧（Tail Frame）作为镜头 B 的起始首帧（Head Frame）输入模型生成。
   - 若镜头 A 与镜头 B 为硬切换景：保持相同的人物卡/服装/光影美学 Prompt，并使用同向运镜或视觉元素匹配切（Match Cut）。
4. **生成与剪辑组装**：视频 agent 按 Shotlist 生成各短片段，剪辑 agent 在全局 Master 音轨上根据拍子（Beat Grid）进行裁切、调速（Speed Ramping）与拼接，确保人声口型、鼓点卡拍与画面过渡完全自然。

## STEP 2：Creative Contract

最终 prompt 前先建立简洁创意合约：

- 音乐类型、器乐、速度感（BPM）、vocal 模式、情绪温度。
- 歌词来源（锁定歌词）。
- 目标时长与多镜头拆解结构（例如：30s 拆分为 6 个 Short Shots）。
- 参考图角色分工：人物卡、场景卡、文字包装卡。
- 运镜、景别、对焦、剪辑卡拍密度与转场衔接逻辑。
- 明确排除项（如：严禁淡入淡出、严禁油亮 AI 美颜脸、严禁单镜头硬撑导致变形）。

## STEP 3：参考图分工与场景采样

每张参考图只分配一个窄任务：

- **文字参考卡**：只控制文字包装样式、字体质感、图形设计、排版比例和动效语言。严禁出现人物或场景。
- **人物参考卡**：只控制人物形象、脸部气质、发型、服装轮廓、角色比例、姿态和整体气场。
- **场景参考卡**：只控制场景视觉风格、空间氛围、影像质感、背景层次和光影气质。

### 3.1 近景场景切换与多镜头采样规则

对于 Trap、Dark-pop、Cyber-grunge 等快节奏 MV，全片应在多个近景场景之间快速切换：

- 场景气质保持统一，但每个镜头的空间必须明显不同（局部背景、隧道、墙面、灯带、反光地面）。
- 场景切换必须由明确音乐冲击触发：bass hit、808 drop、snare、vocal 重音或文字砸屏。
- 镜头切换是 trap beat 上的“视觉采样”：硬切、跳切、扫描 glitch 硬切、闪切、动作匹配切。

## STEP 4：预设语法（以 Dark-pop / Cyber-grunge & Trap 为例）

### 视觉与剪辑语言

- 写实高时装质感、胶片杂志质感（90年代末-00年代初独立杂志/复印纸/胶片扫描/zine拼贴）。
- 粗颗粒、轻微胶片抖动、半色调网点、印刷毛边、扫描错位。
- **剪辑绝对只使用硬切（Hard Cut）**，严禁淡入淡出、溶解或柔和转场。
- 画面与文字强响应鼓点：hi-hat roll（微震/跳帧）、snare（放大/硬切/肩膀下压）、808 bass hit（低频压屏/拉伸/错位）。

### 文字包装规则

- 文字是空间中的动态图形主体（不是普通字幕条），可以处于前景、中景、背景或被人物肩膀/手部遮挡。
- 文字绝不遮挡眼睛或主要面部表情；对嘴时避免遮挡嘴部。
- 有人声时，显示文字必须逐字匹配正在表演的歌词。每个镜头只出现一个主文字事件。

## STEP 5：Prompt 结构模板

多镜头分镜脚本必须按镜头（Shot）进行模块化输出，每个 Shot 标注准确的时长与音频映射：

```text
[Global Aesthetic & Character Lock]: (全局人物与美学锚点 Prompt)

Shot 1 (0.0s - 3.5s)
Vocal Line: "..."
Typography: "..."
Visual & Action: ...
Camera & Motion: ...
Transition Out: Bass-hit 上硬切至 Shot 2 / 同向甩镜

Shot 2 (3.5s - 7.0s)
Vocal Line: "..."
Typography: "..."
Visual & Action: ...
Camera & Motion: ...
Transition Out: ...
```

## STEP 6：BGM 连续性与多镜头自然衔接系统

### 6.1 音频全局连续性

全片必须强绑定同一轨 Master Audio（完整歌曲/Beat）。在分段生成视频时，严禁使用独立、断裂的片段音轨。所有视频片段在剪辑合成阶段均对齐至 Master Audio 的对应时间戳（Timeline）。

### 6.2 多镜头自然衔接系统（Natural Stitching Protocol）

为保证 >15 秒视频拼接后的极其自然，必须在 Prompt 规划与后期合成中严格执行以下“五大衔接锁”：

**人声与口型衔接锁（Vocal & Lip Continuity）**：
分镜切替点（Cut Point）必须落在歌词的句间停顿（Pause/Breath）或强鼓点（Snare/Drop）上。严禁在人物发出某个元音或唱词中途进行硬切，除非后一个镜头是极近特写且口型完全接续。

**音乐与节奏衔接锁（Rhythm & Beat Matching）**：
剪辑点必须精准裁切在音乐的 1/4 或 1/8 拍（Beat Grid）上。利用画面动作的“加速/减速（Speed Ramping）”微调，使视频中人物的头点拍、手势或眨眼精准踩在鼓点上。

**画面美学与色彩衔接锁（Aesthetic & Color Grading）**：
跨镜头生成必须携带相同的 Aesthetic Header Prompt（相同的胶片颗粒度、色调 LUT、光影方向）。最终合成时，全局叠加一层 35mm Film Grain Overlay 和统一调色 LUT，掩盖跨批次生成的微小色差。

**空间与转场衔接锁（Transition & Motion Continuity）**：
长镜头延伸：使用上一镜头的末帧（Tail Frame）作为下一镜头的首帧（Head Frame）输入，Prompt 加上 continuation of action。镜头切换：采用动能延续转场（如 Shot 1 结尾向右快速 Pan，Shot 2 开头从左向右 Pan 入；或利用人物手势遮挡镜头完成 Match Cut）。

**文字动态衔接锁（Typography Motion Stitching）**：
跨镜头的文字动效，前一镜头的文字在切替瞬间跟随 Bass Hit 执行“破碎/扫出/砸屏”，下一镜头的文字在重音上“砸入/展开”，形成视觉动能的连贯传递。

## STEP 7：审查清单（Checklist）

交付前静默检查：

- [ ] 目标时长超过 15 秒时，是否已自动采用多镜头（Multi-Shot）拆解结构？
- [ ] 是否已锁定唯一的全局 Master Audio，且分镜切替点对齐到了音乐拍子上？
- [ ] 镜头切替是否避开了人声唱词中途，口型与呼吸是否自然？
- [ ] 相邻镜头之间是否有明确的转场衔接机制（首尾帧接续 / 同向运镜 / Match Cut / 鼓点硬切）？
- [ ] 剪辑风格是否严格保持“纯硬切”，绝无淡入淡出或柔和转场？
- [ ] 三张参考卡（人物/场景/文字）是否角色隔离，且未互相污染？
- [ ] 文字包装是否作为空间图层，且绝未遮挡眼睛和主要面部表情？
- [ ] 全局画质、颗粒感、色彩与光影是否保持高度一致？

## STEP 8：画布交付

完整 MV Prompt 脚本锁定后，必须写入专用画布文本节点，命名为 `Complete MV Prompt` 或 `完整MV Prompt`。节点内容必须是完整的多分镜 Prompt 脚本与衔接说明，后续修改时更新该节点。

## STEP 9：最终 MV 生成与合成流程

1. **Prompt 锁死与画布写入**：确认完整的多镜头 Prompt 脚本（包含时间戳、歌词映射、转场逻辑）已写入画布。
2. **分镜素材并行生成**：视频 Agent 根据 Shotlist 逐个生成 2~5 秒的短片段。需要长镜头接续的片段，提取上一片段末帧作为首帧图生视频（I2V）。
3. **多轨剪辑与自然缝合（Editing & Stitching）**：剪辑 Agent 导入全局 Master Audio 轨，将生成的各 Shot 视频按时间戳对齐上轨，在鼓点（Beat Grid）上进行精细剪辑与速度曲线微调（Speed Ramping），确保人声口型与画面动作完美卡拍。检查镜头接缝处，应用同向运镜或闪切遮瑕。
4. **全局调色与质感统一（Finishing）**：全局叠加统一的 Movie LUT 与 35mm 胶片颗粒 Overlay，消除 AI 塑料感并锁定画风一致性。
5. **输出交付**：输出无缝衔接的完整 MV 视频文件。
