# MiniMax H3 完整参考模式中文规则（Ref2VA）

本文件是完整参考模式的独立中文规则。它负责把人物、场景、图片、视频和音频参考素材整理成六个固定字段。字段名、标签、关系标记和任务类型值保持协议规定的英文写法，字段中的自然语言描述使用中文。

## 1. 六段输出结构

完整参考模式必须按以下顺序输出六个字段：

```text
subject_definitions:
summary:
retention_analysis:
detailed_description:
overall_soundscape:
non_diegetic_music:
```

- `subject_definitions`：定义目标视频中需要跟踪的参考内容和标签。
- `summary`：概括任务类型、目标视频和主要参考关系。
- `retention_analysis`：说明各个参考内容在目标视频中如何保留、转移、复制或仅作参考。
- `detailed_description`：按播放顺序详细描述画面、动作、镜头、声音和对白。
- `overall_soundscape`：概括环境声、动作声和非语言人声。
- `non_diegetic_music`：描述角色听不到的背景音乐。

六个字段不能改名、调换顺序或合并。不要把完整参考模式写成普通三字段模式。

## 2. 参考标签

### 2.1 `<Subject N>`

`<Subject N>` 表示目标视频中真正会被使用、保留或改变的可见内容单元，例如：

- 人物、动物和物体；
- 场景、背景和环境；
- 服装、道具、界面和视觉效果；
- 风格、动作、表情和姿势。

它表示内容角色，不只是文件本身。一个主体可以由多份素材共同定义，一份素材也可以提供多个主体。

```text
<Subject 1> 是 <Picture 1> 中的年轻女人，具有长黑发、蓝色开衫和细银项链。
```

如果同一主体由多种素材共同提供，说明每份素材各自负责什么：

```text
<Subject 1> 是人物主体，外貌来自 <Picture 1>，行走动作来自 <Video 1>。
```

### 2.2 `<Picture N>`

只有当图片本身承担首帧、关键帧、尾帧、剪辑锚点或具体构图规划作用时，才单独建立 `<Picture N>` 条目。

```text
<Picture 2> 是 [Shot 1] 的第一帧，显示一名女人坐在咖啡馆窗边。
```

如果图片只用于定义人物、场景、服装、风格或姿势，而不是具体时间点的画面锚点，就把它写在对应 `<Subject N>` 的定义中，不要重复创建独立图片条目。

如果图片是分镜或构图参考，要说明它对应哪些镜头，以及它提供的视角、主体位置和镜头顺序：

```text
<Picture 3> 是 [Shot 1] 和 [Shot 2] 的分镜参考，规定两段的视角、主体位置和镜头顺序。
```

### 2.3 `<Video N>`

`<Video N>` 用于完整视频关系，例如：

- 直接编辑原视频；
- 从原视频结尾继续生成；
- 参考原视频的镜头运动、剪辑、节奏或时间结构。

```text
<Video 1> 是目标视频要编辑的源视频。
```

如果参考视频中的人物、物体、场景、动作或特效会作为目标画面中的可见内容使用，仍需在 `<Subject N>` 中单独定义。`<Video N>` 代表素材或结构来源，不替代主体标签。

### 2.4 `<Audio N>`

`<Audio N>` 表示独立的音频素材或参考视频中被启用的同步音轨，可用于：

- 完整或部分复制音频；
- 参考背景音乐风格；
- 参考说话人的音色和表达；
- 使用对白、歌词或动作声；
- 参考节拍、节奏或声音连续性。

如果音频对应目标视频中的说话人，要复用这个说话人的全局编号：

```text
<Audio 1> 是 <Subject 1>（S1）的声音音色参考。
```

说话人编号由目标视频中实际发生的发声事件决定，不能因为新增一个音频标签而重新编号。

## 3. `<Video N>` 和 `<Audio N>` 的关系

`<Video N>` 和 `<Audio N>` 分别独立编号，数字只代表各自类别中的顺序，不代表两者必须配对。同一个源视频可以对应 `<Video 1>` 和 `<Audio 2>`。

普通参考视频包含声音，并不自动生成 `<Audio N>`。只有当音频本身被复制、启用或作为音频参考时，才建立 `<Audio N>`。

```text
<Video 1> 是目标视频的源视频。
<Audio 2> 是 <Video 1> 的同步音轨，并将在目标视频中复用。
```

## 4. `summary`

这一段用一个简短中文段落概括目标视频和参考关系，但开头的任务类型前缀必须使用固定英文值。可用值包括：

- `keyframe completion`：图片作为首帧、关键帧、尾帧或具体画面锚点；
- `reference generation`：图片、视频或音频提供生成参考，但不是直接编辑或续接的源视频；
- `video editing`：直接修改已有源视频；
- `video continuation`：从已有源视频继续、延长或接续；
- `audio reuse`：直接复用全部或部分相同音频信号；
- `audio reference`：只参考音色、节奏、音乐风格、对白内容或声音质感，不直接复制信号。

多个任务类型用 ` + ` 连接，不重复同一个类型：

```text
summary:
[video continuation + keyframe completion] 目标视频从 <Video 1> 的末尾继续，并在最后一镜收束到 <Picture 2> 的构图。<Subject 1> 保持人物身份和服装，<Audio 1> 只作为音色参考。
```

只有当视频确实被编辑或续接时，才使用 `video editing` 或 `video continuation`。仅仅参考视频的镜头运动、剪辑节奏或人物动作时，通常使用 `reference generation`。

如果编辑源视频后仍保留原音频，同时加入 `audio reuse`。如果续接视频时只参考原音频的特点而不复制信号，使用 `audio reference`。

`summary` 只能使用前面已经定义的 `<Subject N>`、`<Picture N>`、`<Video N>` 和 `<Audio N>`，不能在这里创造新标签。直接编辑源视频时，任务类型后面应明确写出：

```text
The target video is an edited version of <Video 1>.
```

这句固定关系可以保留英文，其他自然语言使用中文。

## 5. `retention_analysis`

这一段逐条说明每个已定义的参考内容在目标视频中如何保留、改变、转移或复制。关系标记必须保留以下固定英文值。

### 5.1 可见内容关系

- `fully_preserved`：定义的参考作用完整保留；
- `partially_preserved`：仍在使用，但部分特征改变或只保留一部分；
- `attribute_transfer`：参考特征转移到另一个可识别的目标主体；
- `weak_reference`：只保留宽泛的风格、类别、构图或氛围相似性。

```text
<Subject 1>（出现在 [Shot 1]、[Shot 3]）：fully_preserved - 人物身份、长发、蓝色外套和银色项链完整保留。
<Picture 2>（[Shot 1] 尾帧）：fully_preserved - 画面中的人物位置、相机角度和光线在最后时刻对齐。
<Video 1>（剪辑和节奏结构）：weak_reference - 只参考其镜头节奏，不直接复制画面内容。
```

不要把目标视频中新增的动作、背景或剧情事件误判为参考内容丢失。只分析该标签在定义中承诺保留的特征。

### 5.2 音频关系

音频使用以下固定英文值：

- `fully_copy`：完整音频作为目标视频的完整最终音轨；
- `partially_copy`：只复制部分时间线或部分音频层，或复制后加入、删除、替换了其他声音；
- `reference`：不直接复制信号，只参考音色、节奏、音乐风格、对白内容或声音质感；
- `weak_reference`：只保留宽泛的类别或氛围相似性。

```text
<Audio 1>: fully_copy - <Audio 1> 作为目标视频完整最终音轨按原样复用。
<Audio 2>: reference - 目标说话人参考 <Audio 2> 的音色和克制的语速，但不复制原始信号。
```

关系标记必须符合该音频在 `subject_definitions` 中定义的实际角色。

## 6. `detailed_description`

这是完整参考模式的主体，按目标视频播放顺序逐镜头写出：

- 当前构图和主体位置；
- 人物外观、服装和状态；
- 环境、道具和光线；
- 动作、反应和状态变化；
- 镜头运动和切点；
- 画面内声音、对白和音乐；
- 参考标签在何时、以什么作用生效。

不要把它写成剧情摘要，也不要只列参考关系。每个镜头都要说明真正可见、可听和正在发生的内容。

基本格式遵循基础模式规则：

- `[Shot 1]` 是开头，不写时间码；
- 后续镜头用 `[Shot N] At MM:SS.mmm, ...`；
- 镜头时间严格递增并落在视频时长内；
- 对白和歌词放在 `<d>[Language] ...</d>`；
- 使用稳定的 `(S1)`、`(S2)` 说话人编号；
- 对白跨切镜使用 `<scenetrans>`，结尾截断使用 `<cutoff>`。

### 6.1 参考标签的首次出现

重要主体第一次清楚出现时，说明标签代表的参考特征、当前画面位置和动作；后续继续使用同一标签，不重新定义它的含义。

```text
[Shot 1] 中景建立 <Subject 1>，她保留 <Picture 1> 中的长黑发、蓝色开衫和银色项链，坐在窗边并握着折叠信件。
```

使用自然语言描述具体关键帧：

```text
镜头从 <Picture 1> 的第一帧开始。
镜头的关键帧对应 <Picture 2>。
镜头结尾到达 <Picture 3> 的构图。
```

编辑或续接源视频时，在源状态、结构或续接关系生效的镜头中自然引用 `<Video N>`；音频关系生效的镜头或声音阶段引用 `<Audio N>`。

### 6.2 说话人、音频和对白

参考主体实际说话时，同时保留主体标签和说话人编号：

```text
<Subject 2>（S1）转向女人，用轻松的年轻男声说道：<d>[Chinese] 去年夏天，我去过我祖父家。</d>
```

`<Subject N>` 表示参考内容，`(Sx)` 表示实际发声人。离屏发声保持同一编号并明确写出离屏状态。如果声音只存在于直接复用的背景音乐或完整音轨中，不要凭空创建新的说话人。

如果直接复用参考音频中的对白或歌词，或用户要求重新演绎它们，必须保留原词和原语言。听不清的部分写 `[unclear]`，不要猜测或改写。

说话人编号按照目标视频中实际发声事件的顺序分配，并在所有后续镜头中复用。`<Audio N>` 的定义不能独立分配新的说话人编号。

## 7. 声音字段

`overall_soundscape` 概括整个视频的环境声、动作声和非语言人声；对白、歌唱和与具体镜头同步的声音事件仍留在 `detailed_description`。

`non_diegetic_music` 只写角色听不到的观众侧背景音乐，说明乐器、节奏、速度、动态和结束方式。参考音频的复制或参考关系只写在对应的声音字段中：环境和动作声进入 `overall_soundscape`，观众侧音乐进入 `non_diegetic_music`。

## 8. 完整示例

```text
subject_definitions:
<Subject 1> 是 <Picture 1> 中的咖啡馆环境，包含裸露砖墙、橙色绒面沙发、图案抱枕、霓虹灯和木制茶几。
<Subject 2> 是 <Picture 2>、<Picture 3> 和 <Picture 4> 中的白色萨摩耶，具有厚实白毛、尖耳朵、黑色鼻子和卷曲尾巴。
<Subject 3> 是 <Video 1> 中的金发年轻女人，留着长金发，穿浅粉色卷袖衬衫。
<Subject 4> 是 <Video 2> 中的年轻男人，留着短卷发，穿带抽绳的深灰色连帽衫。
<Audio 1> 是 <Subject 3>（S1）的声音音色参考，包含一段中文对白。

summary:
[reference generation + audio reference] 目标视频显示 <Subject 3> 在 <Subject 1> 中吃饼干。<Subject 4> 牵着 <Subject 2> 进入，狗扑向饼干，三镜头交流最后以观众笑声结束。<Audio 1> 只作为 <Subject 3> 的声音音色和表达参考。

retention_analysis:
<Subject 1>（出现在 [Shot 1]、[Shot 2]、[Shot 3]）：fully_preserved - 裸露砖墙、橙色沙发、图案抱枕、霓虹灯和木制茶几完整保留。
<Subject 2>（出现在 [Shot 1]、[Shot 2]）：fully_preserved - 萨摩耶的白色厚毛、尖耳朵、黑鼻子和卷曲尾巴完整保留。
<Subject 3>（出现在 [Shot 1]、[Shot 2]、[Shot 3]）：fully_preserved - 人物身份、长金发和浅粉色衬衫完整保留。
<Subject 4>（出现在 [Shot 1]、[Shot 2]）：fully_preserved - 短卷发和深灰色连帽衫完整保留。
<Audio 1>: reference - 目标视频参考其声音音色和表达方式，不直接复制原始信号。

detailed_description:
目标视频采用写实多机位情景喜剧风格，室内使用温暖灯光。
[Shot 1] 中景建立 <Subject 1> 的咖啡馆环境。<Subject 3>（S1）坐在沙发上握着巧克力曲奇。<Subject 4> 从左侧进入，手里牵着 <Subject 2>。狗扑向曲奇，牵引绳被拉紧。<Subject 3>（S1）猛地收回手，用参考自 <Audio 1> 的清晰年轻女声音调略带恼火地说：<d>[Chinese] 嘿！看好你的狗！</d> 她闭上嘴唇护住曲奇，<Subject 4> 把狗拉回身边。
[Shot 2] At 00:03.000, 镜头切到 <Subject 4>（S2）的近景。他坐到 <Subject 3> 旁边，抱住 <Subject 2>。<Subject 4>（S2）用轻松的年轻男声和玩笑语气说道：<d>[Chinese] 它只是比喜欢我更喜欢曲奇。</d> 他露出歉意的笑，抚摸狗的白色厚毛。
[Shot 3] At 00:05.000, 镜头切到 <Subject 3>（S1）的近景。她的恼火变成笑意，看向萨摩耶，用同一音色回答：<d>[Chinese] 至少它的品味不错。</d> 她举起曲奇做出小幅度的祝酒动作。观众笑声紧接着对白出现，并持续到最后一帧。

overall_soundscape:
安静的咖啡馆室内声和低沉的通风声贯穿整段视频。

non_diegetic_music:
N/A
```

## 9. 最终检查

1. 六个字段是否完整、顺序正确且没有混入普通三字段格式。
2. 每个参考标签是否先定义后使用，且在后文含义保持一致。
3. `<Picture N>`、`<Video N>`、`<Audio N>` 是否承担了正确的参考角色。
4. `summary` 的任务类型是否符合实际关系，是否错误地把普通参考写成视频编辑或续接。
5. `retention_analysis` 的固定关系标记是否与定义一致。
6. `detailed_description` 是否按播放顺序说明了构图、主体、动作、镜头、声音和参考标签作用。
7. 对白、歌词、品牌名和画面文字是否保留原文，是否正确使用说话人编号和 `<d>`。
8. 是否编造了没有连接或无法读取的媒体内容、人物、文字、Logo 或声音。
9. 最终输出是否只有可复制的提示词，没有解释、分析或 Markdown 围栏。
