h3_prompt_guide.txt

MINIMAX H3提示词写法说明面向海螺 / MiniMax H3(含 Ref2VA 参考模式)。把官方结构和实际生成里踩过的坑收成一份可对照手册:先选模式,再填字段,最后按失败类型只改那一维。适用范围:4–15 秒视频;提示词建议英文主体 + 中文台词原样保留;参考图最多 9 张、参考视频最多 3 段、参考音频最多 3 段。1. 先选模式,再写提示词模式选错,后面写得再细也会和输入打架。生成前先问:有没有参考图、要不要锁首帧/尾帧、要不要复用一段音轨。模式输入提示词骨架适合什么T2VA纯文本三字段从零描述一条时间线I2VA1 张首帧图对齐句 + 三字段从一张图往后续FL2VA首帧 + 尾帧对齐句 + 三字段空间路径明确,首尾都要准L2VA1 张尾帧图对齐句 + 三字段倒推开头,收在指定结尾Ref2VA图 / 视频 / 音频多参考六段式锁脸、锁场景、锁动作或音色和这次片子的关系角色三视图 + 场景图 = Ref2VA。若「人擦过镜头飞远、机位钉死」反复失败,优先改成 FL2VA:首帧是她跑向镜头,尾帧是擦过后远处一个点。首尾帧比加否定句更能锁空间。2. 两种骨架,字段名和顺序不能改2.1 基础模式(T2VA / I2VA / FL2VA / L2VA)I2VA / FL2VA / L2VA 必须把对齐句放在第一行,空一行再接下三字段。T2VA 没有对齐句。For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced. integrated_multimodal_description: [Shot 1] ... overall_soundscape: ... non_diegetic_music: ...FL2VA 对齐句固定写法(把 N 和秒数换成实际值):How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 12.00-second mark of the target video.2.2 参考模式 Ref2VA(六段式)有角色图、场景图、道具图、动作视频或音轨时用这一套。六段顺序固定,标签跨段必须一致。subject_definitions:summary:retention_analysis:detailed_description:overall_soundscape:non_diegetic_music:字段写什么不要写什么subject_definitions每个 <Subject / Picture / Video / Audio> 是谁、从哪张素材来、管什么故事情节、分镜summary方括号任务类型 + 一句整片在干什么新标签、新角色retention_analysis每个标签出现在哪一镜 + 保留标记 + 一句说明把音频标记写成 fully_preserveddetailed_description风格、构图、动作、运镜、台词,按时间往下写抽象形容词堆砌overall_soundscape环境音、动作音、呼吸咀嚼重复台词或配乐non_diegetic_music观众才听得到的配乐:乐器、速度、起伏角色听得到的歌;没有就写 N/A2.3 summary 任务类型summary 必须以方括号开头。多种任务用 + 连接,不要自造新词。标记含义[reference generation]用参考图生成新视频(最常用)[keyframe completion]按首尾帧补中间[video editing]改已有视频[video continuation]续已有视频[audio reuse]整段音轨原样当成品声(对嘴/唱歌用这个)[audio reference]只借音色或风格,不照抄波形例子:[reference generation + audio reuse]3. 参考素材怎么编号、怎么分工上传顺序 = 编号。第 1 张图就是 <Picture 1>。每个文件必须写清用途,没写用途的素材等于浪费。标签职责注意<Subject N>可复用的人、物、场景、服装、动作从哪张图/哪段视频提取,写在定义里<Picture N>首帧、尾帧、构图锚、设定图只提供主体时,不必再单独定义一张废图<Video N>动作、走位、运镜路径、剪辑节奏默认会带上原片构图,要写清只借哪一层<Audio N>成品声轨或音色参考对嘴用 fully_copy,借音色用 reference分工原则一张图只锁一件事:脸、衣服、场景、道具,不要一张图既当身份又当构图又当动作。参考图锁身份和外观;提示词负责动作、时间和运镜。想锁某种镜头路径,最稳的是再丢一段 <Video 1>,并写 camera-path reference only。冲突时写优先级:先保脸,再保场景,再保道具尺寸。设定图常见坑三视图、武器图、产品图默认会被模型当成「真实世界尺寸」。要改大小,必须在定义里写 Picture N is shape/color reference only, not a size reference,并在 retention 用 partially_preserved。4. 分镜、时间戳、一镜到底[Shot 1] 不加时间戳,开头先写风格和构图。[Shot 2] 起必须写 At 00:03.500 这种递增时间,且落在片长内。[Shot 2] 默认是切镜(cut)。只想推近或略转角度,不要新开 Shot,写镜头运动。一镜到底:全文只保留 [Shot 1],不要出现 Shot 2 / 镜头切换 / cut。总时长必须和生成设置一致,12 秒片不要写到 00:15。推荐时间轴写法(同一镜内用秒数分段,而不是切镜):[Shot 1] Cinematic, vertical 9:16. One continuous take, no cut.00:00–00:06.500: ...After the final word: ...5. 官方运镜词表(最容易写错的部分)完整运镜 = 类型 + 必要时的幅度 + 速度。写进句子里,不要在句尾堆标签。幅度默认中等、速度默认正常,可以不写。官方词机位是否移动镜头是否转典型后果Static Shot / holds a static shot否否死脚架Pan Left / Pan Right否左右转原地甩镜Tilt Up / Tilt Down否上下转原地抬头低头Zoom In / Zoom Out否变焦机身不动、画面缩放Push In / Pull Out是,前后可不变整机推进或后退Truck Left / Truck Right是,左右平移可不变横移Pedestal Up / Down是,升降可不变整机升高降低Tracking Shot是,跟人走通常跟人镜头跟着主体走Arc Shot是,绕主体对着主体环绕Shake / POV / Roll视情况视情况手持、主观、滚镜官方推荐的句子形态:The camera holds a static shot as the runner exits the frame.The camera pans right with large amplitude at fast speed, revealing the open doorway.The camera pushes in with small amplitude at slow speed toward the letter in her hands.跟这次片子直接相关的结论写 follow / keep her centered / 镜头跟随 / truck backward,模型会理解成 Tracking,整机出门。要「人飞走、机位留下」:说话前 holds a static shot;擦镜后 pans with large amplitude at fast speed。禁止词要落到官方反义词:no push in, no pull out, no truck, no tracking shot, no aerial move。用栏杆、地面花纹、近景柱础「钉在画面同一位置」来证明脚架没挪,比反复写 locked 更有效。官方词表里没有「机位钉死但一直把飞远的人框满」这种跟拍。合法组合就是 static → 人擦框 → pan。6. 台词、唱歌、对嘴开口的人才给 (S1)(S2)。不说话的角色不要编号。第一次开口时,在 <d> 外面写年龄、性别、气声、语速。用户给的台词一个字都不能改,放进 <d>[Chinese] 原文。</d>对嘴/唱歌:summary 用 [audio reuse],retention 对音频用 fully_copy,正文写 sings along / mouth in exact sync,不要自编歌词。画外音必须写 says in an off-screen voiceover,并写明嘴唇闭合。正确形态:The anxious young woman (S1) says: <d>[Chinese] 要迟到了要迟到,今天上早八啊!</d>7. 保留分析标记视觉和音频两套词不能混用。对象标记含义图 / 人 / 物 / 视频fully_preserved外观、服装、结构原样保留图 / 人 / 物 / 视频partially_preserved保留一部分,改尺寸、换装、去项图 / 人 / 物 / 视频attribute_transfer只借材质、纹样、颜色图 / 人 / 物 / 视频weak_reference新加道具、弱参考音频fully_copy整段当成品声,对嘴必须用这个音频partially_copy只用其中一段音频reference借音色/风格,不抄波形音频weak_reference极弱参考一行标准写法:<Subject 1> (appears in [Shot 1]): fully_preserved - face, bun, and icy-blue hanfu stay identical to <Picture 1>.8. 声音两段怎么分工台词、唱歌、角色听得到的广播/手机铃声:写在 detailed_description / integrated_multimodal_description。overall_soundscape:风、脚步、衣料、咀嚼、呼吸、擦镜时的破风。1–4 句英文,一段写完。non_diegetic_music:只写乐器、速度、节奏、音量变化,少写「紧张、搞笑」这种情绪词。完全静音:两段都写 N/A。只要禁配乐:音乐写 N/A,声景照写。不要一段要配乐、另一段禁 BGM。9. 实战写作顺序(建议照做)确定片长、画幅(9:16 / 16:9)、模式。给每张参考图一句话职责。只定一个主事件。12 秒里不要塞三个高潮。先写时间轴:0–A 秒发生什么,A 秒之后发生什么。再写镜头:全程 static,还是某一秒才 pan / push。再写台词原句和 (S1)。最后写声景和配乐。失败以后只改错的那一维:镜头错改镜头句,脸漂了加 fully_preserved 细节,手乱伸写 forbidden 手部动作。10. 一条提示词里动作太多,就会糊社区和这次生成都验证了同一件事:4–15 秒只适合一个清楚的节拍。下面这组已经偏满,后半段最容易崩。节拍建议跑向镜头 + 塞面包 + 看手机 + 一句台词可以放在前 6–7 秒,算一个「赶路」事件说完立刻起飞、擦镜、极速变小这是第二个事件,最容易变成镜头一起飞再加悬浮剑、扶剑、转身超载,拆成第二条生成修法:拆成两段 6 秒;或 FL2VA 用尾帧把「飞远后的画面」钉死。11. 常见失败和对应修法现象原因怎么改脸漂、衣服换了参考图没声明身份,或 retention 太弱Picture 1 = identity only;fully_preserved 写五官和衣服道具巨大 / 手去扶设定图被当成真实尺寸和持握物not a size reference;双手写死空摆;拉开人与物距离走两步就换动作模型把「身边有物」理解成交互写 Forbidden 清单,点名 00:02 不换动作镜头跟人飞走写了 follow / track / 保持居中改成 static shot + 事后 pan;删 truck人往回飞「飞走」被理解成退回来路写 keep the same forward heading, graze past the lens话说完才对上嘴型台词和动作抢同一秒写 only after the final syllable is fully audible自动切镜写了 Shot 2 或「镜头切换」只留 Shot 1,声明 no cut多出来的人、剑、字幕没写排除No extra person, no weapon, no on-screen text云是死的场景图被 fully_preserved 锁成静帧写 only the cloud layer is allowed to drift12. 可复制模板12.1 Ref2VA 空模板subject_definitions:<Subject 1> is the [person] in <Picture 1>, with [face / hair / clothes].<Picture 1> is the identity reference for <Subject 1> only.<Subject 2> is the environment in <Picture 2>.<Picture 2> is the scene and the planted camera location. summary:[reference generation] A [N]-second single continuous take. [One sentence of what happens]. [One sentence of camera]. retention_analysis:<Subject 1> (appears in [Shot 1]): fully_preserved - [face and costume details].<Picture 1>: fully_preserved - identity only.<Subject 2> (appears in [Shot 1]): fully_preserved - [place details].<Picture 2>: fully_preserved - fixed camera standpoint. detailed_description:[Shot 1] [Style]. [Aspect]. One continuous take, no cut.The camera holds a static shot.[Who does what, when].Speaker (S1) says: <d>[Chinese] 原文。</d>[What happens after the line].The camera [pan / still static]. No tracking shot. overall_soundscape:[Footsteps, cloth, wind, no extra layers]. non_diegetic_music:[Instrument + tempo + change], or N/A.12.2 机位钉死 + 人擦镜飞走(精简版)这是本轮最后稳定下来的镜头句,可直接嵌进 detailed_description。The camera holds a static shot from a tripod on the marble.She runs toward the lens and grows larger because she approaches, not because the camera moves.After the final 啊 she keeps the same forward heading, grazes past the lens, and shrinks to a speck.Only after she passes does the camera pan with large amplitude at fast speed.No push in, no pull out, no truck, no tracking shot, no aerial move.13. 语言和长度结构字段、分镜、运镜用英文。台词、歌词、屏幕上要出现的字,保留用户原文。屏幕文字用英文双引号包起来,例如 A sign reading "营业中"。提示词上限约 7000 字。宁可用短句写清时间和镜头,也不要堆「电影感、高级、炸裂」。具体可见的东西优先:谁在哪、手在干什么、栏杆在画面哪一侧、云怎么移动。14. 生成前 30 秒检查单模式和实际上传的文件数量一致。每个 <Picture N> 都能在 subject_definitions 里找到用途。summary 有方括号任务类型。retention 里视觉/音频标记没有写反。只有一个 [Shot 1],或每个后镜都有递增时间戳。运镜用的是官方词,没有 follow / 镜头跟随 这种含糊说法。台词在 <d> 里,一字未改。片长、画幅、禁止项(多人、武器、字幕、切镜)都写了。如果上次失败,这次只改失败的那一维。15. 主要依据官方:MiniMax-AI/MiniMax-H3 仓库 skills/h3-prompt-writing,以及 VIDEO_PROMPT_WRITING_GUIDE_base_en.md / ref-en.md。平台文档将完整提示词定义为「参考素材说明 + 核心创意 + 画面过程说明」。社区共识:一条提示词只压一个主动作;运镜必须写明,不写就是死脚架;声音要单独写;参考图锁身份、提示词锁动作。本文后半的镜头、道具、手部交互处理,来自同一条 12 秒仙宫赶路片的反复生成:悬浮剑尺寸、手去扶剑、走两步换动作、跟飞、往回飞、擦镜方向。— 完 —
下载此文件