MiniMax H3 prompt 更适合写成一份短小的制作计划:先选生成模式,再标明每个参考素材的职责,描述时间里的变化,并锁住一旦漂移就会让视频失效的细节。
TL;DR:把 H3 prompt 写成带时间的制作 brief
- H3 能统一理解文字、图片、视频与音频,并生成最长 15 秒、2K、带原生立体声的视频。
- 写场景前先选文生视频、首尾帧动画或 Omni Reference。
- 每个素材只承担一个明确职责:身份、产品、风格、动作、镜头、声音或剪辑节奏。
- 按开场状态、时间变化、镜头、声音、一致性锁定和结束状态组织 prompt。
- Vogue AI 已上线模型页和 prompts,但在 API 接入前不会假装可以生成。
MiniMax H3 改变了什么视频提示方式
关键不只是分辨率。H3 把文字、图片、视频和音频放进同一个生成上下文,prompt 因而变成多素材的指令层,而不是一张图的描述。真正需要掌握的是职责分配和时间变化。

先选择 H3 生成模式
MiniMax 用同一套多模态 API 提供文生视频、首尾帧图生视频和参考生成。视频与音频参考属于 Omni Reference;当前 API 不允许首尾帧角色与 reference 角色混用。
| 模式 | 输入 | 适用任务 | 首要风险 |
|---|---|---|---|
| 文生视频 | 提示词 | 概念片、社交广告、氛围和动作测试 | 主体描述不足时,场景容易漂移。 |
| 首帧 / 尾帧 | 提示词 + 一至两张图片 | 让静帧动起来,或控制结束构图 | 变化规则含糊时,提示词会与输入画面冲突。 |
| Omni Reference | 提示词 + 图片、视频和/或音频 | 控制身份、产品、动作、镜头、声音或节奏 | 素材不标职责会产生互相冲突的指令。 |
| 视频编辑 | 提示词 + 参考视频 | 动作迁移或定向重生成 | 同时改动太多内容会破坏连续性。 |
场景矩阵:让 prompt 对应真实制作任务
| 制作任务 | 提示结构 | 参考素材方案 | 第一项检查 |
|---|---|---|---|
| 产品广告 | 开场状态 → 揭示 → 证明细节 → 主视觉 | 产品图 + 可选动作或音乐参考 | 包装形状、标签区、手部和轮廓 |
| 剧情短片 | 身份锁定 → 定时镜头 → 表演 → 声音节点 | 人物图 + 场景 + 可选声音或镜头参考 | 身份漂移、视线、对白时间和镜头连续性 |
| 音乐视频 | 视觉设定 → 节拍变化 → 表演者锁定 → 收尾节拍 | 音乐 + 人物图片或视频 | 音画关系、节奏、嘴部动作和服装连续性 |
| UGC 广告 | 创作者动作 → 一句卖点 → 产品使用 → 结束画面 | 品牌准确性重要时提供产品和人物参考 | 皮肤质感、产品接触、手指和伪文字 |
可复制的 MiniMax H3 awesome prompts
下面的模板依据 X 上公开 H3 首发案例的结构进行原创改写。保留结构、替换主体和参考职责,再删除与最终镜头无关的指令。

- 时尚广告:制作一段 12 秒、16:9 的写实奢华时尚短片。模特穿着虹彩长裙走过极简沙漠秀道;从航拍全景切到侧向跟拍、克制环绕、布料特写和最终主视觉。强调可信布料重量、柔风、受控反射、面部与服装一致性。避免闪烁、身体变形、多余肢体、换装和文字,最后干净淡出。
- 竖屏 UGC 广告:制作 9:16 护肤 UGC。创作者在明亮浴室里直视手机镜头,拿起精华瓶,用一句话说明好处,涂抹少量产品并自然反应。保留真实皮肤纹理、自然眼神和手势、晨间窗光以及一致的瓶身形状。不要磨皮感、多余手指、漂浮产品、生成字幕或水印。
- 图生视频喜剧:把输入图片作为精确首帧,制作 15 秒八十年代真人家庭喜剧。保留画面中的人物、机器人、服装和构图;人群听到楼上声响后一起抬头,再逐步进入庆祝,机器人笨拙跳舞。加入实用特效质感、35mm 颗粒、机器人提示音和短合成器点缀。禁止现代服装、人物增加、文字改写或 CGI 光泽。
H3 prompt 的七层结构
稳定的 H3 prompt 包含模式、素材职责、时间线、镜头、声音、一致性锁定和负面约束。参考与身份规则放前面,时间动作放中间,失败约束放最后。
- 模式:文生视频、首尾帧或 Omni Reference。
- 素材职责:每张图片、每段视频或音频具体控制什么。
- 时间线:从开场状态到结束状态发生哪些变化。
- 镜头:景别、运动、剪辑逻辑和稳定性。
- 声音:对白、环境声、音效、音乐与静默。
- 锁定项:身份、产品几何、服装、空间方向和文字。
- 负面约束:只保留会让结果无法使用的失败项。
完整示例:制作 12 秒产品短片
这个例子只有一张产品参考、一次人物互动和一个品牌可用的结束画面,先保护产品几何,再添加镜头与声音。
原始任务
为一副银色头戴耳机制作 12 秒产品片。产品形状必须准确,片中要有一次真人互动,最后一帧需为品牌文案留出清晰空间。
提示词版本 1
- 将参考图 1 作为耳机外形与材质的精确依据。在深石墨色影棚制作 12 秒高级产品片。0–3 秒:固定微距拍摄金属耳罩,柔光从表面扫过。3–7 秒:一只手拿起耳机,保持转轴结构和耳垫厚度。7–10 秒:侧面拍摄模特戴上耳机,手部接触和头发运动自然。10–12 秒:耳机置于台座上形成干净的三分之四主视觉,左侧留空。声音包含轻微金属触碰、耳垫压缩、低环境底噪和一个克制低音。禁止产品变形、多余手指、虚构文字、材质变化或镜头抖动。
第一轮结果出来后改什么
不要整段重写,先定位第一个失败的制作约束。一般先修几何与身份,再修动作、剪辑节奏和声音。
- 产品发生变化时,加强参考图职责,并删除不必要的风格词。
- 动作太弱时,写清一个因果动作,而不是继续叠加形容词。
- 剪辑混乱时,减少镜头数量,把更多秒数留给核心动作。
- 声音太泛时,让每个重要声音对应同一镜头中可见的动作。
MiniMax H3 常见错误与修复
| 问题 | 优先修复 | 避免 |
|---|---|---|
| 参考素材冲突 | 给每个素材一个明确职责。 | 把所有上传内容都叫作主参考。 |
| 身份或产品漂移 | 把锁定规则移到开头。 | 继续增加电影感形容词。 |
| 镜头过多 | 减少节拍并写清时间。 | 试图在每一秒塞进完整广告。 |
| 声音不支持画面 | 把声音与可见动作相连,并适当留白。 | 罗列互不相关的音乐、对白和音效。 |
| 生成文字不可读 | 预留空白,后期再排版。 | 要求多个标签或标志都完美生成。 |
| 动作随机 | 写清开场、变化、原因和结束状态。 | 只描述视觉风格。 |
H3 如何接入 Vogue AI 工作流
Vogue AI 现在可以准备人物参考、产品图、风格帧和开场构图;H3 模型页负责沉淀可复制的动作 brief 和公开来源案例。等 API、积分、存储、回调和结果 QA 完成后才会开放真实生成。
生成前检查清单
- 生成模式与上传素材匹配。
- 每个素材只有一个明确职责,互相冲突的职责已删除。
- prompt 写明视频如何变化以及如何结束。
- 镜头和声音服务于主要节拍。
- 需要保护的身份、产品结构、服装、左右位置和文字规则已锁定。
- 负面约束只保留会让结果无法使用的错误。
FAQ
MiniMax H3 是什么?
它也被称为 MiniMax Hailuo 3,是面向生成、参考创作和视频编辑的通用多模态视频模型。
H3 可以上传什么?
官方 API 当前接受文字,并在规定数量、时长、大小和格式内支持图片、视频与音频参考。
H3 会一起生成声音吗?
会。MiniMax 标注为原生立体声输出;prompt 可以控制对白、环境声、音效、音乐和静默。
H3 最长能生成多久?
官方资料标注最长 15 秒;实际生成时应以当前平台控件提供的时长为准。
需要写精确时间码吗?
对白、音效、转场或揭示必须准时发生时建议写;简单氛围片可以只写开头、中段和结束。
现在能在 Vogue AI 里生成 H3 吗?
暂时不能。页面和 prompt 库已完成,但生成 API 尚未接入。
H3 权重已经可以下载吗?
MiniMax 宣布将在发布后开放权重;真正发布权重和许可证之前,应将其视为计划而不是已完成事实。