返回博客
教程发布 2026年7月31日12 分钟阅读

MiniMax H3 提示词指南:模式、公式与案例

面向文生视频、首尾帧、Omni Reference、原生声音和 15 秒制作 brief 的 MiniMax H3 实用提示词指南。

作者 Vogue AI Team更新 2026年7月31日
本文目录

MiniMax H3 prompt 更适合写成一份短小的制作计划:先选生成模式,再标明每个参考素材的职责,描述时间里的变化,并锁住一旦漂移就会让视频失效的细节。

TL;DR:把 H3 prompt 写成带时间的制作 brief

  • H3 能统一理解文字、图片、视频与音频,并生成最长 15 秒、2K、带原生立体声的视频。
  • 写场景前先选文生视频、首尾帧动画或 Omni Reference。
  • 每个素材只承担一个明确职责:身份、产品、风格、动作、镜头、声音或剪辑节奏。
  • 按开场状态、时间变化、镜头、声音、一致性锁定和结束状态组织 prompt。
  • Vogue AI 已上线模型页和 prompts,但在 API 接入前不会假装可以生成。

MiniMax H3 改变了什么视频提示方式

关键不只是分辨率。H3 把文字、图片、视频和音频放进同一个生成上下文,prompt 因而变成多素材的指令层,而不是一张图的描述。真正需要掌握的是职责分配和时间变化。

Vogue AI 原创的 MiniMax H3 多模态制作工作流视觉
这张 Vogue AI 自有视觉把文字、图片、视频和声音汇入同一制作画面,说明 H3 提示词为什么需要素材职责、时间动作、一致性锁定和声音指令。

先选择 H3 生成模式

MiniMax 用同一套多模态 API 提供文生视频、首尾帧图生视频和参考生成。视频与音频参考属于 Omni Reference;当前 API 不允许首尾帧角色与 reference 角色混用。

模式输入适用任务首要风险
文生视频提示词概念片、社交广告、氛围和动作测试主体描述不足时,场景容易漂移。
首帧 / 尾帧提示词 + 一至两张图片让静帧动起来,或控制结束构图变化规则含糊时,提示词会与输入画面冲突。
Omni Reference提示词 + 图片、视频和/或音频控制身份、产品、动作、镜头、声音或节奏素材不标职责会产生互相冲突的指令。
视频编辑提示词 + 参考视频动作迁移或定向重生成同时改动太多内容会破坏连续性。

场景矩阵:让 prompt 对应真实制作任务

制作任务提示结构参考素材方案第一项检查
产品广告开场状态 → 揭示 → 证明细节 → 主视觉产品图 + 可选动作或音乐参考包装形状、标签区、手部和轮廓
剧情短片身份锁定 → 定时镜头 → 表演 → 声音节点人物图 + 场景 + 可选声音或镜头参考身份漂移、视线、对白时间和镜头连续性
音乐视频视觉设定 → 节拍变化 → 表演者锁定 → 收尾节拍音乐 + 人物图片或视频音画关系、节奏、嘴部动作和服装连续性
UGC 广告创作者动作 → 一句卖点 → 产品使用 → 结束画面品牌准确性重要时提供产品和人物参考皮肤质感、产品接触、手指和伪文字

可复制的 MiniMax H3 awesome prompts

下面的模板依据 X 上公开 H3 首发案例的结构进行原创改写。保留结构、替换主体和参考职责,再删除与最终镜头无关的指令。

Vogue AI 原创的 MiniMax H3 制作场景提示词蓝图
这张自有分镜把三种任务放在一起:产品几何、布料运动和界面连续性,方便对照每种提示结构。
  • 时尚广告:制作一段 12 秒、16:9 的写实奢华时尚短片。模特穿着虹彩长裙走过极简沙漠秀道;从航拍全景切到侧向跟拍、克制环绕、布料特写和最终主视觉。强调可信布料重量、柔风、受控反射、面部与服装一致性。避免闪烁、身体变形、多余肢体、换装和文字,最后干净淡出。
  • 竖屏 UGC 广告:制作 9:16 护肤 UGC。创作者在明亮浴室里直视手机镜头,拿起精华瓶,用一句话说明好处,涂抹少量产品并自然反应。保留真实皮肤纹理、自然眼神和手势、晨间窗光以及一致的瓶身形状。不要磨皮感、多余手指、漂浮产品、生成字幕或水印。
  • 图生视频喜剧:把输入图片作为精确首帧,制作 15 秒八十年代真人家庭喜剧。保留画面中的人物、机器人、服装和构图;人群听到楼上声响后一起抬头,再逐步进入庆祝,机器人笨拙跳舞。加入实用特效质感、35mm 颗粒、机器人提示音和短合成器点缀。禁止现代服装、人物增加、文字改写或 CGI 光泽。

H3 prompt 的七层结构

稳定的 H3 prompt 包含模式、素材职责、时间线、镜头、声音、一致性锁定和负面约束。参考与身份规则放前面,时间动作放中间,失败约束放最后。

  • 模式:文生视频、首尾帧或 Omni Reference。
  • 素材职责:每张图片、每段视频或音频具体控制什么。
  • 时间线:从开场状态到结束状态发生哪些变化。
  • 镜头:景别、运动、剪辑逻辑和稳定性。
  • 声音:对白、环境声、音效、音乐与静默。
  • 锁定项:身份、产品几何、服装、空间方向和文字。
  • 负面约束:只保留会让结果无法使用的失败项。

完整示例:制作 12 秒产品短片

这个例子只有一张产品参考、一次人物互动和一个品牌可用的结束画面,先保护产品几何,再添加镜头与声音。

原始任务

为一副银色头戴耳机制作 12 秒产品片。产品形状必须准确,片中要有一次真人互动,最后一帧需为品牌文案留出清晰空间。

提示词版本 1

  • 将参考图 1 作为耳机外形与材质的精确依据。在深石墨色影棚制作 12 秒高级产品片。0–3 秒:固定微距拍摄金属耳罩,柔光从表面扫过。3–7 秒:一只手拿起耳机,保持转轴结构和耳垫厚度。7–10 秒:侧面拍摄模特戴上耳机,手部接触和头发运动自然。10–12 秒:耳机置于台座上形成干净的三分之四主视觉,左侧留空。声音包含轻微金属触碰、耳垫压缩、低环境底噪和一个克制低音。禁止产品变形、多余手指、虚构文字、材质变化或镜头抖动。

第一轮结果出来后改什么

不要整段重写,先定位第一个失败的制作约束。一般先修几何与身份,再修动作、剪辑节奏和声音。

  • 产品发生变化时,加强参考图职责,并删除不必要的风格词。
  • 动作太弱时,写清一个因果动作,而不是继续叠加形容词。
  • 剪辑混乱时,减少镜头数量,把更多秒数留给核心动作。
  • 声音太泛时,让每个重要声音对应同一镜头中可见的动作。

MiniMax H3 常见错误与修复

问题优先修复避免
参考素材冲突给每个素材一个明确职责。把所有上传内容都叫作主参考。
身份或产品漂移把锁定规则移到开头。继续增加电影感形容词。
镜头过多减少节拍并写清时间。试图在每一秒塞进完整广告。
声音不支持画面把声音与可见动作相连,并适当留白。罗列互不相关的音乐、对白和音效。
生成文字不可读预留空白,后期再排版。要求多个标签或标志都完美生成。
动作随机写清开场、变化、原因和结束状态。只描述视觉风格。

H3 如何接入 Vogue AI 工作流

Vogue AI 现在可以准备人物参考、产品图、风格帧和开场构图;H3 模型页负责沉淀可复制的动作 brief 和公开来源案例。等 API、积分、存储、回调和结果 QA 完成后才会开放真实生成。

生成前检查清单

  • 生成模式与上传素材匹配。
  • 每个素材只有一个明确职责,互相冲突的职责已删除。
  • prompt 写明视频如何变化以及如何结束。
  • 镜头和声音服务于主要节拍。
  • 需要保护的身份、产品结构、服装、左右位置和文字规则已锁定。
  • 负面约束只保留会让结果无法使用的错误。

FAQ

MiniMax H3 是什么?

它也被称为 MiniMax Hailuo 3,是面向生成、参考创作和视频编辑的通用多模态视频模型。

H3 可以上传什么?

官方 API 当前接受文字,并在规定数量、时长、大小和格式内支持图片、视频与音频参考。

H3 会一起生成声音吗?

会。MiniMax 标注为原生立体声输出;prompt 可以控制对白、环境声、音效、音乐和静默。

H3 最长能生成多久?

官方资料标注最长 15 秒;实际生成时应以当前平台控件提供的时长为准。

需要写精确时间码吗?

对白、音效、转场或揭示必须准时发生时建议写;简单氛围片可以只写开头、中段和结束。

现在能在 Vogue AI 里生成 H3 吗?

暂时不能。页面和 prompt 库已完成,但生成 API 尚未接入。

H3 权重已经可以下载吗?

MiniMax 宣布将在发布后开放权重;真正发布权重和许可证之前,应将其视为计划而不是已完成事实。