MiniMax H3 のプロンプトは短い制作設計として書くと安定します。モードを選び、各リファレンスの役割、時間変化、固定すべき要素を明記します。
要点:H3 を時間付き制作 brief として書く
- H3 はテキスト・画像・動画・音声を統合します。
- 最初に生成モードを選びます。
- 各素材に一つの役割を与えます。
- 開始、変化、カメラ、音、終了を書きます。
- Vogue AI での生成は API 接続後に提供します。
MiniMax H3 が動画プロンプトを変える点
プロンプトは一枚の見た目説明ではなく、複数素材を同じ文脈で指揮するレイヤーになります。

先に H3 の生成モードを選ぶ
公式 API は text-to-video、first/last frame、reference generation を提供し、組み合わせには明確なルールがあります。
| モード | 入力 | 適した用途 | 最初のリスク |
|---|---|---|---|
| テキストから動画 | プロンプト | コンセプト、SNS 広告、雰囲気、動きの検証 | 主体の説明が弱いとシーンがずれます。 |
| 最初 / 最後のフレーム | プロンプト + 1〜2 枚の画像 | 静止画のアニメ化や終了構図の制御 | 変化ルールが曖昧だと入力画像と競合します。 |
| Omni Reference | プロンプト + 画像、動画、音声 | 人物、商品、動き、カメラ、声、リズムの制御 | 素材の役割がないと指示が衝突します。 |
| 動画編集 | プロンプト + 参照動画 | 動きの転用や部分的な再生成 | 同時に変更しすぎると連続性が落ちます。 |
制作ジョブ別シナリオ表
| 制作タスク | プロンプト構成 | 参照素材の計画 | 最初に確認する失敗 |
|---|---|---|---|
| 商品広告 | 開始 → 登場 → 証拠となる細部 → 最終カット | 商品画像 + 必要に応じて動きや音楽 | 形状、ラベル領域、手、シルエット |
| 短編映画 | 人物固定 → 時間付きカット → 演技 → 音 | 人物 + 場所 + 必要に応じて声やカメラ | 人物、視線、台詞タイミング、連続性 |
| ミュージックビデオ | 視覚設定 → ビート変化 → 演者固定 → 終了 | 楽曲 + 人物画像または動画 | 音画関係、リズム、口元、衣装 |
| UGC 広告 | 動作 → 一つの利点 → 使用 → 終了画面 | 精度が必要なら商品と制作者 | 肌、商品接触、指、偽テキスト |
コピーできる MiniMax H3 awesome prompts
X の公開 H3 事例から構造を抽出し、一般用途向けに独自に書き直したテンプレートです。

- ファッション広告:12 秒、16:9 の写実的な高級ファッション映像。虹色のドレスを着たモデルが夕方の砂漠のランウェイを歩く。空撮の全景、横移動、控えめな周回、布のマクロ、最終ヒーローカットへ進む。顔、衣装構造、布の重さを保ち、ちらつき、変形、余分な手足、衣装変更、文字を避ける。
- 縦型 UGC:明るい浴室で撮影した 9:16 のスキンケア動画。制作者が美容液を見せ、一つの利点を話し、頬に塗って自然に反応する。肌の質感、目線、仕草、朝の光、ボトル形状を維持する。美肌フィルター、余分な指、浮く商品、自動字幕、透かしは禁止。
- 画像からコメディ動画:入力画像を正確な最初のフレームとして使う。実物のロボットスーツと 35mm 質感による 1980 年代の家族向けコメディを 15 秒制作。全員が上を見た後に祝福し、ロボットがぎこちなく踊る。人物、衣装、文字、構図を保つ。CGI 光沢、人物追加、現代服は禁止。
H3 プロンプトの構造
モード、素材役割、時間軸、カメラ、音、継続性ロック、ネガティブ制約を順に整理します。
- モード:テキストから動画、最初/最後のフレーム、Omni Reference。
- 素材の役割:各画像、動画、音声が何を制御するか。
- 時間軸:開始状態から終了状態まで何が変わるか。
- カメラ:画角、移動、カットの論理、安定性。
- 音:台詞、環境音、効果音、音楽、無音。
- 固定項目:人物、商品形状、衣装、空間方向、文字。
- ネガティブ指定:結果を使えなくする失敗だけを書く。
実例:12 秒の商品映像
商品形状を先に守り、その後で人の動作、カメラ、音を加えます。
元の制作依頼
銀色のオーバーイヤーヘッドホンを紹介する 12 秒の商品映像を作る。形状を正確に保ち、一度だけ人物が触れ、最終画面にはブランド文言用の余白を残す。
プロンプト第 1 版
- 参照画像 1 をヘッドホンの形状と素材の正確な基準として使う。濃いグラファイト色のスタジオで 12 秒の高級商品映像を制作。0〜3 秒:金属イヤーカップの固定マクロに柔らかな光を走らせる。3〜7 秒:手が持ち上げ、ヒンジ形状とクッション厚を維持。7〜10 秒:モデルが装着する横顔。接触と髪の動きは自然に。10〜12 秒:台座上の三分の四アングルで、左に余白を残す。音は金属の軽い接触、クッションの圧縮、低い室内音、一つの控えめな低音。商品変形、余分な指、架空文字、素材変更、手ぶれは禁止。
最初の結果の修正順
全体を書き直さず、形状、同一性、動き、編集リズム、音の順で最初の失敗を直します。
- 商品が変わる場合は参照役割を強め、不要なスタイル語を削る。
- 動きが弱い場合は形容詞ではなく、一つの原因と結果を書く。
- 編集が騒がしい場合はカット数を減らし、主動作の時間を増やす。
- 音が一般的すぎる場合は、重要な音を同じカットの見える動作に結び付ける。
MiniMax H3 の失敗と修正
| 問題 | 先に修正 | 避ける |
|---|---|---|
| 参照素材が衝突 | 各素材に一つの役割を与える。 | すべてを主参照と呼ぶ。 |
| 人物や商品がずれる | 固定条件を最初の文へ移す。 | 映画的な形容詞を増やす。 |
| カットが多すぎる | 動作を減らし時間を明確にする。 | 毎秒に広告全体を詰め込む。 |
| 音が画面を支えない | 見える動作と音を結び、必要な無音を残す。 | 無関係な音楽、声、効果音を並べる。 |
| 生成文字が読めない | 余白を残し、文字は後で入れる。 | 複数のロゴを完璧に生成させる。 |
| 動きがランダム | 開始、変化、原因、終了を書く。 | 見た目のスタイルだけを書く。 |
Vogue AI での H3 ワークフロー
Vogue AI は人物、商品、style frame、開始画像を準備できます。H3 生成は API と QA 完了後に追加します。
生成前チェック
- モードと素材が一致する。
- 各素材の役割が一つ。
- 変化と終了が明確。
- カメラと音が主動作を支える。
- 人物と商品が固定されている。
- ネガティブ指定が短い。
FAQ
MiniMax H3 とは?
生成、リファレンス制作、編集に対応する汎用マルチモーダル動画モデルです。
何を入力できますか?
公式制限内でテキスト、画像、動画、音声を利用できます。
音声も生成しますか?
はい。MiniMax はネイティブステレオ出力を案内しています。
最大の長さは?
公式資料では最大 15 秒です。
正確な timecode は必要?
台詞、音、転換を正確に合わせる場合に有効です。
Vogue AI で今使えますか?
まだです。ページと prompts は完成していますが API は未接続です。
weights は公開済み?
公開予定は発表されていますが、実際の weights と license を確認する必要があります。