ブログへ戻る
チュートリアル公開 2026年7月31日12 分で読めます

MiniMax H3 プロンプトガイド:モード、公式、実例

text-to-video、first/last frame、Omni Reference、ネイティブ音声、15 秒制作 brief の実践ガイドです。

著者 Vogue AI Team更新 2026年7月31日
この記事の内容

MiniMax H3 のプロンプトは短い制作設計として書くと安定します。モードを選び、各リファレンスの役割、時間変化、固定すべき要素を明記します。

要点:H3 を時間付き制作 brief として書く

  • H3 はテキスト・画像・動画・音声を統合します。
  • 最初に生成モードを選びます。
  • 各素材に一つの役割を与えます。
  • 開始、変化、カメラ、音、終了を書きます。
  • Vogue AI での生成は API 接続後に提供します。

MiniMax H3 が動画プロンプトを変える点

プロンプトは一枚の見た目説明ではなく、複数素材を同じ文脈で指揮するレイヤーになります。

Vogue AI オリジナルの MiniMax H3 マルチモーダル制作フロー
Vogue AI が所有するこのビジュアルは、テキスト・画像・動画・音声を一つの制作画面にまとめ、素材の役割、時間指定、一貫性、音の指示が必要な理由を示します。

先に H3 の生成モードを選ぶ

公式 API は text-to-video、first/last frame、reference generation を提供し、組み合わせには明確なルールがあります。

モード入力適した用途最初のリスク
テキストから動画プロンプトコンセプト、SNS 広告、雰囲気、動きの検証主体の説明が弱いとシーンがずれます。
最初 / 最後のフレームプロンプト + 1〜2 枚の画像静止画のアニメ化や終了構図の制御変化ルールが曖昧だと入力画像と競合します。
Omni Referenceプロンプト + 画像、動画、音声人物、商品、動き、カメラ、声、リズムの制御素材の役割がないと指示が衝突します。
動画編集プロンプト + 参照動画動きの転用や部分的な再生成同時に変更しすぎると連続性が落ちます。

制作ジョブ別シナリオ表

制作タスクプロンプト構成参照素材の計画最初に確認する失敗
商品広告開始 → 登場 → 証拠となる細部 → 最終カット商品画像 + 必要に応じて動きや音楽形状、ラベル領域、手、シルエット
短編映画人物固定 → 時間付きカット → 演技 → 音人物 + 場所 + 必要に応じて声やカメラ人物、視線、台詞タイミング、連続性
ミュージックビデオ視覚設定 → ビート変化 → 演者固定 → 終了楽曲 + 人物画像または動画音画関係、リズム、口元、衣装
UGC 広告動作 → 一つの利点 → 使用 → 終了画面精度が必要なら商品と制作者肌、商品接触、指、偽テキスト

コピーできる MiniMax H3 awesome prompts

X の公開 H3 事例から構造を抽出し、一般用途向けに独自に書き直したテンプレートです。

Vogue AI オリジナルの MiniMax H3 プロンプト設計図
Vogue AI 所有のストーリーボードで、商品形状、布の動き、UI の連続性という三つの仕事を比較できます。
  • ファッション広告:12 秒、16:9 の写実的な高級ファッション映像。虹色のドレスを着たモデルが夕方の砂漠のランウェイを歩く。空撮の全景、横移動、控えめな周回、布のマクロ、最終ヒーローカットへ進む。顔、衣装構造、布の重さを保ち、ちらつき、変形、余分な手足、衣装変更、文字を避ける。
  • 縦型 UGC:明るい浴室で撮影した 9:16 のスキンケア動画。制作者が美容液を見せ、一つの利点を話し、頬に塗って自然に反応する。肌の質感、目線、仕草、朝の光、ボトル形状を維持する。美肌フィルター、余分な指、浮く商品、自動字幕、透かしは禁止。
  • 画像からコメディ動画:入力画像を正確な最初のフレームとして使う。実物のロボットスーツと 35mm 質感による 1980 年代の家族向けコメディを 15 秒制作。全員が上を見た後に祝福し、ロボットがぎこちなく踊る。人物、衣装、文字、構図を保つ。CGI 光沢、人物追加、現代服は禁止。

H3 プロンプトの構造

モード、素材役割、時間軸、カメラ、音、継続性ロック、ネガティブ制約を順に整理します。

  • モード:テキストから動画、最初/最後のフレーム、Omni Reference。
  • 素材の役割:各画像、動画、音声が何を制御するか。
  • 時間軸:開始状態から終了状態まで何が変わるか。
  • カメラ:画角、移動、カットの論理、安定性。
  • 音:台詞、環境音、効果音、音楽、無音。
  • 固定項目:人物、商品形状、衣装、空間方向、文字。
  • ネガティブ指定:結果を使えなくする失敗だけを書く。

実例:12 秒の商品映像

商品形状を先に守り、その後で人の動作、カメラ、音を加えます。

元の制作依頼

銀色のオーバーイヤーヘッドホンを紹介する 12 秒の商品映像を作る。形状を正確に保ち、一度だけ人物が触れ、最終画面にはブランド文言用の余白を残す。

プロンプト第 1 版

  • 参照画像 1 をヘッドホンの形状と素材の正確な基準として使う。濃いグラファイト色のスタジオで 12 秒の高級商品映像を制作。0〜3 秒:金属イヤーカップの固定マクロに柔らかな光を走らせる。3〜7 秒:手が持ち上げ、ヒンジ形状とクッション厚を維持。7〜10 秒:モデルが装着する横顔。接触と髪の動きは自然に。10〜12 秒:台座上の三分の四アングルで、左に余白を残す。音は金属の軽い接触、クッションの圧縮、低い室内音、一つの控えめな低音。商品変形、余分な指、架空文字、素材変更、手ぶれは禁止。

最初の結果の修正順

全体を書き直さず、形状、同一性、動き、編集リズム、音の順で最初の失敗を直します。

  • 商品が変わる場合は参照役割を強め、不要なスタイル語を削る。
  • 動きが弱い場合は形容詞ではなく、一つの原因と結果を書く。
  • 編集が騒がしい場合はカット数を減らし、主動作の時間を増やす。
  • 音が一般的すぎる場合は、重要な音を同じカットの見える動作に結び付ける。

MiniMax H3 の失敗と修正

問題先に修正避ける
参照素材が衝突各素材に一つの役割を与える。すべてを主参照と呼ぶ。
人物や商品がずれる固定条件を最初の文へ移す。映画的な形容詞を増やす。
カットが多すぎる動作を減らし時間を明確にする。毎秒に広告全体を詰め込む。
音が画面を支えない見える動作と音を結び、必要な無音を残す。無関係な音楽、声、効果音を並べる。
生成文字が読めない余白を残し、文字は後で入れる。複数のロゴを完璧に生成させる。
動きがランダム開始、変化、原因、終了を書く。見た目のスタイルだけを書く。

Vogue AI での H3 ワークフロー

Vogue AI は人物、商品、style frame、開始画像を準備できます。H3 生成は API と QA 完了後に追加します。

生成前チェック

  • モードと素材が一致する。
  • 各素材の役割が一つ。
  • 変化と終了が明確。
  • カメラと音が主動作を支える。
  • 人物と商品が固定されている。
  • ネガティブ指定が短い。

FAQ

MiniMax H3 とは?

生成、リファレンス制作、編集に対応する汎用マルチモーダル動画モデルです。

何を入力できますか?

公式制限内でテキスト、画像、動画、音声を利用できます。

音声も生成しますか?

はい。MiniMax はネイティブステレオ出力を案内しています。

最大の長さは?

公式資料では最大 15 秒です。

正確な timecode は必要?

台詞、音、転換を正確に合わせる場合に有効です。

Vogue AI で今使えますか?

まだです。ページと prompts は完成していますが API は未接続です。

weights は公開済み?

公開予定は発表されていますが、実際の weights と license を確認する必要があります。