Les prompts MiniMax H3 fonctionnent comme de courts plans de production : choisissez le mode, attribuez un rôle à chaque référence, décrivez le changement dans le temps et verrouillez les détails critiques.
TL;DR : traitez le prompt H3 comme un brief minuté
- H3 réunit texte, image, vidéo et audio pour produire jusqu’à 15 secondes en 2K avec son stéréo natif.
- Choisissez text-to-video, première/dernière image ou Omni Reference avant d’écrire la scène.
- Donnez à chaque média un seul rôle clair.
- Écrivez état initial, évolution, caméra, son, verrous de cohérence et fin.
- La page et les prompts Vogue AI sont prêts, mais la génération attend encore l’intégration API.
Ce que MiniMax H3 change dans le prompting vidéo
Le changement principal dépasse la résolution : le prompt devient une couche de direction pour plusieurs médias réunis dans un même contexte.

Choisir d’abord le mode de génération H3
L’API officielle regroupe text-to-video, animation première/dernière image et génération par références. Les rôles reference ne se mélangent pas avec les rôles first_frame ou last_frame.
| Mode | Entrée | À choisir pour | Premier risque |
|---|---|---|---|
| Texte vers vidéo | Prompt | Concepts, spots sociaux, ambiance et étude du mouvement | Une description imprécise fait dériver la scène. |
| Première / dernière image | Prompt + une ou deux images | Animer une image ou contrôler la composition finale | Des règles de changement vagues contredisent l’image fournie. |
| Omni Reference | Prompt + images, vidéo et/ou audio | Contrôler identité, produit, mouvement, caméra, voix ou rythme | Des médias non étiquetés créent des consignes contradictoires. |
| Montage vidéo | Prompt + vidéo de référence | Transfert de mouvement ou régénération ciblée | Trop de changements simultanés affaiblissent la continuité. |
Matrice : relier le prompt au travail de production
| Tâche | Structure du prompt | Plan de références | Premier défaut à vérifier |
|---|---|---|---|
| Publicité produit | Ouverture → révélation → détail-preuve → plan final | Image produit + mouvement ou musique en option | Forme, zone d’étiquette, mains et silhouette |
| Court métrage | Identité → plans minutés → jeu → repères sonores | Personnages + lieu + voix ou caméra en option | Identité, regards, timing du dialogue et continuité |
| Clip musical | Prémisse → changements de beat → artiste verrouillé → final | Piste + image ou vidéo du personnage | Relation son-image, rythme, lèvres et tenue |
| Publicité UGC | Action → bénéfice parlé → usage → plan final | Produit et créateur si la précision compte | Texture de peau, contact produit, doigts et faux texte |
Awesome prompts MiniMax H3 à copier
Ces modèles sont des adaptations originales de structures observées dans des exemples H3 publics sur X. Gardez la logique, remplacez les actifs et supprimez le superflu.

- Campagne mode : créez un film photoréaliste de luxe de 12 secondes en 16:9. Une mannequin traverse une piste désertique minimaliste au coucher du soleil. Enchaînez plan aérien, travelling latéral, orbite retenue, macro du tissu et plan final. Préservez le visage, la construction de la robe et le poids crédible du tissu. Évitez scintillement, déformation, membres en trop, changement de tenue et texte.
- UGC vertical : créez une vidéo soin 9:16 tournée comme au smartphone dans une salle de bain lumineuse. La créatrice montre un sérum, exprime un bénéfice, l’applique et réagit naturellement. Gardez texture de peau, regard, gestes, lumière matinale et forme du flacon. Aucun filtre beauté, doigt en trop, produit flottant, sous-titre généré ou filigrane.
- Comédie image-vers-vidéo : utilisez l’image fournie comme première image exacte. Réalisez 15 secondes de comédie familiale des années 1980 avec costumes de robots pratiques et texture 35 mm. Le groupe regarde vers le haut puis fête bruyamment pendant qu’un robot danse maladroitement. Préservez personnes, costumes, texte et composition. Pas d’aspect CGI, de nouveaux personnages ni de vêtements modernes.
Anatomie d’un prompt H3
Un prompt robuste combine mode, rôles des médias, chronologie, caméra, son, verrous de cohérence et contraintes négatives.
- Mode : texte vers vidéo, première/dernière image ou Omni Reference.
- Rôles : ce que contrôle chaque image, vidéo ou piste audio.
- Chronologie : évolution de l’état initial à l’état final.
- Caméra : cadrage, mouvement, logique de coupe et stabilité.
- Son : dialogue, ambiance, effets, musique et silence.
- Verrous : identité, géométrie, tenue, direction spatiale et texte.
- Contraintes négatives : seulement les défauts qui rendent le résultat inutilisable.
Exemple complet : film produit de 12 secondes
L’exemple protège d’abord la géométrie du casque, puis ajoute interaction humaine, caméra et son.
Demande brute
Créer un film produit de 12 secondes pour un casque circum-aural argenté. Sa forme doit rester exacte, une interaction humaine est requise et le dernier plan doit laisser de la place au texte de marque.
Version 1 du prompt
- Utilisez l’image 1 comme référence exacte de design et de matière du casque. Créez un film premium de 12 secondes dans un studio graphite. 0–3 s : macro fixe de l’oreillette en métal sous une lumière douce. 3–7 s : une main soulève le casque ; conservez charnière et épaisseur des coussinets. 7–10 s : profil du modèle qui le met, avec contact et cheveux naturels. 10–12 s : plan final aux trois quarts sur socle, espace vide à gauche. Son : contact métallique discret, compression du coussinet, ambiance basse et une note grave. Aucun morphing, doigt en trop, texte inventé, changement de matière ou tremblement.
Que modifier après le premier rendu
Corrigez le premier défaut de production au lieu de réécrire tout le prompt : géométrie, identité, mouvement, montage, puis son.
- Si le produit change, renforcez le rôle de la référence et retirez les mots de style inutiles.
- Si l’action manque de force, décrivez une cause et son effet au lieu d’ajouter des adjectifs.
- Si le montage paraît chaotique, réduisez les plans et donnez plus de temps à l’action principale.
- Si le son est générique, liez chaque son important à une action visible.
Erreurs MiniMax H3 et corrections
| Problème | Correction | À éviter |
|---|---|---|
| Références contradictoires | Attribuer un rôle explicite à chaque média. | Appeler chaque fichier référence principale. |
| Dérive de l’identité ou du produit | Placer le verrou dans la première phrase. | Ajouter des adjectifs cinématographiques. |
| Trop de plans | Réduire les beats et préciser leur durée. | Faire tenir une publicité entière dans chaque seconde. |
| Son sans rapport avec l’image | Relier le son aux actions visibles et garder du silence utile. | Empiler musique, voix et effets sans lien. |
| Texte généré illisible | Réserver une zone vide et ajouter la typographie après. | Exiger plusieurs logos parfaits. |
| Mouvement aléatoire | Écrire état initial, changement, cause et fin. | Décrire seulement le style visuel. |
Place de H3 dans le workflow Vogue AI
Vogue AI prépare déjà les personnages, produits, styles et images d’ouverture. La génération H3 sera activée après intégration, crédits, stockage, callbacks et QA.
Checklist avant génération
- Le mode correspond aux médias.
- Chaque actif possède un rôle.
- La transformation et la fin sont explicites.
- Caméra et son servent le beat.
- Identité et géométrie sont verrouillées.
- La liste négative reste courte.
FAQ
Qu’est-ce que MiniMax H3 ?
Un modèle vidéo multimodal généraliste pour génération, création par références et montage.
Quels fichiers peut-on fournir ?
Texte, images, vidéos et audio dans les limites de l’API officielle.
H3 génère-t-il le son ?
Oui, MiniMax annonce une sortie stéréo native avec dialogue, ambiance, effets et musique.
Quelle durée maximale ?
La documentation annonce jusqu’à 15 secondes.
Faut-il écrire des timecodes ?
Oui pour les dialogues, révélations ou sons précis ; sinon une structure début-milieu-fin suffit.
H3 fonctionne-t-il déjà dans Vogue AI ?
Non. La page et les prompts sont disponibles, mais pas encore la génération.
Les poids sont-ils disponibles ?
Ils sont annoncés, mais il faut attendre la publication réelle des poids et de la licence.