Retour au blog
TutorielPublié 31 juil. 202612 min de lecture

Guide des prompts MiniMax H3 : modes, formule et exemples

Guide pratique pour text-to-video, première/dernière image, Omni Reference, son natif et briefs de 15 secondes.

Par Vogue AI TeamMis à jour 31 juil. 2026
Dans cet article

Les prompts MiniMax H3 fonctionnent comme de courts plans de production : choisissez le mode, attribuez un rôle à chaque référence, décrivez le changement dans le temps et verrouillez les détails critiques.

TL;DR : traitez le prompt H3 comme un brief minuté

  • H3 réunit texte, image, vidéo et audio pour produire jusqu’à 15 secondes en 2K avec son stéréo natif.
  • Choisissez text-to-video, première/dernière image ou Omni Reference avant d’écrire la scène.
  • Donnez à chaque média un seul rôle clair.
  • Écrivez état initial, évolution, caméra, son, verrous de cohérence et fin.
  • La page et les prompts Vogue AI sont prêts, mais la génération attend encore l’intégration API.

Ce que MiniMax H3 change dans le prompting vidéo

Le changement principal dépasse la résolution : le prompt devient une couche de direction pour plusieurs médias réunis dans un même contexte.

Visuel original Vogue AI du workflow multimodal MiniMax H3
Ce visuel détenu par Vogue AI relie texte, image, vidéo et son dans une même production. Il montre l’utilité des rôles, du minutage, des verrous de cohérence et de la direction audio.

Choisir d’abord le mode de génération H3

L’API officielle regroupe text-to-video, animation première/dernière image et génération par références. Les rôles reference ne se mélangent pas avec les rôles first_frame ou last_frame.

ModeEntréeÀ choisir pourPremier risque
Texte vers vidéoPromptConcepts, spots sociaux, ambiance et étude du mouvementUne description imprécise fait dériver la scène.
Première / dernière imagePrompt + une ou deux imagesAnimer une image ou contrôler la composition finaleDes règles de changement vagues contredisent l’image fournie.
Omni ReferencePrompt + images, vidéo et/ou audioContrôler identité, produit, mouvement, caméra, voix ou rythmeDes médias non étiquetés créent des consignes contradictoires.
Montage vidéoPrompt + vidéo de référenceTransfert de mouvement ou régénération cibléeTrop de changements simultanés affaiblissent la continuité.

Matrice : relier le prompt au travail de production

TâcheStructure du promptPlan de référencesPremier défaut à vérifier
Publicité produitOuverture → révélation → détail-preuve → plan finalImage produit + mouvement ou musique en optionForme, zone d’étiquette, mains et silhouette
Court métrageIdentité → plans minutés → jeu → repères sonoresPersonnages + lieu + voix ou caméra en optionIdentité, regards, timing du dialogue et continuité
Clip musicalPrémisse → changements de beat → artiste verrouillé → finalPiste + image ou vidéo du personnageRelation son-image, rythme, lèvres et tenue
Publicité UGCAction → bénéfice parlé → usage → plan finalProduit et créateur si la précision compteTexture de peau, contact produit, doigts et faux texte

Awesome prompts MiniMax H3 à copier

Ces modèles sont des adaptations originales de structures observées dans des exemples H3 publics sur X. Gardez la logique, remplacez les actifs et supprimez le superflu.

Planche originale Vogue AI pour les prompts MiniMax H3
Cette planche détenue par Vogue AI rapproche trois tâches : géométrie produit, mouvement du tissu et continuité de l’interface.
  • Campagne mode : créez un film photoréaliste de luxe de 12 secondes en 16:9. Une mannequin traverse une piste désertique minimaliste au coucher du soleil. Enchaînez plan aérien, travelling latéral, orbite retenue, macro du tissu et plan final. Préservez le visage, la construction de la robe et le poids crédible du tissu. Évitez scintillement, déformation, membres en trop, changement de tenue et texte.
  • UGC vertical : créez une vidéo soin 9:16 tournée comme au smartphone dans une salle de bain lumineuse. La créatrice montre un sérum, exprime un bénéfice, l’applique et réagit naturellement. Gardez texture de peau, regard, gestes, lumière matinale et forme du flacon. Aucun filtre beauté, doigt en trop, produit flottant, sous-titre généré ou filigrane.
  • Comédie image-vers-vidéo : utilisez l’image fournie comme première image exacte. Réalisez 15 secondes de comédie familiale des années 1980 avec costumes de robots pratiques et texture 35 mm. Le groupe regarde vers le haut puis fête bruyamment pendant qu’un robot danse maladroitement. Préservez personnes, costumes, texte et composition. Pas d’aspect CGI, de nouveaux personnages ni de vêtements modernes.

Anatomie d’un prompt H3

Un prompt robuste combine mode, rôles des médias, chronologie, caméra, son, verrous de cohérence et contraintes négatives.

  • Mode : texte vers vidéo, première/dernière image ou Omni Reference.
  • Rôles : ce que contrôle chaque image, vidéo ou piste audio.
  • Chronologie : évolution de l’état initial à l’état final.
  • Caméra : cadrage, mouvement, logique de coupe et stabilité.
  • Son : dialogue, ambiance, effets, musique et silence.
  • Verrous : identité, géométrie, tenue, direction spatiale et texte.
  • Contraintes négatives : seulement les défauts qui rendent le résultat inutilisable.

Exemple complet : film produit de 12 secondes

L’exemple protège d’abord la géométrie du casque, puis ajoute interaction humaine, caméra et son.

Demande brute

Créer un film produit de 12 secondes pour un casque circum-aural argenté. Sa forme doit rester exacte, une interaction humaine est requise et le dernier plan doit laisser de la place au texte de marque.

Version 1 du prompt

  • Utilisez l’image 1 comme référence exacte de design et de matière du casque. Créez un film premium de 12 secondes dans un studio graphite. 0–3 s : macro fixe de l’oreillette en métal sous une lumière douce. 3–7 s : une main soulève le casque ; conservez charnière et épaisseur des coussinets. 7–10 s : profil du modèle qui le met, avec contact et cheveux naturels. 10–12 s : plan final aux trois quarts sur socle, espace vide à gauche. Son : contact métallique discret, compression du coussinet, ambiance basse et une note grave. Aucun morphing, doigt en trop, texte inventé, changement de matière ou tremblement.

Que modifier après le premier rendu

Corrigez le premier défaut de production au lieu de réécrire tout le prompt : géométrie, identité, mouvement, montage, puis son.

  • Si le produit change, renforcez le rôle de la référence et retirez les mots de style inutiles.
  • Si l’action manque de force, décrivez une cause et son effet au lieu d’ajouter des adjectifs.
  • Si le montage paraît chaotique, réduisez les plans et donnez plus de temps à l’action principale.
  • Si le son est générique, liez chaque son important à une action visible.

Erreurs MiniMax H3 et corrections

ProblèmeCorrectionÀ éviter
Références contradictoiresAttribuer un rôle explicite à chaque média.Appeler chaque fichier référence principale.
Dérive de l’identité ou du produitPlacer le verrou dans la première phrase.Ajouter des adjectifs cinématographiques.
Trop de plansRéduire les beats et préciser leur durée.Faire tenir une publicité entière dans chaque seconde.
Son sans rapport avec l’imageRelier le son aux actions visibles et garder du silence utile.Empiler musique, voix et effets sans lien.
Texte généré illisibleRéserver une zone vide et ajouter la typographie après.Exiger plusieurs logos parfaits.
Mouvement aléatoireÉcrire état initial, changement, cause et fin.Décrire seulement le style visuel.

Place de H3 dans le workflow Vogue AI

Vogue AI prépare déjà les personnages, produits, styles et images d’ouverture. La génération H3 sera activée après intégration, crédits, stockage, callbacks et QA.

Checklist avant génération

  • Le mode correspond aux médias.
  • Chaque actif possède un rôle.
  • La transformation et la fin sont explicites.
  • Caméra et son servent le beat.
  • Identité et géométrie sont verrouillées.
  • La liste négative reste courte.

FAQ

Qu’est-ce que MiniMax H3 ?

Un modèle vidéo multimodal généraliste pour génération, création par références et montage.

Quels fichiers peut-on fournir ?

Texte, images, vidéos et audio dans les limites de l’API officielle.

H3 génère-t-il le son ?

Oui, MiniMax annonce une sortie stéréo native avec dialogue, ambiance, effets et musique.

Quelle durée maximale ?

La documentation annonce jusqu’à 15 secondes.

Faut-il écrire des timecodes ?

Oui pour les dialogues, révélations ou sons précis ; sinon une structure début-milieu-fin suffit.

H3 fonctionne-t-il déjà dans Vogue AI ?

Non. La page et les prompts sont disponibles, mais pas encore la génération.

Les poids sont-ils disponibles ?

Ils sont annoncés, mais il faut attendre la publication réelle des poids et de la licence.