Nouveau · 5–15 secondes · Jusqu’en 4K · Audio stéréo natif

MiniMax H3

Créez des vidéos de 5 à 15 secondes depuis du texte, des images de départ et de fin, ou des références image, vidéo et audio, jusqu’en 4K avec audio stéréo natif.

Utilisez un seul moteur MiniMax H3 pour le texte vers vidéo, l’image vers vidéo et les références vers vidéo. Choisissez durée et résolution, puis dirigez continuité, mouvement, caméra et son dans le même flux.

séquence de sauvetage MiniMax H3 avec gardienne de phare, tempête et dialogue stéréo natif
15s
2K16:9

Rendu MiniMax H3 réel

Elara traverse la tempête pour rallumer un phare et ramener un canot de sauvetage au port

Voir le rendu complet

Trois modes de création

Passez du texte vers vidéo à l’image vers vidéo ou aux références vers vidéo dans un seul moteur H3.

5–15 secondes jusqu’en 4K

Choisissez chaque seconde entière et générez en 768P, 2K ou 4K à 24 FPS.

Direction par références multimodales

Combinez images, vidéos et audios pour guider identité, jeu, mouvement et son.

Audio stéréo natif

Générez ambiance, effets, musique ou parole avec l’image dans le même rendu.

Prix de votre rendu MiniMax H3

Choisissez mode, durée, résolution et références, puis vérifiez le prix exact avant de générer.

Générer avec MiniMax H3

entryText

0,52 $US

audio incl.

imageProduction

1,69 $US

Populaire

audio incl.

referenceFinal

3,12 $US

audio incl.

fullImageReferenceSet

2,11 $US

audio incl.

Les cinq premières images de référence sont incluses ; chaque image supplémentaire ajoute le supplément affiché.

Rendus MiniMax H3 réels

Examinez des rendus MaxVideoAI qui testent continuité du personnage, direction caméra, contrôle par références et son synchronisé.

Continuité du personnage

Examinez visage, tenue et interprétation sur toute la séquence.

Direction caméra

Suivez cadrage, mouvement caméra et transitions d’un moment à l’autre.

Contrôle par références

Comparez identité, mouvement et son visés avec la vidéo finale.

Son stéréo natif

Évaluez timing du dialogue, ambiance et effets synchronisés.

Rendus de production réels

Chaque exemple de cette page est généré avec MaxVideoAI.

Vous partez d’une scène écrite ?

Utilisez le texte vers vidéo et choisissez Auto ou un ratio fixe pour créer un plan complet depuis un prompt.

Générer depuis du texte

Vous contrôlez le début et la fin ?

Animez une image de départ et ajoutez une image de fin optionnelle ; H3 suit automatiquement son cadrage.

Générer depuis des images

Vous dirigez un personnage récurrent ?

Utilisez les références pour attribuer des repères d’identité, de tenue, de mouvement et de voix.

Ouvrir Prompt Lab

Prompt Lab — MiniMax H3

Construisez le prompt en trois passes : définissez le jeu, dirigez les plans, puis verrouillez continuité et son.

Donnez à chaque plan une action visible, une instruction caméra et un événement sonore.

Source : Guide MiniMax H3

Une méthode centrée sur le personnage

Texte vers vidéo

Décrivez personnage, action, décor, caméra et son, puis choisissez un ratio fixe ou Auto.

Image vers vidéo

Importez une image de départ et éventuellement une image de fin ; la sortie suit le ratio de la source.

Références vers vidéo

Combinez jusqu’à 9 images, 3 vidéos et 3 audios, dans la limite de 12 références uniques.

Direction audio native

Écrivez directement dans le prompt les dialogues, ambiances et sons synchronisés.

Définir le personnage et l’action

Fixez identité, expression, langage corporel et changement visible.

Personnage :
[Apparence, tenue, expression et voix]

Décor :
[Lieu, heure, météo et repères visuels]

Action :
[Une action physique claire et sa réaction]

Son :
[Dialogue, ambiance et effets synchronisés]
EXEMPLE

Son : [Dialogue, ambiance et effets synchronisés]

Principes globaux

  • Placez personnage et action avant les adjectifs de style.
  • Reliez chaque mouvement caméra à un moment visible du récit.
  • Décrivez les sons au moment où leur cause apparaît à l’image.
  • Maintenez identité, tenue, lumière et direction de mouvement entre les plans.

Points moteur à surveiller

  • H3 réunit texte, images et références multimodales dans un seul modèle de production.
  • La direction multi-plan permet de construire une courte séquence plutôt qu’un mouvement isolé.
  • L’audio stéréo natif fait évoluer dialogue, ambiance et effets avec l’image.

Sauvetage par une gardienne de phare

Texte vers vidéo

Sujet: Elara, gardienne de phare en imperméable moutarde  •  Action: Gravit la tour, rallume la lentille et rappelle un canot au port
Caméra: Suivi extérieur à l’épaule, poursuite rapprochée dans l’escalier, orbite dans la lanterne et recul aérien  •  Style: Naturalisme cinématographique sous la tempête à l’heure bleue
Rendu 2K: Séquence multi-plan de 15 secondes en 2K avec dialogue stéréo natif

Voir le prompt complet
Créer un film cinématographique de 15 secondes en 16:9 avec continuité multi-plan native et son stéréo natif. Personnage fictif original : ELARA, gardienne de phare de 34 ans, peau olive marquée par le vent, cheveux noirs ondulés attachés, imperméable moutarde patiné, pull anthracite et bottes de mer. Conserver son visage, ses vêtements et ses proportions dans chaque plan. 0,0–3,5 s : extérieur large à l’heure bleue, phare en pierre sur une falaise atlantique battue par la tempête ; la pluie balaie l’image tandis qu’Elara court vers la tour avec une petite mallette de signalisation usée, caméra de suivi à l’épaule, tissu mouillé et appuis réalistes. 3,5–7,5 s : escalier en colimaçon intérieur, suivi rapproché pendant qu’elle monte rapidement, souffle visible, une main sur la rampe, lampes ambrées pratiques, aucune coupe qui rompe son identité. 7,5–11,5 s : lanterne, elle atteint les commandes et actionne le levier de secours ; orbite depuis son visage déterminé vers l’immense lentille de Fresnel qui s’allume. À 10,5 s, Elara dit clairement avec une synchronisation labiale naturelle : « Harbor light is alive. Bring them home. » 11,5–15,0 s : recul aérien extérieur, le faisceau de sauvetage balaie les vagues noires et révèle au loin un canot qui vire vers la sécurité. Audio : stéréo native uniquement — vent de tempête, pluie sur les vitres, bottes sur l’escalier métallique, respiration, choc du levier, montée électrique, mécanisme grave du phare, ressac et réplique exacte d’Elara. Sans musique, sous-titres, texte à l’écran, logo, filigrane, cadrage publicitaire beauté ni packshot produit. Peau et mouvements photoréalistes, mains cohérentes, contraste cinématographique retenu.
15s16:9Audio stéréo natif
séquence de sauvetage avec gardienne de phare MiniMax H3
15s16:9

Conseils et limites

Bonnes pratiques, corrections fréquentes et limites importantes pour obtenir de meilleurs résultats avec H3.

Ce qui marche le mieux

  • Décrivez le personnage, l’action, le décor, la caméra puis le son.
  • Associez une action visible et un mouvement de caméra à chaque plan.
  • Donnez à chaque référence un rôle précis : identité, mouvement, tenue ou voix.
  • Répétez uniquement les éléments de continuité indispensables à chaque plan.

Problèmes fréquents → solutions rapides

  • Résultat aléatoire / incohérent → simplifiez : sujet + action + caméra + lumière. Relancez 2–3 variantes.
  • Mouvement étrange → réduisez le mouvement : un seul move caméra, action plus lente, moins d’accessoires.
  • Le sujet dérive de la marque → partez d’une image de référence et verrouillez palette + lumière.
  • Texte incorrect → évitez la signalétique lisible, les micro‑labels, les petits UI. Gardez le texte hors champ.
  • Dialogue instable → gardez les répliques courtes et percutantes; évitez les longs monologues.

Limites à garder en tête

  • Output is short-form (5-15s). For longer edits, stitch multiple clips.
  • Resolution tops out at 768p / 2K / 4K for this tier.
  • No fixed seeds — iteration = re-run + refine.

Comparer H3 aux autres modèles vidéo IA

Ces comparaisons clarifient les arbitrages de prix, resolution, audio, vitesse et style motion pour choisir vite le bon moteur.

Chaque page inclut des rendus réels et des cas d’usage concrets.

H3 vs Kling 3.0 Omni Pro

Use Kling 3.0 Omni Pro for reference-guided Kling video, storyboard images, @Image prompt anchors, optional start/end frames, video-to-video, and native audio.

Comparer H3 vs Kling 3.0 Omni Pro →

H3 vs Google Veo 3.1

Generate cinematic Veo 3.1 videos with text prompts, start-image animation, multi-reference guidance, optional last-frame control, and extend workflows in one unified MaxVideoAI model page.

Comparer H3 vs Google Veo 3.1 →

Aperçu de MiniMax H3

Les limites qui structurent vos rendus.

Prix / seconde

768P 0,10 $US/s2K 0,17 $US/s4K 0,21 $US/s

Texte→Vidéo

Pris en charge

Image→Vidéo

Pris en charge

Vidéo→Vidéo

Supported as a reference-to-video input

Première / dernière image

Pris en charge (start image + optional end image)

Image de départ / référence

Up to 9 image references

Vidéo de référence

Up to 3 video references; 2-15s each and 15s combined

Résolution max

768p / 2K / 4K

Durée max

5-15s

Formats

Auto / 21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16

Options FPS

24 fps

Format de sortie

MP4

Sortie audio

Native stereo audio

Audio natif

Pris en charge

Synchronisation labiale

Pris en charge

Contrôle caméra / mouvement

Prompt-based camera and multi-shot control

Filigrane

Non (MaxVideoAI)

Date de sortie

Jul 2026

Aperçu de MiniMax H3

Détails
  • Durée: Chaque seconde entière de 5 à 15 secondes
  • Sortie: 768P, 2K ou 4K · Auto, 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16 · 24 FPS
  • Texte et images: Texte vers vidéo, ou image de départ avec image de fin optionnelle
  • Mode références: Jusqu’à 9 images, 3 vidéos et 3 audios, pour 12 références uniques au total
  • Audio: Audio stéréo natif généré avec chaque vidéo

Sécurité, personnes et droit à l'image

Garde-fous intégrés et bonnes pratiques pour créer responsablement avec H3.

  • Utilisez des personnages originaux et des références que vous possédez.
  • Évitez les personnes réelles, célébrités et personnages protégés.
  • N'utilisez pas la ressemblance d'une personne sans consentement.
  • Évitez les franchises, logos et propriétés intellectuelles protégées.

FAQ

Quelles entrées MiniMax H3 accepte-t-il ?

Utilisez un prompt texte, une image de départ avec une image de fin optionnelle, ou un ensemble de références image, vidéo et audio. Une référence audio doit être accompagnée d’au moins une image ou une vidéo.

Quelles durées et résolutions sont disponibles ?

Choisissez chaque seconde entière de 5 à 15 secondes et générez en 768P, 2K ou 4K à 24 FPS.

Combien de références H3 peut-il utiliser ?

Le mode références accepte jusqu’à 9 images, 3 vidéos et 3 audios, sans dépasser 12 références uniques par requête.

MiniMax H3 génère-t-il l’audio ?

Oui. H3 produit un audio stéréo natif avec la vidéo, sans interrupteur audio séparé.

Puis-je générer avec MiniMax H3 depuis cette page ?

Oui. MiniMax H3 est disponible dans MaxVideoAI et le prix exact est affiché avant chaque rendu.