Guide Grok pour la conversion d'image en vidéo : prompts, contrôle du mouvement et questions fréquentes
Animation d'image en vidéo à partir d'images que vous avez déjà validées. C'est à la fois son avantage et sa limite. L'image verrouille la composition d'ouverture, mais le modèle doit encore déduire la profondeur, les parties cachées du corps, le comportement des objets, le timing et ce qui devrait se passer ensuite.
De bons résultats commencent donc avant le téléchargement. Choisissez une image qui semble pouvoir bouger de manière plausible, définissez un petit rythme de performance, et rédigez le prompt comme une instruction pour les secondes à venir — et non comme une description secondaire de l'image.
Ce guide reflète la documentation officielle de xAI en date du 18 septembre 2026. Les mesures de contrôle des produits et les limitations des programmes destinés aux consommateurs sont susceptibles d'être modifiées.
Présentation de la fonctionnalité de conversion d'image en vidéo de Grok
Dans le mode standard de conversion image en vidéo, l'image d'entrée est fixée comme image de départ. Les mots-clés décrivent le mouvement ultérieur. La documentation actuelle de xAI sur Grok Imagine Video 1.5 décrit également la conversion avec référence, l'audio de référence optionnel, le flux de travail avec image de début et de fin, l'édition, l'extension et la prise en charge native de la 1080p pour les demandes de conversion image en vidéo.
Les différences sont importantes :
- Image de départ : Détermine la première image précise.
- Image de référence : Guide l'identité, l'apparence ou le style, mais ne devient pas nécessairement la première image.
- Dernière image : Définit la position que le mouvement doit atteindre.
- Demande d'édition : Modifier une vidéo existante plutôt que d'ajouter des effets d'animation à une image statique.
Veuillez consulter le guide officiel de génération vidéo xAI pour connaître les champs actuels de l'API et les combinaisons prises en charge.
Première étape : choisir une image capable de résister à l'épreuve du mouvement
La meilleure image source n'est pas toujours l'illustration la plus dramatique, mais la trame qui contient les informations spatiales les plus claires.
Préféré :
- Un thème dominant ;
- mains et membres clairement distincts ;
- Séparation nette entre le sujet et l'arrière-plan ;
- un visage suffisamment grand pour être sauvegardé ;
- Éclairage uniforme ;
- Pièces autour de la direction du mouvement ;
- Aucun texte ou filigrane inattendu ;
- Une composition qui pourrait servir d'ouverture de plan.
À traiter avec prudence :
- Croiser les mains pour cacher le visage ;
- Les cheveux couvrent les yeux ;
- Lorsque le personnage doit marcher, ses pieds sont coupés ;
- Foule complexe ;
- Afficher le reflet de la deuxième version du sujet principal ;
- Raccourcissement de perspective extrême ;
- Accessoires minuscules nécessitant un contact précis des doigts ;
- Les lignes de vitesse déjà tracées entrent en conflit avec la nouvelle action.
Si l'image a été créée par un générateur d'images IA, corrigez les principales erreurs anatomiques, vestimentaires et d'objets avant l'animation. La vidéo ne peut pas réparer de manière fiable une image de référence médiocre.
Étape 2 : Décider ce qui peut être modifié
Divisez l'écran en trois catégories :
Verrouillé
Les détails qui doivent rester stables, comme le visage, les cheveux, l'uniforme, les étiquettes de produits, les accessoires clés ou l'agencement de la pièce.
Mobile
Principales performances : se retourner, lever la tête, faire un pas, lever la main, ouvrir la porte ou réagir.
Réponse
Mouvements secondaires provoqués par l'action : chute des cheveux, tissu flottant par inertie, variations de lumière, poussière soulevée, feuillage agité, ou reflets changeants.
Cela générera une instruction de direction claire :
Verrouillage : visage, cheveux courts blancs, manteau bleu, pendentif argenté, bâtiment de la gare.
Mouvement : Elle regarda le train qui arrivait et recula d’un pas.
Les pans du vêtement et les cheveux défaits flottent dans le courant d'air du train.
Troisième étape : Rédiger des prompts axés sur l'action
Évitez de répéter les détails déjà visibles, sauf s'ils sont des points d'ancrage identitaires. Partez de l'état actuel et décrivez ce qui a changé.
Faible :
Belle fille d'anime, cheveux argentés, manteau bleu, cinématographique, chef-d'œuvre, action époustouflante.
Réalisateur :
Elle a remarqué l'agitation à l'extérieur du quai, d'abord en tournant son regard, puis en se retournant lentement.
La tête légèrement relevée à environ trente degrés. Sa main droite serre fermement la bandoulière du sac. Un train passe.
Sous l'ourlet de son manteau et entre ses mèches de cheveux lâches, une brève ondulation se soulève. Un plan moyen verrouille l'objectif, avec une subtile
Poussée à la dernière seconde. Conservez son visage, sa coiffure, son manteau, son pendentif et l'arrière-plan.
Architecture. Un plan-séquence, sans nouveau personnage, sans changement de décor.
La deuxième version définit la performance, la séquence, l’appareil photo, la réponse physique et la continuité.
Étape 4 : Séparer le langage de la caméra du mouvement du sujet
Utilisez des commandes de caméra reconnaissables :
- Verrouiller la caméra ;
- Progression lente ;
- Tirer lentement en arrière ;
- Suivi horizontal ;
- Orbite douces ;
- incliné vers le haut ;
- Micro-interrupteur portatif ;
- Effectuer une transition de mise au point entre les sujets nommés.
En général, un seul mouvement de caméra suffit. Combiner travelling, zoom, grue, tremblement et panoramique rapide peut forcer le modèle à réinterpréter l'ensemble du plan.
Pour maintenir la cohérence du personnage, commencez par verrouiller la caméra. Une fois que la performance est correcte, testez une version subtile de la caméra.
Étape 5 : Remplacer l'accumulation d'adjectifs par un sens du temps
Organiser la séquence des actions avec un rythme simple :
Les deux premières secondes : il reste immobile, écoute.
Plan moyen : Il lève la lanterne à hauteur d'épaule.
Les deux dernières secondes : la lumière chaude illumine le passage ; il a figé la dernière posture.
Le timing rend le « dramatique » mesurable, tout en créant une image finale stable pour le montage.
Six modèles de prompt adaptables
Portrait subtil
Elle respire naturellement, cligne une fois des yeux, et déplace son regard de la fenêtre vers l'objectif.
Les cheveux dénoués réagissent légèrement au flux d'air intérieur. Verrouillage à courte distance, lumière douce et continue,
Conserver la structure du visage et les boucles d'oreilles, sans parole, sans changement de scène.
Préparation à l'action animée
Il abaisse son centre de gravité, dégaine son épée à moitié, puis s'arrête avant d'attaquer.
Le manteau suit les mouvements du corps, avec un effet de retard crédible. Lent panoramique latéral, sobre et retenu.
Particules d'énergie derrière la lame, conservant la forme du visage, des vêtements, des armes et de l'environnement.
Révélation du produit
La caméra effectue un mouvement en arc de cercle lent dans le sens horaire autour du produit, tandis que l'objet reste fixe.
Un étroit reflet lumineux se déplace le long du bord métallique. Conserver le texte des étiquettes et les formes géométriques.
Arrière-plan de studio propre, sans mains, sans déformation, sans ajout d'objets supplémentaires.
Objectif environnemental
Le brouillard matinal traverse lentement les arbres existants. L'enseigne suspendue dans différents
Tarif calculé en fonction de la distance. La caméra avance le long d'un chemin dégagé. Maintenir
Agencement architectural et combinaison de couleurs. Aucun personnage n’apparaît dans l’image.
Réaction de dialogue sans génération vocale
Elle écoute quelqu'un hors-champ, baisse brièvement la tête, puis acquiesce à contrecœur d'un léger signe.
Respiration naturelle, mouvement des épaules minimal. Cadrage moyen rapproché, en conservant le visage et
Ton de pièce uniforme et silencieux, sans mouvement des lèvres et sans coupure.
Transition de la première à la dernière image
Déplacez-vous du cadre de départ fourni vers le cadre final fourni par un virage naturel.
Le personnage contourne la table au lieu de la traverser. Garde le costume,
Maintenez la cohérence de la géométrie du visage, de la surface du bureau, de la direction de l'éclairage et de l'orientation de l'écran tout au long du processus.
Le dernier mode dépend des contrôles décrits dans la documentation actuelle de l'API xAI ; il peut ne pas apparaître exactement de la même manière dans chaque interface de consommateur.
Diagnostiquer les défauts avant de régénérer
Dérive d'identité
Les causes possibles incluent un visage trop petit, une rotation trop importante, une occlusion, des changements de lumière ou trop de mouvements. Veuillez utiliser une source plus nette, des mouvements plus réduits, une durée plus courte et moins d'effets de synchronisation.
Mouvements corporels caoutchouteux
L'action demandée peut nécessiter des structures anatomiques cachées non visibles dans l'image. Veuillez sélectionner une source où l'articulation est visible, ou modifiez le plan pour un plan rapproché du rythme de la performance.
Zoom inutile
"Verrouiller le plan, composition fixe." Supprimez les termes cinématographiques suggérant un mouvement et précisez que seule la partie spécifiée du sujet se déplace.
Action trop faible
Remplacez « animation subtile » par une séquence et une distance : deux pas, main levée à hauteur d’épaule, rotation de la tête de trente degrés, ou mouvement du rideau une fois après l’ouverture de la porte.
Fond qui fond ou qui change
Réduire la parallaxe de la caméra et les mouvements à grande échelle. Préserver clairement la structure du bâtiment. Les arrière-plans complexes peuvent nécessiter d'être séparés dans un autre plan.
Échec de la main ou de l’accessoire
Évitez les opérations complexes en une seule génération. Commencez avant le contact, terminez après le contact, ou alternez entre les réglages et les résultats. Donnez aux objets une forme claire dans l'image source.
Fin impossible de se connecter à un autre objectif
Garder le personnage dans une pose finale stable et maintenir l'orientation de l'écran. Concevoir le plan suivant avant de générer le plan actuel.
Cohérence des personnages à travers plusieurs segments
L'image vers la vidéo conserve le cadre d'ouverture, et non l'intégralité de la bible de production. Pour une séquence :
- Approuver une référence de caractère normative ;
- Conserver une langue d'identité fixe ;
- Générer chaque image de départ à partir de la même référence approuvée ;
- Tenir un registre des placards et des accessoires ;
- Planifier l'orientation de l'écran et le cadrage des plans ;
- Animer un seul plan à la fois ;
- Comparez chaque résultat avec le tableau de référence, et non seulement avec les fragments générés précédemment.
Si vous devez créer une image statique au même endroit et lui ajouter des effets d'animation, Elser AI intègre la génération d'images orientée anime, la conception de personnages, les flux de travail de manga et les fonctionnalités d'animation d'images. Son animateur d'images permet de télécharger ou de générer des images, puis d'utiliser des options de modèle et de caméra pour guider le mouvement. Ce flux de travail est particulièrement utile lorsque l'image statique elle-même doit être modifiée avant d'être animée.
Coût et stratégie de sélection
L'API xAI facture en fonction de la durée de génération et de la résolution, plus les entrées médias prises en charge. Les tarifs officiels actuels listent différents taux par seconde pour les résolutions 480p, 720p et 1080p. La version grand public de Grok utilise des quotas de forfait, et non le barème de prix de l'API.
Rédaction efficace :
- Tester un plan représentatif ;
- Utiliser la résolution de brouillon minimale acceptable ;
- Gardez la durée courte ;
- Évitez de modifier cinq variables en même temps ;
- Approuver la motion avant de générer la résolution finale ;
- Enregistrez les invites et les paramètres de chaque segment accepté.
Veuillez consulter la tarification de l'API xAI pour connaître les tarifs actuels, plutôt que de vous fier à des articles en cache.
Foire aux questions
Est-ce que Grok utilisera l'image que je télécharge comme première image ?
Dans le mode standard de conversion d'image en vidéo, oui. La conversion par référence est différente : l'image de référence peut guider l'identité ou l'apparence, sans nécessairement servir d'image de départ.
Devrais-je décrire à nouveau cette image ?
Ne décrivez que les détails qui doivent rester stables. Utilisez la majeure partie de l’indice pour les actions, les plans, le temps, les réactions environnementales et les contraintes.
Grok peut-il utiliser la première et la dernière image ?
La documentation actuelle de l'API Grok Imagine Video 1.5 inclut une option last_frame et prend en charge la combinaison de la fixation simultanée de la première et de la dernière image. La disponibilité de l'interface peut varier.
Grok peut-il générer des vidéos à partir d'images avec audio ?
La documentation actuelle de l'API décrit l'audio généré et les voix prédéfinies prises en charge. Vous pouvez également demander une sortie silencieuse dans l'API. Veuillez consulter l'interface consommateur active pour connaître ses fonctionnalités de contrôle audio disponibles.
Pourquoi les personnages immobiles changent-ils dans l'animation ?
Le modèle doit inférer les vues non vues et les structures anatomiques de transition. Les mouvements importants, les occlusions, les lumières complexes ou les sources floues rendent cette inférence plus difficile.
Puis-je animer des œuvres d'art protégées par le droit d'auteur ?
Les compétences techniques ne sont pas synonymes d'autorisation. Veuillez utiliser des images que vous possédez ou dont vous avez le droit de modifier, et vérifiez les conditions de la plateforme ainsi que les lois applicables avant de publier ou de commercialiser vos résultats.
Conclusion
La fonction de conversion d'image en vidéo de Grok fonctionne mieux lorsque l'identité et la composition sont déjà résolues dans l'image statique. Fournissez au modèle un rythme de performance, une idée de plan, quelques points d'ancrage de continuité et un point d'atterrissage stable. Lorsque le résultat échoue, diagnostiquez si le problème provient de l'image source, de l'action, du plan, du temps ou du contact — et non d'un manque de mots-clés décoratifs.




