Grok Bild-zu-Video-Leitfaden: Prompt, Bewegungssteuerung und häufige Fragen
Bild-zu-Video beginnt mit einem Bild, das du bereits gut findest. Das ist sein Vorteil, aber auch seine Einschränkung. Das Bild legt die Anfangskomposition fest, aber das Modell muss trotzdem Tiefe, versteckte Körperteile, das Verhalten von Objekten, den zeitlichen Ablauf und das, was als Nächstes passieren soll, ableiten.
Gute Ergebnisse beginnen daher bereits vor dem Hochladen. Wählen Sie ein Bild, das sich plausibel bewegen lässt, definieren Sie einen kleinen Performance-Rhythmus und formulieren Sie den Prompt als Anweisung für die nächsten Sekunden – nicht als nachträgliche Beschreibung des Bildes.
Diese Anleitung spiegelt die offizielle xAI-Dokumentation vom 18. September 2026 wider. Produktkontrollmaßnahmen und Verbraucherplanbeschränkungen können sich ändern.
Einführung in die Grok-Bild-zu-Video-Funktion
Im Standardmodus für Bild-zu-Video wird das Eingabebild als Startbild festgelegt. Der Prompt beschreibt die nachfolgende Bewegung. Die aktuellen xAI-Dokumente zu Grok Imagine Video 1.5 beschreiben außerdem Referenz-zu-Video, optionales Referenzaudio, Arbeitsabläufe mit Start- und Endbild, Bearbeitung, Erweiterung sowie native 1080p-Unterstützung für Bild-zu-Video-Anfragen.
Unterschiede sind wichtig:
- Startbild: Legt den genauen ersten Frame fest.
- Referenzbild: Leitet Identität, Aussehen oder Stil, wird aber nicht zwangsläufig zum ersten Bild.
- Letzter Frame: Definiert die Position, die die Bewegung erreichen muss.
- Bearbeitungsanfrage: Ändern Sie ein vorhandenes Video, anstatt einer statischen Bildanimation hinzuzufügen.
Bitte lesen Sie den offiziellen xAI-Videogenerierungsleitfaden, um die aktuellen API-Felder und unterstützten Kombinationen zu erfahren.
Schritt 1: Wählen Sie ein Bild aus, das Bewegungen standhält
Das beste Quellbild ist nicht immer die dramatischste Illustration, sondern der Frame mit den klarsten räumlichen Informationen.
Bevorzugt:
- Ein dominantes Thema;
- klar erkennbare Hände und Gliedmaßen;
- Klare Trennung zwischen Vordergrund und Hintergrund;
- Ein ausreichend großes Gesicht zum Speichern;
- Einheitliche Beleuchtung;
- Räume um die Bewegungsrichtung;
- Kein unerwarteter Text oder Wasserzeichen;
- Eine Komposition, die möglicherweise als Beginn einer Szene dient.
Vorsicht walten lassen:
- Beide Hände über das Gesicht kreuzen;
- Die Haare bedecken die Augen;
- Wenn die Figur gehen muss, werden die Füße abgeschnitten;
- Komplexe Menschenmenge;
- Zeige den zweiten Versionsschatten des Hauptteils;
- Extreme perspektivische Verkürzung;
- Kleine Requisiten, die präzisen Fingerkontakt erfordern;
- Die bereits gezeichneten Geschwindigkeitslinien stehen im Konflikt mit der neuen Aktion.
Wenn das Bild von einem KI-Bildgenerator erstellt wurde, korrigieren Sie vor der Animation die wichtigsten anatomischen, kleidungsbezogenen und objektbezogenen Fehler. Ein Video kann einen schlechten Referenzrahmen nicht zuverlässig reparieren.
Schritt 2: Entscheiden, welche Änderungen erlaubt sind
Teilen Sie das Bild in drei Kategorien:
已锁定
Muss stabile Details wie Gesicht, Haare, Uniform, Produktetiketten, wichtige Requisiten oder Raumaufteilung beibehalten.
Mobil
Hauptleistungen: Drehen, Kopf heben, Schritt machen, Hand heben, Tür öffnen oder reagieren.
Antwort
Sekundäre Bewegungen durch Aktion: herabfallendes Haar, im Trägheitsmoment wehendes Tuch, Lichtveränderungen, aufwirbelnder Staub, schwankende Blätter oder sich verändernde Spiegelungen.
Dies erzeugt eine klare Richtungsangabe:
Gesicht fixiert, kurze weiße Haare, blaue Jacke, silberner Anhänger, Bahnhofsgebäude.
Bewegung: Sie sah den herannahenden Zug an und trat einen Schritt zurück.
Der Saum und das offene Haar wehen im Luftzug des Zuges.
Schritt 3: Verfassen Sie handlungsorientierte Aufforderungen
Vermeide es, bereits sichtbare Details zu wiederholen, es sei denn, sie sind Identitätsanker. Beginne mit dem aktuellen Zustand und beschreibe, was sich geändert hat.
schwach:
Wunderschönes Anime-Mädchen, silbernes Haar, blaue Jacke, filmisch, Meisterwerk, atemberaubende Action.
Regisseur:
Sie bemerkte die Bewegung außerhalb des Bahnsteigs, ließ zuerst ihren Blick schweifen und drehte sich dann langsam um.
Der Kopf ist leicht um etwa dreißig Grad angehoben. Ihre rechte Hand umklammert fest den Riemen der Tasche. Ein Zug fährt vorbei.
Unter dem Saum ihres Mantels und zwischen ihren losen Haarsträhnen entsteht eine kurze Bewegung. Die mittlere Einstellung fixiert die Kamera, mit einer subtilen
Im letzten Sekunde hineinschieben. Behalte ihr Gesicht, ihre Frisur, ihren Mantel, den Anhänger und den Hintergrund bei.
Architektur. Eine durchgehende Einstellung, keine neuen Figuren, keine Szenenwechsel.
Die zweite Version definiert Leistung, Sequenz, Kamera, physikalische Reaktion und Kontinuität.
Schritt 4: Trennung der Kamerasprache von der Hauptbewegung
Verwenden Sie erkennbare Kamerabefehle:
- Kamera sperren;
- Langsames Vorankommen;
- langsam zurückziehen;
- horizontales Tracking;
- Sanfte Bahn;
- nach oben geneigt;
- Handmikrofon;
- Führen Sie einen Fokuswechsel zwischen den benannten Subjekten durch.
Normalerweise reicht eine einzige Kamerabewegung aus. Die Kombination aus Schienenfahrt, Zoom, Heben, Verwackeln und schnellem Schwenken könnte das Modell dazu zwingen, die gesamte Szene neu zu interpretieren.
Um die Konsistenz der Rolle zu wahren, beginnen Sie mit einer fixierten Kamera. Wenn die Aufführung normal funktioniert, testen Sie eine subtile Kameraversion.
Schritt 5: Ersetze Adjektivansammlungen durch Zeitgefühl
Ordne die Bewegungsabläufe in einem einfachen Takt an:
Die ersten zwei Sekunden: Er bleibt still und hört zu.
Mittelaufnahme: Er hält die Laterne auf Schulterhöhe.
Letzte zwei Sekunden: warmes Licht zeigt den Weg; er erstarrte in der letzten Pose.
Der richtige Zeitpunkt macht das "Dramatische" messbar und schafft gleichzeitig ein stabiles endgültiges Bild für den Schnitt.
Sechs anpassbare Prompt-Muster
Zartes Porträt
Sie atmete natürlich, blinzelte einmal und richtete ihren Blick vom Fenster auf die Kamera.
Lockere Haare reagieren leicht auf die Raumluftströmung. Aus nächster Nähe fixiert, weiches, kontinuierliches Licht,
Behalte die Gesichtsstruktur und die Ohrringe bei, keine Sprache, keine Szenenwechsel.
Anime-Action-Vorbereitung
Er senkte den Schwerpunkt, zog das Schwert zur Hälfte und hielt vor dem Angriff inne.
Der Mantel folgt den Bewegungen des Körpers mit einer glaubwürdigen Verzögerung. Langsame horizontale Kamerafahrten, zurückhaltend und dezent.
Energiepartikel hinter der Klinge, die Form von Gesicht, Kleidung, Waffen und Umgebung beibehalten.
Produktvorstellung
Die Kamera bewegt sich langsam im Uhrzeigersinn in einem Bogen um das Produkt, während das Objekt stationär bleibt.
Ein schmaler Lichtstreifen bewegt sich entlang der Metallkante. Behalte den Beschriftungstext und die geometrischen Formen bei.
Sauberer Studiohintergrund, keine Hände, keine Verformung, keine zusätzlichen Objekte.
Umgebungsaufnahmen
Der Morgennebel zieht langsam durch die vorhandenen Bäume. Die hängenden Schilder sind an verschiedenen
Gebühren basierend auf der Entfernung. Die Kamera bewegt sich entlang eines leeren Pfades nach vorne. Behalten
Architektonische Anordnung und Farbabstimmung. Im Bild erscheinen keine Personen.
Konversationsreaktion ohne Sprachgenerierung
Sie hörte auf die Worte von jemandem außerhalb des Bildes, senkte kurz den Kopf und nickte dann widerwillig leicht.
Natürlich atmen, Schulterbewegungen minimieren. Mittlere Nahaufnahme fixieren, Gesicht und
Gleichmäßiger, ruhiger Raumton, ohne Lippenbewegungen und ohne Schnitte.
Übergang vom ersten zum letzten Frame
Von der bereitgestellten Startaufnahme durch eine natürliche Kurve zur bereitgestellten Endaufnahme bewegen.
Die Rolle geht um den Tisch herum, statt hindurchzugehen. Behalte das Kostüm,
Während des gesamten Prozesses die Konsistenz von Gesichts-, Tischgeometrie, Lichtrichtung und Bildschirmausrichtung beibehalten.
Die letzte Modus hängt von den in der aktuellen xAI-API-Dokumentation beschriebenen Steuerungen ab; er kann in den einzelnen Benutzeroberflächen nicht identisch erscheinen.
Fehlerdiagnose vor der Neugenerierung
Identitätsdrift
Mögliche Ursachen sind ein zu kleines Gesicht, zu große Drehungen, Verdeckungen, Lichtveränderungen oder zu viele Bewegungen. Bitte verwenden Sie klareres Quellmaterial, kleinere Bewegungen, kürzere Dauer und weniger Synchronisationseffekte.
Gummiartige Körperbewegungen
Die angeforderte Aktion erfordert möglicherweise versteckte anatomische Strukturen, die im Bild nicht dargestellt sind. Bitte wählen Sie eine Quelle, bei der das Gelenk sichtbar ist, oder ändern Sie die Aufnahme in einen Nahaufnahme-Performance-Beat.
Unnötige Skalierung
"Den Rahmen fixieren, die Komposition festlegen." Entfernen Sie filmische Begriffe, die Bewegung suggerieren, und stellen Sie klar, dass nur der angegebene Teil des Motivs sich bewegt.
Aktion zu schwach
Ersetze „subtilen Animationen“ durch eine Sequenz und Distanz: zwei Schritte, die Hand auf Schulterhöhe heben, den Kopf um dreißig Grad drehen, oder der Vorhang bewegt sich einmal, nachdem die Tür geöffnet wurde.
Hintergrundunschärfe oder -veränderung
Reduzieren Sie die Kameraparallaxe und großflächige Bewegungen. Behalten Sie die Gebäudestruktur klar bei. Komplexe Hintergründe müssen möglicherweise in eine separate Aufnahme ausgelagert werden.
Hand- oder Requisitenfehler
Vermeiden Sie komplexe Operationen in einer einzelnen Generierung. Beginnen Sie vor dem Kontakt, enden Sie nach dem Kontakt, oder wechseln Sie zwischen Einstellungen und Ergebnissen. Geben Sie Objekten im Quellbild klare Formen.
Ende kann nicht mit einem anderen Shot verbunden werden
Lassen Sie die Figur in der endgültigen Pose stabil bleiben und die Bildschirmausrichtung beibehalten. Entwerfen Sie die nächste Einstellung, bevor Sie die aktuelle Einstellung generieren.
Charakterkonsistenz über mehrere Szenen hinweg
Das Bild-zu-Video behält den Eröffnungsframe bei, nicht die gesamte Produktionsbibel. Für eine Sequenz:
- Genehmigung einer normativen Zeichenreferenz;
- Behalten Sie eine feste Identitätssprache bei;
- Generieren Sie jeden Startframe aus derselben genehmigten Referenz;
- Führen Sie Aufzeichnungen über Kleiderschränke und Requisiten;
- Planen Sie die Bildrichtung und die Kameraeinstellung;
- Animieren Sie jeweils nur eine Einstellung;
- Vergleichen Sie jedes Ergebnis mit der Normtabelle, nicht nur mit den zuvor generierten Ausschnitten.
Wenn Sie an derselben Stelle ein statisches Bild erstellen und animieren müssen, integriert Elser AI die auf Anime ausgerichtete Bildgenerierung, Charakterdesign, Comic-Workflows und Bildanimationsfunktionen. Der Bildanimator unterstützt das Hochladen oder Generieren von Bildern und steuert dann die Bewegung über Modell- und Kameroptionen. Dieser Workflow ist besonders nützlich, wenn das statische Bild selbst vor der Animation modifiziert werden muss.
Kosten und Draft-Strategie
Die xAI API wird nach Generierungsdauer und Auflösung abgerechnet, zuzüglich der unterstützten Medieneingaben. Die aktuellen offiziellen Preise listen unterschiedliche Sekundensätze für 480p, 720p und 1080p auf. Die Verbraucherversion von Grok nutzt Paketkontingente, nicht die API-Preisliste.
Effizientes Verfassen:
- Testen Sie ein repräsentatives Objektiv;
- Verwenden Sie die niedrigste akzeptable Entwurfsauflösung;
- Halten Sie die Dauer kurz;
- Vermeiden Sie, fünf Variablen gleichzeitig zu ändern;
- Antrag vor der endgültigen Beschlussfassung genehmigen;
- Notieren Sie die Hinweise und Einstellungen jedes akzeptierten Fragments.
Siehe xAI API Preise für aktuelle Tarife, anstatt sich auf zwischengespeicherte Artikel zu verlassen.
Häufig gestellte Fragen
Wird Grok mein hochgeladenes Bild als erstes Bild verwenden?
Im Standardmodus Bild-zu-Video, ja. Referenz-zu-Video ist anders: Das Referenzbild kann Identität oder Aussehen lenken, ohne als Startbild zu dienen.
Soll ich dieses Bild noch einmal beschreiben?
Nur die Details beschreiben, die stabil bleiben müssen. Verwende den Großteil des Prompts für Aktionen, Kameraeinstellungen, Timing, Umgebungsreaktionen und Einschränkungen.
Kann Grok den ersten und letzten Frame verwenden?
Die aktuelle Grok Imagine Video 1.5 API-Dokumentation enthält eine last_frame-Option und unterstützt die Kombination aus gleichzeitiger Fixierung des ersten und letzten Frames. Die Verfügbarkeit der Schnittstelle kann variieren.
Kann Grok Videos mit Audio aus Bildern generieren?
Die aktuelle API-Dokumentation beschreibt die generierten Audiodateien und die unterstützten voreingestellten Stimmen. Sie können in der API auch eine stille Ausgabe anfordern. Bitte überprüfen Sie die aktive Consumer-Schnittstelle auf deren verfügbare Audio-Steuerungsfunktionen.
Warum verändern sich statische Figuren in Animationen?
Das Modell muss nicht gesehene Ansichten und Übergangsanatomien ableiten. Große Bewegungen, Verdeckungen, komplexes Licht oder unklare Quellen erschweren diese Ableitung zusätzlich.
Kann ich urheberrechtlich geschützte Kunstwerke animieren?
Technische Fähigkeiten sind nicht gleichbedeutend mit Autorisierung. Bitte verwenden Sie Bilder, die Sie besitzen oder zu deren Änderung Sie berechtigt sind, und überprüfen Sie vor der Veröffentlichung oder Kommerzialisierung von Ergebnissen die Plattformbedingungen und geltenden Gesetze.
Fazit
Die Funktion von Grok zur Umwandlung von Bildern in Videos funktioniert am besten, wenn Identität und Komposition im statischen Bild bereits gelöst sind. Geben Sie dem Modell einen Performance-Beat, eine Kameraeinstellungsidee, einige Kontinuitätsanker und einen stabilen Endpunkt. Wenn das Ergebnis fehlschlägt, diagnostizieren Sie, ob das Problem vom Quellbild, der Bewegung, der Kameraeinstellung, der Zeit oder dem Kontakt herrührt – und nicht von einem Mangel an dekorativen Hinweisen.




