Grok 圖像轉影片指南:提示詞、運動控制與常見問題

來源: Elser AI

圖像轉影片從你已經認可的幀開始。這是它的優勢,也是它的限制。圖像鎖定了開場構圖,但模型仍需推斷深度、隱藏的身體部位、物體行為、時間安排以及接下來應該發生什麼。

好的結果因此在上傳之前就已開始。選擇一張看起來可以合理移動的圖片,定義一個小型表演節拍,並將提示詞寫為接下來幾秒的指令——而不是對畫面的二次描述。

本指南反映了截至2026年9月18日的官方xAI文件。產品控制措施和消費者計劃限制可能會有所變更。

Grok 圖像轉影片功能簡介

在標準圖像轉影片模式下,輸入圖像被固定為起始幀。提示詞描述後續的運動。當前xAI關於Grok Imagine Video 1.5的文件還描述了參考轉影片、可選參考音訊、首尾幀工作流程、編輯、擴展以及支援圖像轉影片請求的原生1080p。

差異很重要:

  • 起始影像: 決定精確的第一幀。
  • 參考圖像: 指導身份、外觀或風格,但不一定成為第一幀。
  • 最後一幀: 定義運動必須到達的位置。
  • 編輯請求: 修改現有影片而非為靜態圖像添加動畫效果。

請查閱 官方 xAI 影片生成指南 以了解當前 API 欄位及支援的組合。

第一步:選擇一張能經得起運動考驗的圖片

最好的源圖像並不總是最富戲劇性的插圖,而是具有最清晰空間資訊的幀。

首選:

  • 一個主導主題;
  • 清晰可辨的手和四肢;
  • 主體與背景之間清晰分離;
  • 一張足夠大的臉以供保存;
  • 一致的光照;
  • 運動方向周圍的房間;
  • 無意外文本或水印;
  • 一個可能作為鏡頭開頭的構圖。

謹慎對待:

  • 雙手交叉遮住臉;
  • 頭髮遮住雙眼;
  • 角色必須行走時,腳部被裁剪;
  • 複雜的人群;
  • 顯示主體第二個版本的倒影;
  • 極端透視縮短;
  • 需要精確手指接觸的微小道具;
  • 已繪製的速度線與新動作衝突。

如果圖像是由AI圖像生成器創建的,請在動畫前修正主要的解剖結構、服裝和物體錯誤。影片無法可靠地修復糟糕的規範幀。

第2步:決定允許更改的內容

將畫面分為三類:

已鎖定

必須保持穩定的細節,如面部、頭髮、制服、產品標籤、關鍵道具或房間佈局。

移動

主要性能:轉身、抬頭、邁步、舉手、開門或做出反應。

回覆

動作引起的次級運動:頭髮垂落、布料隨慣性飄動、光線變化、塵土揚起、樹葉搖曳,或倒影變幻。

這會生成一個清晰的方向說明:

鎖定:面部,白色短髮,藍色外套,銀色吊墜,車站建築。
移動:她看向駛來的火車,後退了一步。
衣擺和散發在列車氣流中飄動。

第三步:撰寫以動作為優先的提示詞

避免重複已經可見的細節,除非它們是身份錨點。從當前狀態開始,描述發生了什麼變化。

弱:

美麗的動漫女孩,銀髮,藍色外套,電影感,傑作,驚豔的動作。

導演:

她注意到月台外的動靜,先是轉動目光,然後緩緩轉過身來。
頭部微微抬起約三十度。她的右手緊緊攥著包帶。一列火車駛過
在她的外套下擺和鬆散的髮絲間激起一陣短暫的波動。中景鎖定鏡頭,帶著一絲微妙的
在最後一秒推入。保留她的面部、髮型、外套、吊墜和背景
架構。一個連續鏡頭,沒有新人物,沒有場景切換。

第二個版本定義了效能、序列、相機、物理響應和連續性。

第四步:將鏡頭語言與主體運動分離

使用可識別的相機指令:

  • 鎖定攝像頭;
  • 緩慢推進;
  • 緩慢拉回;
  • 橫向追蹤;
  • 溫和的軌道;
  • 向上傾斜;
  • 手持式微動;
  • 在命名主體之間進行拉焦轉換。

通常一個鏡頭運動就足夠了。結合軌道、變焦、升降、抖動和快速搖攝,可能會迫使模型重新解讀整個畫面。

為了保持角色一致性,從鎖定攝影機開始。當表演效果正常後,測試一個微妙的攝影機版本。

步驟 5:用時間感代替形容詞堆砌

以簡單的節拍來安排動作順序:

前兩秒:他保持靜止,傾聽。
中景:他將燈籠舉到齊肩高。
最後兩秒:暖光映出門道;他定格了最後的姿勢。

時機讓「戲劇性」變得可衡量,同時也為剪輯創造了一個穩定的最終畫面。

六種可適配的提示模式

微妙的肖像

她自然地呼吸,眨了一次眼,將目光從窗戶移向鏡頭。
散發頭髮對室內氣流有輕微反應。近距離鎖定,柔和連續的光線,
保留面部結構和耳環,無言語,無場景變化。

動漫動作準備

他降低重心,將劍拔出一半,在攻擊前停住。
外套跟隨身體移動,帶有可信的延遲感。緩慢的橫向鏡頭滑動,克制而內斂
刀片後的能量粒子,保留面部、服裝、武器形狀及環境。

產品揭曉

相機圍繞產品緩慢順時針弧線運動,而物體保持固定。
一道狹窄的高光沿著金屬邊緣移動。保留標籤文本和幾何形狀。
乾淨的工作室背景,無手部,無變形,無額外添加物體。

環境鏡頭

晨霧緩緩穿過現有的樹木。懸掛的招牌在不同
根據距離計算的費率。攝影機沿著空曠的路徑向前推進。保持
建築佈局與色彩搭配。畫面中不出現人物。

無生成語音的對話反應

她聽著畫外某人的話,短暫地低頭,然後不情願地微微點了點頭。
自然呼吸,肩部動作最小化。鎖定中近景,保留面部及
均勻、安靜的房間音調,無唇部動作且無剪輯。

首幀到末幀過渡

從提供的起始幀透過一個自然的轉彎移動到提供的最終幀。
角色繞過桌子而非穿過它。保持服裝,
在整個過程中保持面部、桌面幾何形狀、光照方向和螢幕方向的一致性。

最後一種模式依賴於當前xAI API文件中描述的控制;它在每個消費者界面中可能不會完全相同地出現。

在重新生成前診斷故障

身份漂移

可能的原因包括臉部太小、旋轉幅度過大、遮擋、光線變化或動作過多。請使用更清晰的源素材、更小的動作幅度、更短的時長以及更少的同步效果。

橡膠般的身體運動

所請求的動作可能需要畫面中未顯示的隱藏解剖結構。請選擇關節可見的來源,或將鏡頭改為近景表演節拍。

不必要的縮放

「鎖定鏡頭,固定構圖。」移除暗示移動的電影術語,並明確僅指定的主體部分移動。

動作太弱

將「微妙的動畫」替換為一個序列和距離:兩步,手抬至肩高,頭部轉動三十度,或門打開後窗簾移動一次。

背景融化或變化

減少相機視差和大範圍移動。明確保留建築結構。複雜背景可能需要分離到另一個鏡頭中。

手部或道具失敗

避免在單次生成中進行複雜操作。在接觸前開始,接觸後結束,或在設定與結果之間切換。在來源圖像中賦予物體清晰的形狀。

結尾無法連接到另一個鏡頭

讓角色保持穩定的最終姿勢並維持螢幕方向。在生成當前鏡頭之前設計好下一個鏡頭。

多個片段中的角色一致性

圖像到影片保留的是開場幀,而非整部製作聖經。對於一個序列:

  1. 批准一個規範的字符參考;
  2. 保持固定的身份語言;
  3. 從相同的已批准參考中生成每個起始幀;
  4. 保持衣櫃和道具的記錄;
  5. 規劃畫面方向和鏡頭景別;
  6. 每次只動畫化一個鏡頭;
  7. 將每個結果與規範表進行比較,而不僅僅是先前生成的片段。

如果你需要在同一處建立靜態影像並為其添加動畫效果,Elser AI 整合了針對動漫的影像生成、角色設計、漫畫工作流程以及影像動畫功能。其影像動畫器支援上傳或生成影像,然後透過模型和相機選項來引導運動。當靜態影像本身在動畫化之前需要修改時,這個工作流程特別實用。

成本與選秀策略

xAI API 按生成時長和解析度計費,外加支援的媒體輸入。當前官方定價列出了 480p、720p 和 1080p 的不同每秒費率。消費者版 Grok 使用套餐配額,而非 API 價格表。

高效起草:

  • 測試一個代表性鏡頭;
  • 使用最低可接受的草稿解析度;
  • 保持持續時間短;
  • 避免同時更改五個變數;
  • 在生成最終決議之前批准動議;
  • 記錄每個被接受片段的提示和設定。

請參閱 xAI API 定價 了解當前費率,而非依賴快取文章。

常見問題解答

Grok 會把我上傳的圖片用作第一幀嗎?

在標準圖像轉影片模式下,是的。參考轉影片則不同:參考圖像可以引導身份或外觀,而不必作為起始幀。

我應該再次描述這張圖片嗎?

只描述必須保持穩定的細節。將提示的大部分內容用於動作、鏡頭、時間、環境反應和約束。

Grok 能否使用首幀和尾幀?

當前 Grok Imagine Video 1.5 API 文件包含一個 last_frame 選項,並支援同時固定首幀和尾幀的組合。介面可用性可能有所不同。

Grok 能透過圖像生成影片並帶有音訊嗎?

當前的 API 文件描述了生成的音訊和受支援的預設語音。您也可以在 API 中請求靜音輸出。請查看活躍的消費者介面以了解其可用的音訊控制功能。

為什麼靜止的角色在動畫中會發生變化?

模型必須推斷未見視圖和過渡解剖結構。大幅運動、遮擋、複雜光線或來源不清晰會使這種推斷更加困難。

我可以對受版權保護的藝術作品進行動畫化嗎?

技術能力不等於授權。請使用您擁有或有權修改的圖片,並在發布或商業化結果前檢查平台條款及適用法律。

結論

Grok 圖像轉影片功能在靜態影像已解決身份與構圖問題時效果最佳。為模型提供一個表演節拍、一個鏡頭創意、幾個連續性錨點以及一個穩定的落點。當結果失敗時,診斷問題是否源於來源幀、動作、鏡頭、時間或接觸——而非缺乏裝飾性提示詞。

最新發布