Grok 圖像轉影片指南:提示詞、運動控制與常見問題
圖像轉影片從你已經認可的幀開始。這是它的優勢,也是它的限制。圖像鎖定了開場構圖,但模型仍需推斷深度、隱藏的身體部位、物體行為、時間安排以及接下來應該發生什麼。
好的結果因此在上傳之前就已開始。選擇一張看起來可以合理移動的圖片,定義一個小型表演節拍,並將提示詞寫為接下來幾秒的指令——而不是對畫面的二次描述。
本指南反映了截至2026年9月18日的官方xAI文件。產品控制措施和消費者計劃限制可能會有所變更。
Grok 圖像轉影片功能簡介
在標準圖像轉影片模式下,輸入圖像被固定為起始幀。提示詞描述後續的運動。當前xAI關於Grok Imagine Video 1.5的文件還描述了參考轉影片、可選參考音訊、首尾幀工作流程、編輯、擴展以及支援圖像轉影片請求的原生1080p。
差異很重要:
- 起始影像: 決定精確的第一幀。
- 參考圖像: 指導身份、外觀或風格,但不一定成為第一幀。
- 最後一幀: 定義運動必須到達的位置。
- 編輯請求: 修改現有影片而非為靜態圖像添加動畫效果。
請查閱 官方 xAI 影片生成指南 以了解當前 API 欄位及支援的組合。
第一步:選擇一張能經得起運動考驗的圖片
最好的源圖像並不總是最富戲劇性的插圖,而是具有最清晰空間資訊的幀。
首選:
- 一個主導主題;
- 清晰可辨的手和四肢;
- 主體與背景之間清晰分離;
- 一張足夠大的臉以供保存;
- 一致的光照;
- 運動方向周圍的房間;
- 無意外文本或水印;
- 一個可能作為鏡頭開頭的構圖。
謹慎對待:
- 雙手交叉遮住臉;
- 頭髮遮住雙眼;
- 角色必須行走時,腳部被裁剪;
- 複雜的人群;
- 顯示主體第二個版本的倒影;
- 極端透視縮短;
- 需要精確手指接觸的微小道具;
- 已繪製的速度線與新動作衝突。
如果圖像是由AI圖像生成器創建的,請在動畫前修正主要的解剖結構、服裝和物體錯誤。影片無法可靠地修復糟糕的規範幀。
第2步:決定允許更改的內容
將畫面分為三類:
已鎖定
必須保持穩定的細節,如面部、頭髮、制服、產品標籤、關鍵道具或房間佈局。
移動
主要性能:轉身、抬頭、邁步、舉手、開門或做出反應。
回覆
動作引起的次級運動:頭髮垂落、布料隨慣性飄動、光線變化、塵土揚起、樹葉搖曳,或倒影變幻。
這會生成一個清晰的方向說明:
鎖定:面部,白色短髮,藍色外套,銀色吊墜,車站建築。
移動:她看向駛來的火車,後退了一步。
衣擺和散發在列車氣流中飄動。
第三步:撰寫以動作為優先的提示詞
避免重複已經可見的細節,除非它們是身份錨點。從當前狀態開始,描述發生了什麼變化。
弱:
美麗的動漫女孩,銀髮,藍色外套,電影感,傑作,驚豔的動作。
導演:
她注意到月台外的動靜,先是轉動目光,然後緩緩轉過身來。
頭部微微抬起約三十度。她的右手緊緊攥著包帶。一列火車駛過
在她的外套下擺和鬆散的髮絲間激起一陣短暫的波動。中景鎖定鏡頭,帶著一絲微妙的
在最後一秒推入。保留她的面部、髮型、外套、吊墜和背景
架構。一個連續鏡頭,沒有新人物,沒有場景切換。
第二個版本定義了效能、序列、相機、物理響應和連續性。
第四步:將鏡頭語言與主體運動分離
使用可識別的相機指令:
- 鎖定攝像頭;
- 緩慢推進;
- 緩慢拉回;
- 橫向追蹤;
- 溫和的軌道;
- 向上傾斜;
- 手持式微動;
- 在命名主體之間進行拉焦轉換。
通常一個鏡頭運動就足夠了。結合軌道、變焦、升降、抖動和快速搖攝,可能會迫使模型重新解讀整個畫面。
為了保持角色一致性,從鎖定攝影機開始。當表演效果正常後,測試一個微妙的攝影機版本。
步驟 5:用時間感代替形容詞堆砌
以簡單的節拍來安排動作順序:
前兩秒:他保持靜止,傾聽。
中景:他將燈籠舉到齊肩高。
最後兩秒:暖光映出門道;他定格了最後的姿勢。
時機讓「戲劇性」變得可衡量,同時也為剪輯創造了一個穩定的最終畫面。
六種可適配的提示模式
微妙的肖像
她自然地呼吸,眨了一次眼,將目光從窗戶移向鏡頭。
散發頭髮對室內氣流有輕微反應。近距離鎖定,柔和連續的光線,
保留面部結構和耳環,無言語,無場景變化。
動漫動作準備
他降低重心,將劍拔出一半,在攻擊前停住。
外套跟隨身體移動,帶有可信的延遲感。緩慢的橫向鏡頭滑動,克制而內斂
刀片後的能量粒子,保留面部、服裝、武器形狀及環境。
產品揭曉
相機圍繞產品緩慢順時針弧線運動,而物體保持固定。
一道狹窄的高光沿著金屬邊緣移動。保留標籤文本和幾何形狀。
乾淨的工作室背景,無手部,無變形,無額外添加物體。
環境鏡頭
晨霧緩緩穿過現有的樹木。懸掛的招牌在不同
根據距離計算的費率。攝影機沿著空曠的路徑向前推進。保持
建築佈局與色彩搭配。畫面中不出現人物。
無生成語音的對話反應
她聽著畫外某人的話,短暫地低頭,然後不情願地微微點了點頭。
自然呼吸,肩部動作最小化。鎖定中近景,保留面部及
均勻、安靜的房間音調,無唇部動作且無剪輯。
首幀到末幀過渡
從提供的起始幀透過一個自然的轉彎移動到提供的最終幀。
角色繞過桌子而非穿過它。保持服裝,
在整個過程中保持面部、桌面幾何形狀、光照方向和螢幕方向的一致性。
最後一種模式依賴於當前xAI API文件中描述的控制;它在每個消費者界面中可能不會完全相同地出現。
在重新生成前診斷故障
身份漂移
可能的原因包括臉部太小、旋轉幅度過大、遮擋、光線變化或動作過多。請使用更清晰的源素材、更小的動作幅度、更短的時長以及更少的同步效果。
橡膠般的身體運動
所請求的動作可能需要畫面中未顯示的隱藏解剖結構。請選擇關節可見的來源,或將鏡頭改為近景表演節拍。
不必要的縮放
「鎖定鏡頭,固定構圖。」移除暗示移動的電影術語,並明確僅指定的主體部分移動。
動作太弱
將「微妙的動畫」替換為一個序列和距離:兩步,手抬至肩高,頭部轉動三十度,或門打開後窗簾移動一次。
背景融化或變化
減少相機視差和大範圍移動。明確保留建築結構。複雜背景可能需要分離到另一個鏡頭中。
手部或道具失敗
避免在單次生成中進行複雜操作。在接觸前開始,接觸後結束,或在設定與結果之間切換。在來源圖像中賦予物體清晰的形狀。
結尾無法連接到另一個鏡頭
讓角色保持穩定的最終姿勢並維持螢幕方向。在生成當前鏡頭之前設計好下一個鏡頭。
多個片段中的角色一致性
圖像到影片保留的是開場幀,而非整部製作聖經。對於一個序列:
- 批准一個規範的字符參考;
- 保持固定的身份語言;
- 從相同的已批准參考中生成每個起始幀;
- 保持衣櫃和道具的記錄;
- 規劃畫面方向和鏡頭景別;
- 每次只動畫化一個鏡頭;
- 將每個結果與規範表進行比較,而不僅僅是先前生成的片段。
如果你需要在同一處建立靜態影像並為其添加動畫效果,Elser AI 整合了針對動漫的影像生成、角色設計、漫畫工作流程以及影像動畫功能。其影像動畫器支援上傳或生成影像,然後透過模型和相機選項來引導運動。當靜態影像本身在動畫化之前需要修改時,這個工作流程特別實用。
成本與選秀策略
xAI API 按生成時長和解析度計費,外加支援的媒體輸入。當前官方定價列出了 480p、720p 和 1080p 的不同每秒費率。消費者版 Grok 使用套餐配額,而非 API 價格表。
高效起草:
- 測試一個代表性鏡頭;
- 使用最低可接受的草稿解析度;
- 保持持續時間短;
- 避免同時更改五個變數;
- 在生成最終決議之前批准動議;
- 記錄每個被接受片段的提示和設定。
請參閱 xAI API 定價 了解當前費率,而非依賴快取文章。
常見問題解答
Grok 會把我上傳的圖片用作第一幀嗎?
在標準圖像轉影片模式下,是的。參考轉影片則不同:參考圖像可以引導身份或外觀,而不必作為起始幀。
我應該再次描述這張圖片嗎?
只描述必須保持穩定的細節。將提示的大部分內容用於動作、鏡頭、時間、環境反應和約束。
Grok 能否使用首幀和尾幀?
當前 Grok Imagine Video 1.5 API 文件包含一個 last_frame 選項,並支援同時固定首幀和尾幀的組合。介面可用性可能有所不同。
Grok 能透過圖像生成影片並帶有音訊嗎?
當前的 API 文件描述了生成的音訊和受支援的預設語音。您也可以在 API 中請求靜音輸出。請查看活躍的消費者介面以了解其可用的音訊控制功能。
為什麼靜止的角色在動畫中會發生變化?
模型必須推斷未見視圖和過渡解剖結構。大幅運動、遮擋、複雜光線或來源不清晰會使這種推斷更加困難。
我可以對受版權保護的藝術作品進行動畫化嗎?
技術能力不等於授權。請使用您擁有或有權修改的圖片,並在發布或商業化結果前檢查平台條款及適用法律。
結論
Grok 圖像轉影片功能在靜態影像已解決身份與構圖問題時效果最佳。為模型提供一個表演節拍、一個鏡頭創意、幾個連續性錨點以及一個穩定的落點。當結果失敗時,診斷問題是否源於來源幀、動作、鏡頭、時間或接觸——而非缺乏裝飾性提示詞。




