Grok画像から動画は最初のフレームを引き継ぐ
テキストだけの生成と違い、Grokは提供されたピクセルから始めます。開始フレームが残すべき要素を決め、動きのブリーフがその後のシーンの変化を指定します。
動きの前に被写体を固定する
顔、商品のシルエット、文字、主な小道具が読み取れるフレームを使います。安定した視覚アンカーがあれば、Grokが判断する曖昧さを減らせます。
次のビートを説明する
時間とともに変わるものを書きます。視線、リビール、歩行、光の変化、カメラの動きなどです。元画像がすでに示している細部をプロンプトで繰り返す必要はありません。
動きを段階的に調整する
結果がずれる場合は、動作やカメラ方向を簡単にします。静かすぎる場合は、雰囲気を増やす前に目的のある動きを1つ追加します。

