VidGen - AI動画・画像制作プラットフォーム

Grok Imagine Video 1.5

Grok Imagine Video 1.5 は、1枚の開始画像から映像と同期音声を生成します。先頭フレームで構図とビジュアルスタイルを決め、被写体の動き、カメラワーク、空気感、効果音、必要に応じた短い台詞をプロンプトで指定します。xAI は、Grok Imagine Video 1.5 で形の崩れを減らし、動きの重さと勢いをより自然にし、音声の明瞭さと同期も改善したと説明しています。VidGen では現在、1〜15秒、480pまたは720pの画像から動画ワークフローを利用できます。

ロケット発射例:先頭フレームから動画へ

VidGen で検証した例です。720×1280の開始画像を使い、点火、明るい噴射炎、広がる煙柱、急上昇、ローアングルでの追跡をプロンプトで指定しました。出力ファイルは約6秒、720p、24 FPSの縦型動画で、AACステレオ音声を含みます。

演出指示:アクション + カメラ + 空気感

Rocket from the reference image launching vertically from the launch pad with ignition, engines ejecting huge bright orange flames and dense white smoke columns, rocket accelerating strongly towards the clear blue sky, leaving a long spectacular smoke trail, low-angle dynamic tracking shot smoothly following the ascending process, cinematic golden light illumination, ultra realistic details, realistic physical effects, epic atmosphere.

Grok Imagine Video 1.5 の先頭フレームとして使用した縦型のロケット発射台画像

結果:動き、追跡、ステレオ音声

Grok Imagine Video 1.5 の主な機能

1枚の静止画から音付き動画を生成

先頭フレームで被写体、構図、スタイルを決め、プロンプトで動き、カメラ、空気感、音を指定します。人物の顔の向き、商品の見せ方、コンセプトアート内の環境変化などを表現できます。

映像と音声を同時に生成

xAI は、効果音、環境音、台詞を映像と同時に生成し、動きに同期させると説明しています。通常のプロンプト内で AUDIO: セクションを使って音の指示を整理できますが、VidGenの独立した設定項目ではありません。BGMも指定できますが、結果は内容によって異なります。

形の崩れを減らし、動きをより一貫させる

xAI によると、Grok Imagine Video 1.5 は動画全体での動きの連続性を改善し、形の崩れを減らし、前モデルより自然な重さと勢いを表現します。

一般的なカメラ用語に対応

プロンプトガイドでは、スロープッシュイン、ドリー、オービット、追跡、手持ち、空撮、固定三脚などが紹介されています。複数の指示を重ねるより、主要なカメラ移動を一つ明確にする方が伝わりやすくなります。

先頭フレームでルックを決める

構図、照明、キャラクターデザイン、商品のディテールは元画像で整えます。プロンプトは画像全体を説明し直すのではなく、変化する部分に集中できます。

1〜15秒、480pまたは720pに対応

VidGenでは1〜15秒を1秒単位で選べます。短い動画や480pでプロンプトの方向を確認してから720pで再生成できますが、生成ごとに動き、構図、音が変わる場合があります。

Grok Imagine Video 1.5 の実用例

  • スニーカー、時計、化粧品、ガジェットの写真に回転、移動する光、動きに合う効果音を加える
  • ポートレートに顔の向き、表情、髪の動き、カメラの接近、室内の環境音を加える
  • イラストのキャラクターにデフォルメされた表情、誇張した動き、対応する効果音を加える
  • 煙、反射、天候、布、意図的なカメラ経路でコンセプトアートを生きた場面にする
  • 映像の動きと音を組み合わせた短い縦型SNS動画を作る
  • 広告ショット、タイトル、絵コンテ、歴史写真、ミーム案を本制作前にプレビズする

Grok Imagine Video 1.5 の使い方

ステップ 1

開始画像を準備する

構図と照明が分かりやすく、被写体が明確で、予定する動きの余白がある画像を選びます。プロンプトは場面全体を作り直すのではなく、動きに集中できます。

ステップ 2

動き、カメラ、音を説明する

一つの具体的な動作と強度から始め、主要なカメラ移動、空気感、光の変化を加えます。効果音、環境音、任意のBGM、短い台詞は、同じプロンプト内の AUDIO: セクションにまとめられます。

ステップ 3

テスト後に高解像度で再生成する

短い動画や480pでプロンプトの方向を確認し、必要に応じて720pや長い動画を再生成します。生成ごとに動き、構図、音が変わる場合があります。

Grok Imagine Video 1.5 よくある質問

Grok Imagine Video 1.5 の主な機能は何ですか?

開始画像1枚と、動き、カメラ、空気感、音を説明するプロンプトから動画を生成します。xAI は、Grok Imagine Video 1.5 で動きの一貫性と自然な重さを改善し、効果音、環境音、短い台詞を映像と同時に生成すると説明しています。

まだプレビュー版ですか?テキストから動画に対応していますか?

xAI は2026年6月に grok-imagine-video-1.5 をプレビューから正式提供へ移行しました。ただし開始画像は必須で、テキストから動画には対応していません。文章だけで場面を作る場合は、VidGenのテキストから動画ページで別モデルを選んでください。

VidGen では何を設定できますか?

先頭フレーム1枚、最大4,096文字のプロンプト、1〜15秒を1秒単位で選ぶ長さ、480pまたは720pを設定できます。独立したアスペクト比選択はないため、元画像を目的の横長、縦長、正方形で準備してください。

本当に効果音や台詞を生成できますか?

はい。xAI は効果音、環境音、台詞を映像と同時に生成し、動きに同期させると説明しています。検証済みのロケット例にはAACステレオ音声があります。通常のプロンプト内の AUDIO: セクションに具体的な音を書けますが、VidGenに独立したAUDIO設定はありません。

効果的なプロンプト構成は?

被写体 + 具体的な動作と強度 + 一つのカメラ移動 + 環境変化 + 音の指示、という構成が使えます。xAIがReplicateで公開しているモデルガイドは、変化する部分に集中し、元画像と矛盾しない具体的な動詞を使い、ネガティブプロンプトではなく望む結果を直接説明するよう勧めています。AUDIO: は文章を整理するための表記です。

どのカメラ移動を理解しますか?

パン、チルト、ズーム、ドリー、追跡、オービット、空撮やドローン、手持ち、スロープッシュイン、固定三脚などの一般的な表現を理解します。競合する複数の指示を重ねるより、主要な動きを一つ明確にする方が安定します。

15秒を常に使うべきですか?

必ずしもそうではありません。xAIがReplicateで公開しているモデルガイドは、短い動画の方が安定しやすく、15秒では不自然な部分が出る可能性が高まるため、まず5〜8秒から始めるよう勧めています。これは実践上の目安であり保証ではありません。長い動画では被写体、相互作用、カメラ変更を減らしてください。

前の Grok Imagine Video から何が変わりましたか?

xAI は形の崩れの減少、より自然な重さと勢い、明瞭な音声、より正確な音画同期を挙げています。xAIのGrok Imagine Video 1.5 Fastでは6秒・720pが約25秒で、以前の40秒超から短縮されたと報告されています。VidGenではプロバイダーとキューが異なるため同じ時間を保証しません。

VidGen の Kling 3.0 とどう使い分けますか?

Grokは1枚の開始画像を使い、長さと解像度を設定するシンプルなワークフローです。Kling 3.0 はテキストから動画、開始・終了フレーム、アスペクト比、品質ティア、音声切替も提供します。単一画像から簡単に始めるならGrok、より多くの設定が必要ならKlingを選べます。

VidGen の Grok Imagine Video 1.5 は無料ですか?

解像度と長さに応じてクレジットを消費します。480pまたは短い動画で方向を試し、より長い720pへ進む前に最新の見積もりを確認してください。恒久的な無料枠を保証するものではありません。

1枚の画像から音付き動画を生成

開始画像とプロンプトを使って、動き、カメラ、空気感、音声を含む1〜15秒のGrok Imagine Video 1.5動画を作成します。