VidGen - AI 视频与图片创作平台

Grok Imagine Video 1.5

Grok Imagine Video 1.5 可以从一张起始图片生成带同步音频的视频。首帧用于确定构图和视觉风格,提示词用于描述主体动作、运镜、氛围、音效和可选的短对白。xAI 表示,Grok Imagine Video 1.5 减少了画面形变,让运动呈现更可信的重量和动量,并改善了对白清晰度与音画同步。VidGen 当前提供 1–15 秒、480p 或 720p 的图生视频工作流。

火箭发射样例:从首帧到视频

这支经过核验的 VidGen 样例使用一张 720×1280 首帧,提示词要求呈现点火、明亮尾焰、膨胀烟柱、快速升空和低机位跟拍。输出文件是一段约六秒的 720p、24 FPS 竖屏视频,并包含 AAC 双声道音轨。

导演指令:动作 + 运镜 + 氛围

Rocket from the reference image launching vertically from the launch pad with ignition, engines ejecting huge bright orange flames and dense white smoke columns, rocket accelerating strongly towards the clear blue sky, leaving a long spectacular smoke trail, low-angle dynamic tracking shot smoothly following the ascending process, cinematic golden light illumination, ultra realistic details, realistic physical effects, epic atmosphere.

用作 Grok Imagine Video 1.5 首帧的竖屏火箭发射台图片

生成结果:动作、跟拍和双声道音频

Grok Imagine Video 1.5 的核心能力

从一张静帧生成带声音的视频

首帧确定主体、构图和视觉风格,提示词进一步引导动作、运镜、氛围与声音,例如让人像转头、展示产品,或为概念图加入环境运动。

画面与音频同步生成

xAI 表示,音效、环境声和对白会与画面同次生成并尽量匹配动作。可以在普通提示词中用 AUDIO: 小节整理声音要求,但它不是 VidGen 的独立设置项。背景音乐也可以作为提示尝试描述,具体结果会因内容而异。

减少形体扭曲与运动漂移

根据 xAI 的介绍,Grok Imagine Video 1.5 提升了整个视频片段中的运动连贯性,减少形体扭曲,并让动作呈现比上一代更可信的重量和动量。

支持常见镜头语言

提示指南列出了缓慢推进、dolly 移动、环绕、跟拍、手持、航拍和固定三脚架等表达。相比堆叠多个互相冲突的指令,一个明确的主运镜通常更容易执行。

用首帧锁定视觉方向

生成前先在源图中确定构图、光线、角色设计和产品细节,提示词就可以集中描述后续变化,而不必重复整张图片的静态内容。

支持 1–15 秒、480p 和 720p

VidGen 支持 1 到 15 秒之间的任意整数时长。可以先用较短时长或 480p 验证提示词方向,再重新生成 720p 版本;每次生成的动作、构图和声音都可能有所变化。

Grok Imagine Video 1.5 的实用场景

  • 让球鞋、手表、美妆或电子产品照片旋转展示,并加入移动光线和匹配动作的音效
  • 为人像加入转头、表情变化、发丝运动、镜头推进和室内环境声
  • 为插画角色添加风格化表情、夸张动作和匹配的声音效果
  • 用烟雾、反射、天气、布料运动和明确运镜,让概念图形成动态场景
  • 制作动作与声音相互配合的竖屏社媒短片
  • 在正式制作前预演广告镜头、片头、分镜、历史照片和 meme 创意

如何使用 Grok Imagine Video 1.5

步骤 1

准备起始图片

选择构图清晰、光线可辨、主体明确,并为目标动作留有空间的源图。这样提示词可以集中描述运动,而不必重新构建整个场景。

步骤 2

描述动作、运镜和声音

先写一个明确动作及其强度,再指定一个主运镜,并补充氛围和光线变化。音效、环境声、可选的背景音乐或一句短对白可以整理在同一提示词的 AUDIO: 小节中。

步骤 3

先测试,再重新生成高分辨率版本

先用较短时长或 480p 评估提示词方向,再根据需要重新生成 720p 或更长的版本。不同生成结果的动作、构图和声音可能有所变化。

Grok Imagine Video 1.5 常见问题

Grok Imagine Video 1.5 的主要能力是什么?

它根据一张起始图片和提示词生成视频,提示词可以描述动作、运镜、氛围和声音。xAI 表示,Grok Imagine Video 1.5 改善了运动连贯性和物理重量感,并能在生成视频的同时产生音效、环境声和短对白。

Grok Imagine Video 1.5 还处于预览吗?支持文生视频吗?

xAI 已于 2026 年 6 月将 grok-imagine-video-1.5 移出预览,并在 Imagine API 正式开放。它仍然要求一张起始图片,不支持文生视频。在 VidGen 中如果需要完全由文字创造场景,请到文生视频页面选择其他模型。

在 VidGen 可以控制哪些参数?

上传一张首帧,输入最长 4,096 个字符的提示词,选择 1–15 秒之间的任意整数时长,以及 480p 或 720p。没有独立宽高比选择器,因此源图应提前准备成目标横屏、竖屏或方形构图。

它真的能生成音效和对白吗?

可以。xAI 表示音效、环境声和对白会与视频一起生成,并与动作同步。本页核验过的火箭样例包含 AAC 双声道音轨。可以在普通提示词的 AUDIO: 小节中写明引擎轰鸣、风声、脚步、环境底噪或一句短对白,但 VidGen 没有单独的 AUDIO 设置项。

什么样的提示词结构最有效?

可以按照主体 + 明确动作与强度 + 一个主运镜 + 环境变化 + 声音要求来组织。xAI 在 Replicate 发布的模型指南建议重点描述会发生的变化,让指令与源图一致,使用具体动词,并直接描述目标结果而不是依赖负面提示词。AUDIO: 只是一种组织提示词内容的方式。

Grok Imagine Video 1.5 能理解哪些运镜?

模型提示指南支持常见镜头语言,包括横摇、俯仰、变焦、dolly 移动、跟拍、环绕、航拍或无人机视角、手持、缓慢推进和固定三脚架。一个清晰的主运镜通常比堆叠多个互相争抢的镜头指令更可靠。

应该直接用满 15 秒吗?

不一定。xAI 在 Replicate 发布的模型指南建议先从 5–8 秒开始,因为短片通常更稳定,而 15 秒视频更容易出现瑕疵。这是一项提示词实践建议,并非保证;视频越长,越适合减少主体数量、复杂互动和运镜变化。

Grok Imagine Video 1.5 相比上一代改了什么?

xAI 强调更少形变、更可信的重量与动量、更清晰的对白和更紧密的音画同步。在 xAI 自有的 Grok Imagine Video 1.5 Fast 产品中,官方给出的 6 秒 720p 基准约为 25 秒,上一代超过 40 秒。VidGen 不承诺完全相同的时延,因为供应商和队列状况会变化。

Grok Imagine Video 1.5 与 VidGen 中的 Kling 3.0 怎么选?

Grok 提供以单张首帧为起点的精简工作流,可设置时长和分辨率。Kling 3.0 还提供文生视频、首尾帧控制、宽高比和质量档位,以及独立的生成音频开关。偏好简单的单图起步流程可选 Grok;需要更多控制项可选 Kling。

在 VidGen 使用 Grok Imagine Video 1.5 免费吗?

VidGen 会根据分辨率和时长消耗积分。可以先用 480p 或较短视频测试方向,再查看实时积分预估后决定是否生成更长的 720p 结果;本页不承诺长期免费额度。

从一张静帧生成带声音的视频

使用一张起始图片和提示词,生成包含动作、运镜、氛围和音频的 1–15 秒 Grok Imagine Video 1.5 视频。