VidGen - AI 视频与图片创作平台

AI 图生视频

上传照片或插画,描述希望出现的主体动作和镜头变化,再选择模型及可用的输出设置。

拖拽图片文件到此处或点击上传

JPG, PNG, WEBP (最大 10MB)

所需积分🔥 限时
64 积分
A Blender, Elevated
Burger People Motion
Character Dance Transfer
Billboard Waltz Romance
Blonde Singer Between Frames
Profile Frame Motion
Rocket Launch Tracking
Sakura Bicycle Ride
Silver Supercar Transformation
Glowing Whale Night Sky
Coko Cola Frame Escape
Futuristic VR Headset
Office Woman Long Take
Cat Artist Studio
Autumn Forest — Boy & Puppy

按素材和需求选择图生视频模型

用 AI 让照片、产品图或插画动起来。图片引导画面外观,提示词描述希望出现的动作。下方模型卡片可查看各模型的能力和限制;需要开始创作时,在上方生成区域选择输入方式和输出设置。

用首尾帧和音频生成演唱片段

这个 Wan 2.7 示例结合了首帧、尾帧、上传音频和提示词,设置为 8 秒、720p。下方展示原始提示词的完整译文。其中的“8K”是提示词原文,并不代表这个示例以 8K 输出。请对比两张图片与生成视频,检查画面衔接、面部、手部和声音。生成自己的视频后,也可以按这些项目检查结果。

提示词、首尾帧与音频

写实中近景镜头:一位甜美迷人的年轻女性留着浅金色长卷发,拥有明亮的蓝眼睛,正自然地对着支架上的专业黑色麦克风演唱。她带着温暖、放松且富有感染力的笑容,整体气质清新、年轻、自然。她身穿浅色、柔软轻盈的上衣,例如奶油白、浅粉色或柔和的裸色;款式简洁精致,突出青春魅力。她佩戴精致但不过分夸张的耳饰,以及一条小巧的金色项链。整体光线柔和且富有电影感,带有温暖的轮廓光和细腻的皮肤质感。背景呈现浅蓝色、暖白色和柔和暖色光点为主的虚化散景,营造出轻松、梦幻又时尚的舞台或摄影棚氛围。高质量、8K 分辨率、社交媒体博主美学、写实摄影质感、清新年轻的色调。

图生视频示例中金发歌手的首帧图片
图生视频示例中金发歌手的尾帧图片

生成视频

如何用 AI 让图片动起来

选择输入模式、描述动作,生成后完整检查视频再下载。

第 1 步:选择模型并上传图片

选择支持所需输入模式的模型。上传清晰的首帧图片,或在支持首尾帧的模式下添加结束画面。给主体预期的运动方向留出空间,并核对该模型显示的上传限制。

第 2 步:描述动作并选择输出设置

说明主体做什么、镜头如何移动,以及动作的节奏。按当前模型提供的选项设置时长、分辨率、宽高比和音频,提交前查看预计所需积分。

第 3 步:生成、检查并下载

查看任务状态,完成后完整播放视频。检查动作、面部、产品细节、闪烁,以及有音频时的声音。下载你想使用的结果。如果需要其他版本,先明确要调整的地方;每次重新生成都会消耗积分。

常见问题

AI 图生视频是什么,和把照片拼成视频有什么区别?

AI 图生视频根据图片和提示词生成新的运动画面。你可以用它让人像、产品图或插画动起来,描述主体动作或镜头变化。这里的照片转视频侧重生成动态画面;如果需要把现有照片按顺序排列、添加转场并调整时间线,可以使用视频编辑器制作相册视频。

应该怎么选择图生视频模型?

先按需要的输入方式选择,再比较可用的输出设置和积分预估。点击上方模型卡片,可以查看具体能力和限制。用同一张图片和提示词做一次短片段测试,有助于在制作更长的视频前比较动作、面部和细节。

一张图片、首尾帧和多张参考图应该怎么选?

首帧图片引导视频开头,首尾帧用于引导开头和结尾。参考图片提供人物、物体或场景的视觉参考。需要加入视频或音频参考时,可以选择提供“全能参考”模式的模型。请查看所选模式上传区域的文件限制。

什么是全能参考?可以把图片、视频和音频一起使用吗?

全能参考允许在同一次生成中,组合所选模型支持的图片、视频和音频素材。选择带有“全能参考”选项的模型,上传所需素材,并在提示词中说明各自用途,例如用照片提供人物外观参考、用视频提供动作参考、用音频提供声音参考。不必三类素材全部上传,但可用组合、文件数量、大小和时长因模型而异;部分模型要求音频搭配图片或视频。生成后请检查结果如何采用这些参考,声音和画面细节可能发生变化。

支持哪些图片格式、文件大小和尺寸?

常见支持格式包括 JPG/JPEG、PNG 和 WebP。文件大小、尺寸和宽高比要求取决于所选模型。添加图片前请查看上传说明,详细要求可通过上方模型卡片了解。建议准备主体和重要细节清晰可见的图片。

图生视频提示词应该怎么写?

描述主体动作、镜头运动、节奏,以及希望保留的细节。例如:“镜头缓慢靠近香水瓶,柔和的反光掠过玻璃。让瓶身保持在画面中央,标签保持可读。”这些描述表达的是画面意图,使用视频前仍需检查生成的标签。提示词长度限制随模型变化,请以当前模型的字符上限为准。

视频可以多长,支持哪些分辨率和宽高比?

按所选模型的控件设置时长和分辨率。如果提供相应选项,横屏可选 16:9,竖屏可选 9:16。部分模式不能单独选择时长或宽高比。各模型说明页列有具体支持范围;在提示词里填写分辨率不会覆盖输出设置。

可以上传音频,或生成带声音的视频吗?

部分模型可以生成声音,也有模型接受上传音频。需要使用自己的音轨时,可以选择 Wan 2.7 的音频上传选项。作为参考输入的音频不一定会原样保留。如果主要目的是让照片中的人物按录音说话,可以查看 AI 数字人。

生成需要多久,结果不理想怎么办?

处理时长会变化,请查看任务状态,不要依赖固定完成时间。生成后检查整个片段,留意不符合预期的动作、面部变化、手部变形、闪烁和声音问题。可以换用更清晰的图片、简化动作提示词,或在模型支持时缩短片段。重新生成可能有帮助,但不保证改善。

AI 图生视频可以免费试用吗,积分怎么计算?

生成前需要登录。如果账户中有可用的注册赠送积分,可以用于任务,但不一定足够完成一次生成。所需积分取决于模型、输出设置和输入素材,部分全能参考模型还会计入参考视频时长。提交前请对照余额查看积分预估。每次新任务,包括重新生成,都需要消耗积分。

人物、产品文字和 Logo 能保持完全一致吗?

图片可以提供视觉参考,但生成细节仍可能变化。发布或使用视频前,请检查面部、手部、文字、Logo 和产品形状。清晰的输入与幅度适中的动作有助于明确生成目标,但不能保证原样复制。如果原图本身需要调整,可以先用图生图准备素材,再生成视频。

VidGen 标志

上传图片,描述你希望出现的动作