MiniMax H3
在 VidGen 中使用 MiniMax H3,通过文字提示词、单张首帧、首尾帧组合,或图片、视频和音频参考素材生成 768P 或 2K AI 视频。你可以选择 5–15 秒时长,并在文生视频和全能参考模式中使用六种画幅。它尤其适合需要明确起止构图、多种视觉参考素材,或希望获得比单靠提示词更精确运动控制的项目。
用首尾帧生成樱花街骑行视频
这个 MiniMax H3 示例使用首帧、尾帧和详细的 5 秒运动提示词,引导骑行者穿过樱花街道。帧组合定义开场与结束构图,提示词则控制人物、花瓣、跟拍镜头和动作节奏。
提示词与首尾帧
以参考图中的年轻亚洲女性为主体,保持她的外貌、发型、服装、自行车以及樱花街道环境完全一致。生成一段 5 秒的写实电影感视频。 采用正面跟拍的中近景镜头,年轻女性骑着复古城市自行车缓慢穿过樱花街道,始终保持自然、愉快的微笑。春风轻轻吹动她的短发,衣服和肩上的帆布包随着骑行动作轻微摆动。自行车前方的藤编车篮略微摇晃,车轮缓慢转动。 周围的樱花树在微风中轻轻摇曳,粉白色花瓣自然飘落,少量花瓣从镜头近处掠过。让背景中的行人和建筑保持柔和虚化,营造安静、舒缓的春日城市氛围。 使用自然稳定的镜头运动,模拟真实摄影师使用手持稳定器跟随主体,并让她始终位于画面中央。保持 85mm 镜头质感、大光圈和浅景深,使用柔和自然光、电影感调色、真实皮肤纹理和日常抓拍氛围。 动作节奏: 0–2 秒:自行车从远处接近镜头,女性保持自然微笑,樱花花瓣在周围飘落。 2–4 秒:镜头轻微向后移动进行跟拍,捕捉骑行动作细节和春风吹动头发的效果。 4–5 秒:女性靠近镜头,笑容更加明显,花瓣从镜头前飘过。以这个温暖自然的画面作为视频尾帧。 风格:写实、电影感、日式春日美学、柔和自然光、真实运动、细节丰富、流畅镜头运动。


生成视频
核心功能
四种生成模式
使用同一个模型完成文生视频、首帧动画、首尾帧视频或全能参考生成,无需切换模型。
首尾帧控制
当镜头需要明确的目标画面时,提供开场图和结束图,再通过提示词描述两个视觉锚点之间的运动。
全能参考模式
当文字不足以表达主体、动作或创作方向时,可以通过参考图片和短视频引导结果,也可添加音频作为额外参考输入。
768P 或 2K 输出
生成视频前,可以选择成本更低、适合快速迭代的 768P,或清晰度更高的 2K。
5–15 秒时长
可选择 5–15 秒之间任意整数时长,用于快速动作测试、规划好的转场,或需要更多展开时间的场景。
六种画幅
文生视频和全能参考模式支持 21:9、16:9、4:3、1:1、3:4 和 9:16;帧生成模式跟随上传图片的画幅。
MiniMax H3 与 Hailuo 2.3 对比
MiniMax H3
需要文生视频、单帧动画、首尾帧转场或多参考创作时,可以选择此模型。它支持 768P 或 2K 输出和灵活的 5–15 秒时长。
Hailuo 2.3
需要专注的单图动画工作流时选择 Hailuo 2.3。它提供 Standard 和 Pro 档位、6 秒或 10 秒时长,以及兼容的 768p 或 1080p 设置。
MiniMax H3 适用场景
- 具有明确开场和结束构图的首尾帧转场
- 通过多张参考图片引导的角色或产品视频
- 借助短参考视频进一步引导动作的镜头创作
- 用于电影场景、产品创意和视觉概念的文生视频草稿
- 5–15 秒的横屏、竖屏、方形和超宽视频
如何使用 MiniMax H3
步骤 1
选择生成模式
只有提示词时使用文生视频;需要首帧、首尾帧组合或全能参考素材时,打开图生视频。
步骤 2
添加帧或参考素材
上传当前模式所需的素材。规划转场时使用视觉连贯的首尾帧;使用多项参考时,明确每张图片或每段视频在视觉或动作引导上的作用,音频则可作为额外参考输入。
步骤 3
编写聚焦运动的提示词
描述主体、动作、镜头运动、环境、光线、节奏以及需要保持一致的细节。使用多个参考时,请说明每项参考的作用。
步骤 4
设置时长并生成
选择 768P 或 2K、5–15 秒时长,并在可用时选择画幅。生成后检查运动和构图,再按需要优化提示词或参考素材。
常见问题
MiniMax H3 是什么?
它是一款支持文生视频、图生视频、首尾帧生成和全能参考模式的 AI 视频模型。在 VidGen 中,可以生成 5–15 秒的 768P 或 2K 视频。
MiniMax H3 可以从文字生成视频吗?
可以。打开文生视频,选择该模型,输入提示词,再选择分辨率、时长和画幅,即可生成视频。
MiniMax H3 可以把图片生成视频吗?
可以。上传一张首帧并描述希望出现的运动;如果视频需要到达指定的结束构图,还可以添加尾帧。
MiniMax H3 首尾帧视频如何工作?
上传首帧和尾帧,再描述主体、镜头和环境应如何在两者之间运动。这两张图片会作为生成转场的视觉锚点。
MiniMax H3 的全能参考模式有什么用?
在全能参考模式下,你可以上传图片或短视频,用来参考人物外观、画面风格和动作表现,也可以添加音频作为额外参考输入。建议在提示词中说明需要从每张图片或每段视频中保留或借鉴的视觉内容。
MiniMax H3 最多可以使用多少个参考文件?
VidGen 最多支持 9 张参考图片、3 个参考视频和 3 个参考音频。每个参考视频或音频必须为 2–15 秒,参考视频与参考音频分别最多合计 15 秒。
可以只用音频生成 MiniMax H3 视频吗?
不可以。全能参考模式至少需要一张图片或一个视频。音频可以作为额外参考,但不能是唯一上传的输入。
MiniMax H3 支持什么分辨率和时长?
它在 VidGen 中支持 768P 和 2K 输出,时长支持 5–15 秒,并可按 1 秒递增。
MiniMax H3 支持哪些画幅?
文生视频和全能参考模式支持 21:9、16:9、4:3、1:1、3:4 和 9:16。图生视频模式跟随上传单帧或帧组合的构图。
MiniMax H3 和 Hailuo 2.3 是同一个模型吗?
不是。二者是 VidGen 中不同的模型选项。Hailuo 2.3 专注于单图动画,而当前模型还支持文字、首尾帧和多参考工作流。
在 VidGen 中使用 MiniMax H3 需要多少积分?
它使用 VidGen 积分,分辨率和输出时长会影响预估消耗。在全能参考模式下,参考视频费用也会跟随所选分辨率,第 6 张及之后的参考图片会额外增加积分;前 5 张参考图片和参考音频不额外增加积分。VidGen 会在生成前显示当前积分预估。
