AI 口型同步
上传人物视频和音频,让视频中的口型跟随你的配音。
AI 口型同步
上传人物视频和音频,让视频中的口型跟随你的配音。


为视频和音频选择合适的模型
用 AI 口型同步,让已有视频中的嘴部动作匹配新的音频。Lip Sync Fast 支持 480p 和 720p,音频最长 10 分钟;Lip Sync Standard 适用于 2–120 秒素材,输出分辨率、帧率和宽高比跟随源视频。建议先用短片段比较实际效果。
对比口型同步效果
对比原视频、替换音频和处理结果。一边听人声及其中的停顿,一边观察嘴部动作,再检查整段视频中的面部是否保持连贯。
原视频与替换音频
处理后的视频
如何用 AI 让视频口型匹配音频
准备视频和音频,按所选模型设置参数,再检查生成的片段。
第一步:选择模型并上传
选择 Fast 或 Standard,再上传一个视频和用于驱动口型的音频。选用人脸清晰可见的视频和人声清晰的音频;使用 Standard 时,请准备已去除背景音乐和环境噪声的人声音频。对应模型的文件和时长限制见下方说明。
第二步:设置输出选项
Fast 可选择 480p 或 720p。使用 Standard 时,如果希望循环原画面来匹配更长的音频,可开启「延长视频画面」。提交前确认所需积分。
第三步:生成、检查并下载
通过任务状态查看进度,完成后从头到尾播放结果。检查嘴部动作、面部细节,以及音频是否在预期位置结束,再下载希望使用的版本。
口型同步常见问题
可以免费体验 AI 口型同步吗,需要登录吗?
生成视频需要登录。账户中可用的注册积分可以用于尝试,但每次任务都会消耗积分。余额是否足够,取决于模型、时长和输出设置。请在提交前查看积分预估。
Lip Sync Fast 和 Standard 应该怎么选?
需要 480p 或 720p 输出,或音频超过两分钟时,可以选择 Fast,音频需在 10 分钟以内。Standard 是默认选项,适用于 2–120 秒的输入素材,输出规格跟随源视频,也能循环画面来匹配更长的音频。建议结合积分预估,用自己的短片段比较结果。
支持哪些视频和音频格式、大小与时长?
Fast 支持最大 100 MB 的 MP4/MOV 视频,以及最大 50 MB、时长 2 秒至 10 分钟的 MP3/WAV 音频。Standard 支持最大 300 MB 的 MP4/MOV 视频和最大 30 MB 的 MP3/WAV/AAC 音频,视频与音频时长均需在 2–120 秒范围内。Standard 还要求视频采用 H.264 或 H.265 编码、帧率为 15–60 fps,画面宽和高均为 640–2048 像素。如有需要,请先裁剪或转换文件再上传。
使用 Lip Sync Standard 时,音频和视频时长不一致会怎样?
Standard 默认关闭「延长视频画面」,结果时长按视频和音频中较短的一方处理。音频较长时,开启该选项会交替倒放、正放原视频,循环画面来匹配音频时长。这是重复已有画面,并不会生成新的镜头。上传前将两者准备为相近的时长,有助于控制最终剪辑。
必须自己录音吗?工具会自动翻译或生成配音吗?
你可以使用有权使用的录音,或用文字转语音工具生成音频,再将准备好的音频上传到这里。本页负责匹配口型,不会自动翻译语音、根据文字生成旁白或克隆声音。需要翻译和配音时,可以先准备新的音频,或使用视频翻译工具。
只有照片,没有视频,可以使用吗?
本页需要已有视频和音频文件。如果只有人像照片,请使用 AI 数字人,根据照片和音频生成口播视频。
可以同步唱歌口型或动画人物吗?
可以尝试用 Lip Sync Fast 将视频口型匹配歌唱音频,用于音乐视频片段。尽量使用清晰的人声,并检查长音和快速演唱段落对应的嘴部动作。Standard 主要面向清晰的说话人声。动画或风格化程度较高的面孔可能更难识别,使用任一模型制作完整片段前,都建议先做短片测试。
多人、侧脸或嘴部被遮挡时会怎样?
尽量选择单个人脸清晰可见、光照稳定且嘴部无遮挡的视频。大幅转头、侧脸和手部遮挡可能降低结果的连贯性。本页没有手动指定人物的选项,因此不适合依赖它为多个说话人分别同步口型。
结果会保持原分辨率和原画质吗?
Fast 按你选择的 480p 或 720p 输出。Standard 的输出分辨率、帧率和宽高比跟随源视频,但规格一致不代表画质完全不变。处理过程中嘴部和面部细节可能发生变化,请按实际使用时的显示尺寸检查结果。
处理需要多久,结果不自然怎么办?
处理时间取决于模型、片段长度、分辨率和服务负载,没有统一的完成时间。请查看任务状态,完成后检查闪烁、面部细节模糊、停顿时的嘴部动作,以及末尾音频是否缺失。必要时换用更清晰的素材,或先尝试更短的片段。每次新任务都会消耗积分,再次尝试也不保证结果一定更好。
