VidGen - AI 视频与图片创作平台
返回博客
AI 视频

什么是数字人?AI 数字人如何工作,以及如何制作一个数字人视频

10 分钟

VidGen:你的一站式 AI 创作套件

在一个工作区里完成视频、图像等内容创作。

  • 文生视频、图生视频
  • AI 图像生成与编辑
  • 免费开始,无需信用卡
免费试用 VidGen
数字人(Digital Human) 是一种由软件创建或驱动、能够以接近人类的方式呈现外观、动作、语言或互动的数字角色。它既可以是一段预先生成的 AI 主播视频,也可以是能够实时交流的数字客服,或者是游戏和虚拟世界中的 3D 角色。 因此,“数字人”并不指某一种固定技术。搜索数字人生成器的人,可能想让一张照片开口说话,给已有视频替换新语音,制作一个实时客服,也可能想创建能在新场景中行动的虚拟角色。这些目标需要不同的产品和制作方式。 对普通创作者来说,最实用的问题其实是:你手里已经有什么素材,又想得到什么样的视频? 这篇文章贯穿着一个实用原则:保留已经可用的部分,只生成项目中缺失的部分。 按照这个原则,就更容易判断应该让照片开口说话、给已有表演替换语音,还是根据参考素材创建一段新场景。

什么是数字人?

判断一个角色是否属于数字人,关键并不在于它看起来有多逼真,而在于它的身份或表演中有哪些部分是由数字技术创建和控制的。 它的外观可以是真人写实风格、动画风格、二维虚拟形象或完整的三维角色;它的表演可以由录制音频、文字脚本、动作参考、AI 模型或实时对话驱动。也正因为如此,“数字人”“AI Avatar”“虚拟人”和“数字角色”经常被混用,但它们并不总是在描述同一种产品。 一个实用的判断边界是:只要软件参与创建、驱动或控制一个类人形象或人物表演,它就属于广义的数字人范畴。 现在很多数字人会使用 AI,但 AI 并不是唯一基础。通过传统 3D 建模和动作捕捉驱动的角色,同样可以称为数字人。AI 数字人通常进一步加入语音生成、面部动画、语言理解或参考视频生成等能力。

数字人技术是如何工作的?

数字人技术可以拆成几个层次,不是每一种产品都会包含全部层次。

1. 人物外观

数字人首先需要一个可以被看见的形象。它可能来自一张人物照片、一段真人录像、设计好的二维 Avatar,或者一个完成绑定的 3D 模型。有些系统强调保留真人身份,有些则用于创建虚构角色。

2. 语音与音频

角色可以由上传的真人语音、文字转语音、克隆声音或实时麦克风输入驱动。在预生成视频中,音频通常决定说话时长和表演节奏。

3. 面部动画与口型同步

系统会把语音中的声音映射成嘴型、表情、眨眼和头部动作。这一层可以通过 AI Avatar 让静态照片开口说话,也可以通过 Lip Sync AI 让已有视频中的人物匹配一段新的语音。

4. 动作与场景生成

一些参考视频驱动的动作控制工作流并不只处理面部,而是将参考视频中的身体动作、姿态和表演节奏迁移到人物图片。更广义的参考生成还可以影响镜头运动、视觉风格和构图。

5. 智能与实时互动

这一层不是必需的。对话式数字人客服通常会组合语音识别、大语言模型或业务知识库、语音合成和实时动画,使角色能够理解问题并立即回应。预先生成的 AI 主播视频不需要这一层,因为它播放的是提前准备好的内容。 市场上的产品也反映了这种跨度:MetaHuman 重点解决写实 3D 角色创建与动画,NVIDIA ACE 提供语音、智能、动画和渲染等开发技术,而腾讯云 AI 数字人同时覆盖合成视频和实时互动。它们都属于数字人技术,但解决的并不是同一个问题。 上面五个层次说明的是一个数字人可以由什么组成;下面三种类型说明的则是市场上的产品如何组合并交付这些能力

数字人的三种主要类型

类型工作方式常见用途典型结果
预生成 AI 讲解者通过照片、Avatar、脚本或音频生成表演营销、培训、产品讲解、社交视频可下载的视频
对话式数字人通过语音识别和 AI 或知识系统实时回答客服、导览、虚拟助手、终端设备实时互动体验
3D 数字角色对完成绑定的三维模型进行动画和渲染游戏、虚拟制作、仿真、沉浸式体验实时或渲染后的 3D 角色

预生成 AI 讲解者

这是普通创作者最容易使用的一类数字人。用户提供人物照片、声音、脚本或已有片段,系统生成可以编辑、下载和发布的视频。它不需要实时听懂观众的问题。

对话式数字人

对话式数字人是给对话式 AI 加上可见、可说话的人类界面。一些数字人平台会将这类角色作为互动智能体,使其能够连接知识并部署到不同的数字环境中。这类平台往往需要实时语音处理、对话编排和业务系统集成。 因此,一个完整的数字人平台可能同时包含形象设计、对话智能、部署工具、分析能力和业务数据连接,而不仅仅是视频生成。

实时 3D 数字角色

这类角色需要在镜头、光线、身体姿态和环境不断变化的场景中工作,通常涉及角色绑定、动画管线、渲染引擎和更多开发投入,与浏览器里的数字人视频生成器不是同一类产品。

数字人、AI Avatar 和 Chatbot 有什么区别?

这些词存在重叠,但可以用下面的方式理解:
概念通常强调什么必须说话吗?必须实时回答吗?
数字人广义的类人数字体验不一定不一定
AI Avatar由 AI 生成或动画化的视觉身份不一定不需要
说话人像由语音驱动的面部表演不需要
对话式数字人可见、可说话的对话智能体通常需要
3D 数字人完成建模和绑定的三维角色不一定不一定
所以,AI Avatar 可以是数字人的一种;Chatbot 可以作为数字人的智能部分,但只有文字界面的 Chatbot 本身不属于数字人;一张会说话的照片也可以是一段数字人视频,但它并不是可复用的 3D 角色或实时智能体。

数字人可以用来做什么?

当一张照片已经足够:营销和培训

AI 数字人讲解者可以介绍产品功能、解释活动信息,也可以用于课程开场、员工培训和内部说明。当讲稿和音频已经准备好,但没有真人表演视频时,照片驱动的 AI 讲解者通常是最直接的方式。

当已有表演值得保留:本地化和内容复用

如果团队已经有一段表现良好的讲解视频,重新生成整个场景反而可能丢失原有的肢体动作、镜头和节奏。这时更适合替换音频并同步人物嘴型,用于配音、替换台词和制作本地化版本。

当人物表演也要改变:社交媒体和角色场景

当目标不只是让人物开口说话,而是需要新的动作、镜头或环境时,可以使用参考生成。它适合角色短视频、虚拟主持人、风格化营销内容,以及由人物或角色推动的社交媒体场景。

当项目并不是预生成视频

数字客服、虚拟导览、游戏角色和仿真参与者也可以属于数字人,但它们需要另外一类产品。实时助手依赖对话基础设施,而 3D 角色则依赖角色绑定、动画系统和渲染引擎。

如何选择 VidGen 的数字人制作方式?

VidGen 当前主要解决的是数字人视频创作。最合适的工具取决于你的起始素材,以及你希望保留哪一部分内容。 选择时可以遵循同一个原则:保留已经可用的部分,只生成缺失的那一层。
你已经有的素材你想制作的内容推荐的 VidGen 制作方式
一张人物照片和完成的音频说话照片、说话人像或 AI 讲解者视频使用 AI Avatar 制作
一段人物视频和另一条音频替换配音,并让新语音与人物嘴型同步使用 Lip Sync AI
一张人物图片和一段动作参考视频让人物生成一段跟随参考动作和节奏的新表演使用 Motion Control 迁移动作
参考图片、视频或音频根据参考生成新的动作、表演、镜头或场景使用图片生视频生成
这四条路径可以得到相似的数字人效果,但并不能完全互换。AI Avatar 把照片作为人物外观来源,并生成缺失的说话表演;Lip Sync AI 沿用已有视频中的人物动作、镜头和表演,只改变语音;Motion Control 将参考视频中的身体动作和表演节奏迁移到人物图片;更广义的参考生成会创建一条新视频,因此模型对人物、动作和场景细节有更大的解释空间。

示例一:用人物照片制作会说话的数字人

如果你已经有清晰的人物照片和完成的语音,可以选择这条路径。 **输入:**一张人物照片和完成的语音。**方法:**根据音频生成照片中缺失的面部表演。
  1. 打开 VidGen AI Avatar
  2. 上传一张正面清晰、格式受支持的人物照片。
  3. 上传希望人物说出的 WAV 或 MP3 音频。
  4. 描述期望的表演方式,例如表情、节奏和头部动作。
  5. 选择分辨率并生成,发布前检查面部动作和音频效果。
它适合产品讲解、公告、课程开场和 AI 发言人内容。面部无遮挡的清晰照片和干净语音,通常能给模型提供更明确的信息。 VidGen AI Avatar 示例使用的人物输入照片 生成后的 AI Avatar 视频:

示例二:给已有视频匹配一段新语音

当人物的动作、画面和表演已经存在,只需要替换说话内容时,应选择 Lip Sync AI。 **输入:**一段已有的人物视频和新的音频。**方法:**保留原有表演,只重新生成嘴部动作。
  1. 打开 VidGen Lip Sync AI
  2. 上传一段说话者面部清晰可见的 MP4 或 MOV 视频。
  3. 上传新的 MP3 或 WAV 音频。
  4. 生成同步版本,并重点检查快速语句、复杂发音和侧脸片段。
这条路径适合视频配音、替换台词、本地化版本和已有讲解视频的二次利用,不需要从一张静态照片重新创建整段表演。 原始视频输入: 口型同步后的结果:

示例三:使用参考素材生成一条新视频

如果你想要的是一段新的表演,而不是保留原始说话人像镜头,参考生成会更加灵活。根据所选模型不同,参考素材可以用于指导人物、动作、视觉风格、构图、声音节奏或表演方式。 **输入:**一张人物参考图和一段动作参考视频。**方法:**明确每份参考素材的作用,并生成一段新的角色表演。
  1. 打开 VidGen 的图片生视频
  2. 选择支持所需参考素材和模式的模型。
  3. 添加相关的参考图片、视频或音频。
  4. 在提示词里明确每个参考素材的作用,例如使用图片中的人物,并模仿参考视频中的动作。
  5. 生成后检查人物一致性、动作、镜头连续性和构图。
下面的示例使用一张参考图片提供人物形象,并使用参考视频引导舞蹈动作。它很好地说明了参考生成与精确口型同步的区别:前者创建新的角色表演,后者修改已有视频中的嘴部动作。 人物参考图: Seedance 参考生成示例使用的人物图片 动作参考视频: 生成结果:

提升数字人视频效果的建议

使用清晰且获得授权的素材

优先选择自己拥有或已经获得使用许可的照片、声音和视频。尽量避免面部被大面积遮挡、严重模糊或人物难以识别的素材。

保持语音干净

背景噪声、破音和多人重叠说话会给语音驱动动画增加难度。清晰、节奏自然的单人语音更适合 AI Avatar 和 Lip Sync AI。

只生成项目缺失的部分

如果原视频中的人物动作和镜头已经很好,就保留它们并使用口型同步;如果手里只有一张照片,就用 AI Avatar 生成说话表演;只有确实需要新动作、新镜头或新环境时,才使用参考生成。

写清楚动作要求

生成新场景时,应描述人物做什么、镜头如何运动,以及哪些元素必须保持一致。“人物自然地说话”适合照片驱动的说话人像;“保留参考图片中的人物,并使用参考视频中的动作”则更适合参考生成。

发布前认真检查

重点检查嘴部、牙齿、眼睛、手部、人物身份、音频时序和突兀转场。AI 输出会有波动,换用更清晰的素材或提示词再次生成,可能会改善结果。

如何负责任地使用数字人技术?

数字人技术让制作逼真的类人内容变得更容易,也因此更需要明确使用边界。
  • 使用他人的肖像、声音或表演前,应先获得许可。
  • 不要在可能误导观众的情况下,把合成内容冒充为真实录像。
  • 遵守广告、政治内容、身份冒用、隐私和知识产权相关规则。
  • 当受众或发布平台需要时,说明内容由 AI 生成或经过 AI 处理。
  • 为团队或客户制作内容时,妥善保存来源文件和授权记录。
数字人技术应该帮助人们沟通和创作,而不是剥夺被呈现者对肖像和声音的权利。

常见问题

Digital Human 或“数字人”是什么意思?

数字人是对“由软件创建和控制的类人形象或人物表演”的统称。仅凭这个名称,并不能判断它是一段预生成视频、实时互动智能体,还是一个 3D 角色。

数字人和 AI Avatar 是同一个概念吗?

不完全相同。AI Avatar 更强调可见的人物身份或 AI 讲解者,而数字人的范围更广,还可以包含语音、行为、对话和实时 3D 渲染。

所有数字人都能实时对话吗?

不能。很多数字人只是提前生成的视频。实时对话还需要语音识别、语言模型或知识系统、回答生成、语音合成和实时动画等额外能力。

如何制作一个数字人 Avatar?

如果你有照片和音频,可以上传到 AI Avatar,补充表演描述并生成说话视频。如果你已经有一段视频,则更适合使用 Lip Sync AI

AI Avatar 和 Lip Sync AI 有什么区别?

AI Avatar 从静态人物照片开始,生成一段说话表演;Lip Sync AI 从已有视频开始,让一段新音频与画面中的说话者同步。

什么时候应该使用参考视频生成?

当你希望根据一个或多个参考素材生成新的动作、镜头或场景时,可以使用参考生成。它适合迁移动作或延续视觉方向,但不等同于精确的口型同步。

制作数字人视频必须学习 3D 建模吗?

不需要。通过浏览器中的 AI Avatar 和 Lip Sync 工具,可以直接利用普通图片、音频和视频制作数字人内容。只有当目标是游戏、仿真或实时渲染环境中的绑定角色时,才通常需要 3D 建模。

从你已有的素材开始制作数字人视频

不存在适合所有项目的唯一数字人工具。最有效的选择,取决于你已经拥有什么: 原则很简单:保留已经可用的部分,只生成项目中缺失的部分。这样才能更好地控制人物身份、语音、动作和视频的最终用途。