Kling AI Avatar 2.0
Kling AI Avatar 2.0は、1枚の人物写真と録音済みの音声からトーキングアバター動画を生成するモデルです。VidGenでは、鮮明な画像と5〜300秒の音声をアップロードし、ガイダンスプロンプトで表情、頭の動き、画面内で見える身体の動きを指定できます。720pまたは1080pを選択でき、プレゼンター動画、製品紹介、レッスン、バーチャルホスト、ローカライズコンテンツに利用できます。このワークフローではアップロードした音声を使用し、テキストから音声を生成することはありません。
Kling AI Avatar 2.0の実際の生成結果
このVidGenの実例では、ポッドキャスト司会者の人物写真、21秒の音声トラック、下記のプロンプトを使用しています。Kling AI Avatar 2.0が、自然なリップシンク、表情、頭の動きを含む720pのトーキングアバター動画を生成します。
人物写真、音声、プロンプト
人物が自然に話し、控えめな表情と頭の動きを見せる。
トーキングアバター動画
Kling AI Avatar 2.0の主な機能
1枚の写真からトーキングアバターを作成
プレゼンターを撮影する代わりに、1枚の人物写真から始められます。モデルは、入力した音声とプロンプトに合わせて、写真内の人物が話しているようにアニメーション化します。
音声駆動のリップシンクと演技
用意した音声トラックで口の動きと演技のタイミングを制御し、アップロードした音声の長さに合わせて動画を生成します。
プロンプトで表情と動きを指定
意図する雰囲気、表情、頭の動き、ジェスチャー、エネルギー感を指定し、メッセージに合った演技へ導けます。
最長5分の音声に対応
5〜300秒の音声から生成できるため、短いSNSクリップだけでなく、長めの解説やレッスンにも利用できます。
720pと1080pで出力
低コストで下書きを試す場合は720p、最終的なトーキングアバター動画でより細かな描写が必要な場合は1080p Proを選べます。
カメラ撮影やローカル環境は不要
画像、音声ファイル、プロンプトを使ってブラウザ上で生成でき、新たな撮影やローカルモデルのインストールは必要ありません。
Kling AI Avatar 2.0 StandardとProの比較
Standard — 720p
プレビュー、SNS用の下書き、一般的なトーキングアバター動画に適しています。VidGenでは現在、入力音声1秒あたり8クレジットです。
Pro — 1080p・48fps
最終出力で細部の鮮明さや滑らかさを重視する場合に適しています。VidGenでは現在、入力音声1秒あたり16クレジットです。
Kling AI Avatar 2.0で作成できるもの
- ブランド用の人物写真と用意したナレーションから作るプレゼンター動画やバーチャルホスト動画。
- 出演者を撮影せずに作る製品解説、機能紹介、EC向け動画。
- 研修レッスン、講座の導入、オンボーディングメッセージ、社内コミュニケーション。
- 同じ人物写真に別途用意した各言語の音声を組み合わせるローカライズ版のトーキングアバター。
- 一貫した画面上の人物イメージを使ったクリエイターの近況報告、ポッドキャスト予告、SNS投稿、短い解説。
- プロンプトで表情、ジェスチャー、話し方を指定するキャラクター演技やストーリー動画。
Kling AI Avatar 2.0の使い方
ステップ 1
鮮明な人物写真を選ぶ
顔が見える明るい画像をアップロードし、生成したい表情、頭の動き、上半身のジェスチャーのために十分な余白を確保します。
ステップ 2
完成済みの音声トラックをアップロード
5〜300秒のMP3、WAV、AAC、MP4、OGG音声を追加します。音声が演技のタイミングを決めるため、意図した間を含む明瞭な音声を使用してください。
ステップ 3
演技を説明する
雰囲気、表情、視線、頭の動き、見える範囲のジェスチャーをプロンプトに記述します。人物写真の構図とナレーションの目的に合う内容にしてください。
ステップ 4
解像度を選んで生成
720p Standardまたは1080p Proを選び、音声時間に基づくクレジット見積もりを確認して生成します。ダウンロード前にリップシンク、表情、動きを確認してください。
Kling AI Avatar 2.0のよくある質問
Kling AI Avatar 2.0とは?
Kling AI Avatar 2.0は、1枚の人物写真、1本の音声トラック、ガイダンスプロンプトを組み合わせて、キャラクターが話す動画を生成するトーキングアバターモデルです。一般的なテキスト動画生成ではなく、写真から話す動画を作る用途に向いています。
Klingのトーキングアバターを作るには何が必要ですか?
鮮明な人物写真、5〜300秒の音声ファイル、希望する表情や動きを説明するプロンプトを用意してください。VidGenは一般的な画像形式とMP3、WAV、AAC、MP4、OGG音声に対応し、720pまたは1080pを選択できます。
Kling AI Avatar 2.0の動画は最長何分ですか?
現在のVidGenワークフローでは、5秒から5分までの音声を使用できます。出力動画は入力音声の長さに沿い、必要なクレジットは音声時間と選択した解像度から計算されます。
ガイダンスプロンプトはどう書けばよいですか?
音声の台本を繰り返すのではなく、演技について記述してください。落ち着いた講師、温かい笑顔、控えめなうなずき、抑えた手の動きのように、雰囲気、表情、頭の動き、視線、見える範囲のジェスチャー、エネルギー感を直接指定します。
どのような人物写真が適していますか?
1人の人物がはっきり写り、顔が隠れておらず、明るく鮮明な画像を使用してください。指定した動きのために、頭や上半身の周囲に十分な余白があることも重要です。極端な角度、顔の遮り、人物が小さすぎる画像では、結果が不安定になることがあります。
Kling AI Avatar 2.0は音声も生成しますか?
現在のVidGenのKlingアバターワークフローでは音声を生成しません。アバターに話させたい完成済みの音声トラックをアップロードしてください。これにより、言葉、言語、話す速さ、発音、話者を直接管理できます。
AI AvatarとLip Sync AIの違いは?
静止した人物写真から新しいトーキング動画を作る場合はKling AI Avatar 2.0を使用します。すでに人物が映った動画があり、口の動きを差し替え音声に同期したい場合はLip Sync AIを使用します。
720pと1080pのどちらを選ぶべきですか?
人物写真、プロンプト、音声トラックを低コストで試す場合は720pを選びます。追加のディテールと48fps出力を重視する最終書き出しには1080p Proが適しています。
VidGenでKling AI Avatar 2.0を使う料金は?
現在の料金は、720p Standardが音声1秒あたり8クレジット、1080p Proが1秒あたり16クレジットです。タスクを送信する前に、生成画面で最新の見積もりを確認できます。
VidGenの他のAIモデルを見る
Kling AI Avatar 2.0でトーキングアバターを作成
1枚の人物写真と用意した音声から、プロンプトで演技を指定した720pまたは1080pのトーキングアバター動画を生成します。
