Kling Avatar V2

あらゆるポートレートを音声同期リップシンク付きのトーキング動画に変換。1080p 48fps対応

Kling Avatar V2

動画生成AI
ポートレート画像 *(0/1)
オーディオファイル *(0/1)
0 / 2000
50クレジット消費残り0クレジット
動画プレビュー
Cinematic war scene AI video generated with Kling
Luxury car on a night drive, AI video generated with Kling
Dark fantasy monster rider AI video generated with Kling
Motorcycle racing on a track, AI video generated with Kling
Airport storm and flooding VFX AI video generated with Kling
Anime girl on a mountain road, AI video generated with Kling
Cyberpunk female warrior AI video generated with Kling
Fantasy dragon queen in the snow, AI video generated with Kling

Kling Avatar V2とは?

Kling Avatar V2は、静止ポートレート写真を音声ファイルで駆動するトーキング動画に変換します。顔画像と音声クリップをアップロードすると、モデルが音声に同期した自然なリップムーブメント、表情、微妙な頭の動きを生成します。出力は1080p、48fpsです。

  • 音声駆動リップシンク

    ポーズ、強調、自然な発話リズムを含め、リップムーブメントが音声に正確に一致します。

  • 1080p 48fps

    自然な動きを実現するスムーズな48フレーム/秒の高解像度出力です。

  • マルチスタイル対応

    リアルな写真、アニメキャラクター、漫画の顔、動物のポートレートにも対応しています。

  • 自動再生時間

    動画の長さは音声ファイルの再生時間に自動的に合わせられます。手動トリミングは不要です。

Kling Avatar V2の使い方

01

1. ポートレートをアップロード

鮮明な正面向きのポートレート画像を用意してください。JPGまたはPNG、最大10MB、最小300px。明るく顔がはっきり見える写真が最適です。

02

2. 音声をアップロード

音声ファイルを追加します。MP3、WAV、M4A、またはAAC形式、最大5MB。背景ノイズが少ないクリアな音声が最良のリップシンクを実現します。

03

3. プロンプトを追加(任意)

リップシンク以外の頭の動き、感情、カメラモーションを記述してアニメーションをガイドします。

04

4. 生成

StandardまたはProモードを選択します。動画の再生時間は音声の長さに自動的に合わせられます。

Kling Avatar V2の機能

  • 精密なリップシンク

    子音、母音、ポーズを含む発話パターンに追従するフレーム精度のリップムーブメントです。

  • 自然な頭の動き

    リアルな出力のために、会話パターンに合わせた微妙な頭の傾き、うなずき、動きを生成します。

  • 表情制御

    音声のトーンとオプションのプロンプトガイダンスに基づいて、適切な表情を生成します。

  • 多言語リップシンク

    複数の言語でリップシンクに対応しています。英語と中国語の音声で最良の結果が得られます。

  • 柔軟なキャラクタータイプ

    リアルなポートレート、イラストキャラクター、アニメの顔、3Dレンダリング、スタイライズドアートワークをアニメーション化できます。

  • プロンプトガイド付きアニメーション

    テキストプロンプトで音声駆動アニメーション以外の特定のジェスチャー、感情、カメラの動きを追加できます。

Kling Avatar V2の料金

音声の再生時間に基づく秒単位の料金設定です。

  • Standardモード

    クイックプレビューやドラフト向けの低コストオプションです。

  • Proモード

    より精細な顔のディテールとスムーズなモーションの高品質出力です。

Kling Avatar V2の活用シーン

Avatar V2は、音声駆動で静止ポートレートをトーキング動画に変換するために設計されています。

  • 教育コンテンツ

    1枚の写真とナレーション録音から、オンラインコースやチュートリアル向けの講師トーキング動画を作成します。

  • マーケティング・解説動画

    撮影なしで、商品デモ、FAQ回答、ブランドメッセージ向けのスポークスパーソン動画を制作します。

  • ポッドキャストの可視化

    ポッドキャスト音声をSNSプロモーションやYouTubeアップロード用のトーキングヘッド動画クリップに変換します。

  • 多言語コンテンツ

    翻訳された音声トラックから、同じスポークスパーソンが異なる言語で話す動画を生成します。

Kling Avatar V2 のスペックとクレジット料金

Kling Avatar V2 はトーキングヘッド/リップシンク用モデルです。音声トラックからキャラクターを動かすため、クリップの長さは音声の長さに従います。Standardの毎秒10クレジットは動画ラインナップ最安のベースレートです。

Standardモード — 10クレジット/秒

Kling動画モデル中で最安のベースレート。

Proモード — 20クレジット/秒

より高い忠実度。

1080p / 48fps

滑らかなトーキングヘッド出力。

長さは音声に従う

固定のクリップ長ではありません。

トーキングヘッド向き

リップシンクの話者、解説動画、LinkedIn風動画に。

よくある質問

明るく鮮明な正面向きのポートレートが最適です。髪、手、アクセサリーで顔が大きく隠れていないことが重要です。最小解像度300px。

MP3、WAV、M4A、AAC。最大ファイルサイズ5MB。最良のリップシンク精度のために、背景ノイズが少なく音量が正規化されたクリアな音声をご使用ください。

動画の再生時間は音声の長さに自動的に合わせられます。固定の上限はありませんが、短いクリップ(60秒以内)の方がより安定した結果が得られます。

はい。リアルな写真、漫画イラスト、アニメキャラクター、3Dレンダリング、動物のポートレートにも対応しています。顔の特徴がはっきり定義されていることが重要です。

複数の言語でリップシンクに対応しています。英語と中国語が最も正確な結果を得られます。その他の言語も対応していますが、精度がやや低下する場合があります。

はい。オプションのテキストプロンプトで特定のジェスチャー、感情、カメラの動きを記述できます。例: 「フレンドリーな笑顔でうなずきながら話す」。

1080p解像度、48フレーム/秒です。標準的な動画(24-30fps)より高いため、より滑らかな顔の動きが実現されます。

Avatar V2はお手持ちの音声ファイルで駆動するトーキングヘッドコンテンツに特化しています。Kling 2.6はテキストプロンプトから動画と音声の両方を生成します。特定の音声をリップシンクしたい場合はAvatar V2をご利用ください。

いいえ。リアルな写真、AI生成の顔、イラスト、3Dキャラクターなど、あらゆるポートレートスタイルの画像が使用可能です。顔の特徴がはっきり見えることが重要です。

Avatar V2は顔と上半身のアニメーションに特化しています。全身モーションが必要な場合は、Kling 3.0 Motion ControlまたはKling 2.6 Motion Controlをご利用ください。

音声が加工されることはありません。アップロードした音声トラックがタイムラインそのものになります。Kling Avatar V2は音素のタイミング、間、強勢を解析し、そのタイミングに合うように口の形・表情・頭の動きをフレームごとに生成します。映像が音声に合わせて作られるのであって、その逆ではありません。出力の長さが常に音声の長さと一致するのも、背景ノイズの少ないクリアな音声ほどリップシンクが正確になるのも、この仕組みのためです。

はい。動画の長さは音声に自動で追従し、10秒のクリップは十分に安定した範囲内です。人物の同一性とシンクは60秒未満のクリップで最も安定します。それより長いトラックでは表情にわずかなドリフトが出ることがあるため、長い台本は短いセグメントに分割して個別に生成してください。課金は出力1秒単位(Standardモードで1秒10クレジット)なので、10秒のStandardクリップは100クレジットです。生成前に正確な見積もりが表示されます。

許諾がある場合に限ります。当サイトの利用規約は第三者の権利の尊重を求めており、権利を持たない著名人の画像のアップロードは、モデル内蔵のコンテンツチェックで拒否されるのが一般的です。確実に使えるのは、自分のポートレート、同意を得た出演者やクライアント、ライセンス済み画像、そしてAI生成の顔です。オリジナルのプレゼンターが必要なら、当サイトのNano Banana 2画像モデルで顔を生成し、Kling Avatar V2でアニメーションさせてください。肖像権リスクのない、完全にクリアな顔が手に入ります。
Start free — no credit card

Kling Avatar V2を試す

あらゆるポートレートを音声同期リップシンク付きのトーキング動画に変換しましょう。

他のAIモデルを見る

Kling 4.0

Kling 4.0 で音声付きの4K動画を。年間プラン不要、100無料クレジットで今日から。

Kling 3.0

のKling 3.0で動画を生成。ネイティブ4K出力、マルチショットシーケンス、統合オーディオ生成、画像から動画に対応。

Kling 3.0 4K

Kling 3.0でネイティブ4KのAI動画を生成 — モデルが直接レンダリングする本物の3840×2160解像度を、同期オーディオと60fpsのモーションで実現します。アップスケールなし、アーティファクトなし。

Kling 3.0 Turbo

Kling 3.0 TurboでAI動画を生成 — Kling 3.0の高速・低コストなバリアントです。マルチショットシーケンスとネイティブオーディオに対応し、720p(Standard)と1080p(Pro)でテキストから動画、画像から動画を作成できます。

Kling O3 4K

Kling O3でネイティブ4KのAI動画を生成 — 同期オーディオ付きの本物の3840×2160出力を、Kling 3.0と同じ4Kクレジット料金で、より高速な生成で実現します。大量4K作業のために作られています。

Kling 3.0 Omni

テキスト、画像、動画リファレンスから動画を生成・編集できる統合モデル

Kling 3.0 Motion Control

リファレンス動画のモーションを静止画に転送し、アイデンティティを保持したスムーズなアニメーションを生成

Kling O3

Kling O3 を使用して、高速かつ手頃な価格の AI ビデオを生成します。テキストからビデオへ、画像からビデオへ、マルチショット シーケンス、ネイティブ オーディオ、4K 出力を、Kling 3.0 よりも低いクレジット コストで実現します。

Kling O1

自然言語で動画を編集 -- 変更内容を記述するだけでモデルが処理します

Kling 2.6

高品質AI動画のための決定版モデル。Kling 2.6は業界最高水準のモーション一貫性、リアルなリップシンク、豊かなサウンドデザインを、たった一つのプロンプトから実現します。

Kling 2.6 Motion Control

動画内の要素の動きを制御 -- パスの描画、リファレンスクリップからのモーション転送、最大6要素のアニメーション

Kling 2.5 Turbo

Kling 2.5 Turboはテキストプロンプトまたは静止画像からネイティブオーディオ付き1080pクリップを生成します。5または10秒、70クレジットから。

Kling 2.1

Kling 2.1は静止画像をシネマティックなモーションにアニメーション化します。フレームをアップロードし、動きを説明すれば、一律70クレジットで5秒または10秒のクリップが得られます。

Kling O3 Image

Kling O3 を使用して高品質の AI 画像を生成および編集します。リファレンス入力を使用したテキストから画像への生成と画像編集 — 1K から 4K までの解像度、複数のアスペクト比、画像ごとに 5 クレジット。

Nano Banana 2

Nano Banana 2 を使用して、超高速でフォトリアリスティックな AI 画像を生成します。幅広いアスペクト比にわたる 1K、2K、または 4K 解像度でのテキストからイメージへの生成およびイメージからイメージへの生成。