テキスト、画像、動画リファレンスから動画を生成・編集できる統合モデル








Kling 3.0 Omniは、テキスト、画像、動画を入力として受け付ける統合マルチモーダル動画モデルです。テキストから動画、画像から動画、リファレンスベースの生成、動画編集を一つのパイプラインに統合し、ネイティブ音声出力にも対応しています。
テキストプロンプト、リファレンス画像(最大7枚)、既存の動画クリップを一つのモデルに入力できます。
リファレンスクリップを提供し、自然言語で変更内容を記述して既存の動画を編集できます。
リファレンス画像を使用して、複数のショットやシーンにわたって同じキャラクターの外観を維持します。
リファレンス画像や動画のビジュアルスタイルを生成コンテンツに適用できます。
テキストプロンプトから始めるか、スタイル一貫性のためにリファレンス画像をアップロードするか、編集用の動画を提供します。
キャラクターやスタイルの一貫性のためにリファレンス画像を最大7枚アップロードできます。動画編集にはリファレンス動画(3-10秒、最大200MB)を追加します。
StandardまたはProモード、アスペクト比(16:9、9:16、1:1)、再生時間(3-15秒)、音声生成の有無を選択します。
モデルがすべての入力を統合処理し、同期音声付きの動画を出力します。
最大7枚のリファレンス画像(動画と併用時は4枚)をアップロードして、キャラクターの外観やビジュアルスタイルをガイドできます。
リファレンス動画を提供して編集内容を記述すると、モデルがモーションを保持しながら変更を適用します。
スタイル転送には「feature」モード、モーション保持付きの直接動画編集には「base」モードを使用します。
シーケンス全体で一貫したキャラクターを持つ最大6つの連続ショットを作成できます。
セリフ、効果音、環境音を含む同期音声を生成します。
動画編集時に、リファレンスクリップの元の音声トラックをそのまま保持できます。
モード選択に基づく秒単位の料金設定です。
1秒あたり$0.112。10秒の動画で$1.12です。
1秒あたり$0.168で、より高品質な出力が得られます。10秒の動画で$1.68です。
リファレンスベースの制御や動画編集機能が必要な場合にOmniが最適です。
ブランドのリファレンス画像をアップロードして、キャンペーン全体でビジュアルアイデンティティに合った動画を生成します。
被写体のリファレンス画像を提供することで、複数のシーンにわたって同じキャラクターを維持します。
元のモーションとタイミングを保持しながら、既存の映像を異なるビジュアルスタイルに変換します。
同じリファレンスから異なるスタイルや設定で商品動画の複数バージョンを生成します。
Kling 3.0 Omni はマルチモーダルで編集対応の上位ティアです。ベースの3.0より毎秒コストが高い(Standardで45対35)代わりに、より幅広い入力対応と長い単一生成が可能です。
音声なし45、音声付き60。
音声なし60、音声付き70。
ベースのKling 3.0より長い単一クリップ。
単なる生成を超えたモデル内動画編集。
編集や長尺が必要なら3.0からステップアップ。
Kling 4.0 でシネマティックな4K AI動画を生成 — 最新世代のフラッグシップ Kling ティアです。ネイティブオーディオ、マルチショットシーケンス、一貫したキャラクターで、テキストや画像を動画に変換。Kling 4.0 Lite なら無料で始められ、Fast、Standard、Pro、4K へステップアップできます。
のKling 3.0で動画を生成。ネイティブ4K出力、マルチショットシーケンス、統合オーディオ生成、画像から動画に対応。
Kling 3.0でネイティブ4KのAI動画を生成 — モデルが直接レンダリングする本物の3840×2160解像度を、同期オーディオと60fpsのモーションで実現します。アップスケールなし、アーティファクトなし。
Kling 3.0 TurboでAI動画を生成 — Kling 3.0の高速・低コストなバリアントです。マルチショットシーケンスとネイティブオーディオに対応し、720p(Standard)と1080p(Pro)でテキストから動画、画像から動画を作成できます。
Kling O3でネイティブ4KのAI動画を生成 — 同期オーディオ付きの本物の3840×2160出力を、Kling 3.0と同じ4Kクレジット料金で、より高速な生成で実現します。大量4K作業のために作られています。
リファレンス動画のモーションを静止画に転送し、アイデンティティを保持したスムーズなアニメーションを生成
Kling O3 を使用して、高速かつ手頃な価格の AI ビデオを生成します。テキストからビデオへ、画像からビデオへ、マルチショット シーケンス、ネイティブ オーディオ、4K 出力を、Kling 3.0 よりも低いクレジット コストで実現します。
あらゆるポートレートを音声同期リップシンク付きのトーキング動画に変換。1080p 48fps対応
高品質AI動画のための決定版モデル。Kling 2.6は業界最高水準のモーション一貫性、リアルなリップシンク、豊かなサウンドデザインを、たった一つのプロンプトから実現します。
動画内の要素の動きを制御 -- パスの描画、リファレンスクリップからのモーション転送、最大6要素のアニメーション
Kling O3 を使用して高品質の AI 画像を生成および編集します。リファレンス入力を使用したテキストから画像への生成と画像編集 — 1K から 4K までの解像度、複数のアスペクト比、画像ごとに 5 クレジット。
Nano Banana 2 を使用して、超高速でフォトリアリスティックな AI 画像を生成します。幅広いアスペクト比にわたる 1K、2K、または 4K 解像度でのテキストからイメージへの生成およびイメージからイメージへの生成。