Kling Avatar V2

حوّل أي صورة شخصية إلى فيديو ناطق مع مزامنة الشفاه مع الصوت بدقة 1080p و48 إطارًا في الثانية

Kling Avatar V2

مولّد الفيديو
صورة بورتريه *(0/1)
ملف صوتي *(0/1)
0 / 2000
التكلفة 50 رصيدالرصيد المتبقي 0
معاينة الفيديو
Cinematic war scene AI video generated with Kling
Luxury car on a night drive, AI video generated with Kling
Dark fantasy monster rider AI video generated with Kling
Motorcycle racing on a track, AI video generated with Kling
Airport storm and flooding VFX AI video generated with Kling
Anime girl on a mountain road, AI video generated with Kling
Cyberpunk female warrior AI video generated with Kling
Fantasy dragon queen in the snow, AI video generated with Kling

ما هو Kling Avatar V2؟

يحوّل Kling Avatar V2 صورة شخصية ثابتة إلى فيديو ناطق مدفوع بملف صوتي. قم بتحميل صورة وجه ومقطع صوتي - يولد النموذج حركات شفاه طبيعية وتعبيرات وجه وحركة رأس خفيفة متزامنة مع الكلام. الإخراج بدقة 1080p و48 إطارًا في الثانية.

  • مزامنة الشفاه المدفوعة بالصوت

    تتطابق حركات الشفاه مع الصوت بدقة، بما في ذلك الوقفات والتأكيد وإيقاع الكلام الطبيعي.

  • دقة 1080p بمعدل 48 إطارًا في الثانية

    إخراج عالي الدقة مع 48 إطارًا سلسًا في الثانية للحصول على حركة طبيعية المظهر.

  • دعم أنماط متعددة

    يعمل مع الصور الواقعية وشخصيات الكرتون ووجوه الأنمي وحتى صور الحيوانات.

  • مدة تلقائية

    يتطابق طول الفيديو تلقائيًا مع مدة الملف الصوتي - لا حاجة للقص اليدوي.

كيفية استخدام Kling Avatar V2

01

1. تحميل صورة شخصية

قدم صورة شخصية واضحة ومواجهة للأمام. JPG أو PNG، بحد أقصى 10 ميجابايت، بحد أدنى 300 بكسل. الصور المضاءة جيدًا مع وجه مرئي تعمل بشكل أفضل.

02

2. تحميل الصوت

أضف ملفك الصوتي. تنسيق MP3 أو WAV أو M4A أو AAC، بحد أقصى 5 ميجابايت. الكلام الواضح مع الحد الأدنى من ضوضاء الخلفية يعطي أفضل مزامنة للشفاه.

03

3. إضافة وصف (اختياري)

صف حركات الرأس المرغوبة أو العواطف أو حركة الكاميرا لتوجيه الرسوم المتحركة بما يتجاوز مزامنة الشفاه.

04

4. التوليد

اختر الوضع القياسي أو الاحترافي. تتطابق مدة الفيديو مع طول الصوت تلقائيًا.

ميزات Kling Avatar V2

  • مزامنة دقيقة للشفاه

    حركات شفاه دقيقة للإطار تتبع أنماط الكلام، بما في ذلك الحروف الساكنة والمتحركة والوقفات.

  • حركة رأس طبيعية

    إمالات رأس خفيفة وإيماءات وحركات تتطابق مع أنماط المحادثة للحصول على إخراج واقعي.

  • التحكم في تعبيرات الوجه

    يولد النموذج تعبيرات وجه مناسبة بناءً على نبرة الكلام وتوجيه الوصف الاختياري.

  • مزامنة شفاه متعددة اللغات

    يدعم مزامنة الشفاه عبر لغات متعددة. أفضل النتائج مع الصوت الإنجليزي والصيني.

  • أنواع شخصيات مرنة

    تحريك الصور الواقعية والشخصيات المرسومة ووجوه الأنمي والرسومات ثلاثية الأبعاد والأعمال الفنية المنمقة.

  • رسوم متحركة موجهة بالوصف

    استخدم أوصاف نصية لإضافة إيماءات أو عواطف أو حركات كاميرا محددة بما يتجاوز الرسوم المتحركة المدفوعة بالصوت.

أسعار Kling Avatar V2

التسعير بالثانية بناءً على مدة الصوت.

  • الوضع القياسي

    خيار أقل تكلفة للمعاينات السريعة والمسودات.

  • الوضع الاحترافي

    إخراج عالي الجودة مع تفاصيل وجه أفضل وحركة أكثر سلاسة.

متى تستخدم Kling Avatar V2

Avatar V2 مصمم لتحويل الصور الشخصية الثابتة إلى مقاطع فيديو ناطقة مدفوعة بالصوت.

  • المحتوى التعليمي

    إنشاء مقاطع فيديو مدرب ناطق من صورة واحدة وتسجيل صوتي للدورات والبرامج التعليمية عبر الإنترنت.

  • التسويق والشروحات

    إنتاج مقاطع فيديو متحدث رسمي لعروض المنتجات وردود الأسئلة الشائعة ورسائل العلامة التجارية دون تصوير.

  • تصور البودكاست

    تحويل صوت البودكاست إلى مقاطع فيديو رأس ناطق للترويج على وسائل التواصل الاجتماعي وتحميلات YouTube.

  • المحتوى متعدد اللغات

    توليد نفس المتحدث الرسمي يتحدث لغات مختلفة من مسارات صوتية مترجمة.

مواصفات Kling Avatar V2 وتكلفة الكريديت

Kling Avatar V2 هو نموذج المتحدث/مزامنة الشفاه: يحرّك شخصية من مسار صوتي، لذا تتبع مدة المقطع طول صوتك. بسعر 10 كريديت في الثانية في Standard، فهو أرخص سعر أساسي في مجموعة الفيديو.

وضع Standard — 10 كريديت/ثانية

أرخص سعر أساسي بين نماذج فيديو Kling.

وضع Pro — 20 كريديت/ثانية

إخلاص أعلى.

1080p بمعدل 48fps

إخراج متحدث سلس.

المدة تتبع صوتك

ليست مدة مقطع ثابتة.

مثالي للمتحدثين

متحدثون بمزامنة الشفاه، فيديوهات شرح، وفيديوهات بأسلوب LinkedIn.

الأسئلة الشائعة

صورة شخصية واضحة ومواجهة للأمام مع إضاءة جيدة. يجب أن يكون الوجه مرئيًا بالكامل دون انسداد كبير من الشعر أو اليدين أو الإكسسوارات. دقة لا تقل عن 300 بكسل.

MP3 وWAV وM4A وAAC. الحد الأقصى لحجم الملف 5 ميجابايت. استخدم كلامًا واضحًا مع الحد الأدنى من ضوضاء الخلفية وحجم صوت طبيعي لأفضل دقة لمزامنة الشفاه.

تتطابق مدة الفيديو مع طول الصوت تلقائيًا. لا يوجد حد أقصى ثابت، ولكن المقاطع الأقصر (أقل من 60 ثانية) تنتج نتائج أكثر اتساقًا.

نعم. يدعم الصور الواقعية ورسوم الكرتون التوضيحية وشخصيات الأنمي والرسومات ثلاثية الأبعاد وحتى صور الحيوانات. يجب أن يكون للوجه ملامح محددة بوضوح.

تعمل مزامنة الشفاه عبر لغات متعددة. الإنجليزية والصينية تنتج النتائج الأكثر دقة. اللغات الأخرى مدعومة ولكن قد يكون لها دقة أقل قليلاً.

نعم. استخدم الوصف النصي الاختياري لوصف إيماءات أو عواطف أو حركات كاميرا محددة. على سبيل المثال: 'الإيماء أثناء التحدث مع ابتسامة ودية'.

دقة 1080p بمعدل 48 إطارًا في الثانية. هذا أعلى من الفيديو القياسي (24-30 إطارًا في الثانية)، مما ينتج عنه حركات وجه أكثر سلاسة.

Avatar V2 متخصص في محتوى الرأس الناطق المدفوع بملف الصوت الخاص بك. يولد Kling 2.6 كلاً من الفيديو والصوت من وصف نصي. استخدم Avatar V2 عندما يكون لديك صوت محدد لمزامنة الشفاه.

لا. أي صورة بنمط شخصي تعمل - صور حقيقية أو وجوه مولدة بالذكاء الاصطناعي أو رسوم توضيحية أو شخصيات ثلاثية الأبعاد. المتطلب الرئيسي هو وجه واضح ومرئي مع ملامح محددة.

يركز Avatar V2 على رسوم متحركة للوجه والجزء العلوي من الجسم. للحركة الكاملة للجسم، استخدم Kling 3.0 Motion Control أو Kling 2.6 Motion Control بدلاً من ذلك.

لا يتم تعديل الصوت أبدًا. المقطع الذي ترفعه هو الخط الزمني نفسه: يحلل Kling Avatar V2 الكلام — توقيت الفونيمات والوقفات والنبرة — ثم يولّد أشكال الفم وتعابير الوجه وحركة الرأس إطارًا بإطار لتطابق ذلك التوقيت. الفيديو هو الذي يُبنى ليلائم الصوت، وليس العكس. ولهذا السبب يساوي طول الناتج دائمًا طول الصوت، ولهذا ينتج الكلام الواضح مع ضوضاء خلفية قليلة أدق مزامنة للشفاه.

نعم. تتبع المدة الصوت تلقائيًا، ومقطع 10 ثوانٍ يقع تمامًا ضمن النطاق المستقر — وتظل الهوية والمزامنة في أفضل حالاتهما في المقاطع الأقصر من 60 ثانية. في المقاطع الأطول بكثير قد يظهر انحراف طفيف في التعابير، لذا قسّم النصوص الطويلة إلى مقاطع أقصر وولّد كلًا منها على حدة. الفوترة بالثانية من الناتج (10 نقاط لكل ثانية في وضع Standard)، أي أن مقطع Standard مدته 10 ثوانٍ يكلف 100 نقطة، ويعرض المولّد التقدير الدقيق قبل الإنشاء.

بإذن فقط. تُلزم شروط الخدمة لدينا باحترام حقوق الأطراف الثالثة، ورفع صور شخصيات عامة يمكن التعرف عليها دون امتلاك الحقوق عادةً ما ترفضه فحوصات المحتوى المدمجة في النموذج. ما ينجح بشكل موثوق: صورتك الشخصية، وممثلون أو عملاء منحوا موافقتهم، وصور مرخّصة، ووجوه مولّدة بالذكاء الاصطناعي. إذا كنت بحاجة إلى مقدّم أصلي، فولّد وجهًا بنموذج الصور Nano Banana 2 على هذا الموقع ثم حرّكه بـ Kling Avatar V2 — وجه خالٍ تمامًا من أي مخاطر تتعلق بحقوق الصورة.
Start free — no credit card

جرب Kling Avatar V2

حوّل أي صورة شخصية إلى فيديو ناطق مع مزامنة الشفاه مع الصوت.

استكشف نماذج AI أخرى

Kling 4.0

أنشئ فيديو سينمائياً بدقة 4K مع Kling 4.0 — فئتنا الرائدة من أحدث جيل من Kling. حوّل النصوص أو الصور إلى فيديو مع صوت أصلي وتسلسل متعدد اللقطات وشخصيات ثابتة. ابدأ مجاناً مع Kling 4.0 Lite، أو ارتقِ إلى Fast و Standard و Pro و 4K.

Kling 3.0

أنشئ فيديوهات بأحدث نموذج Kling 3.0. دقة 4K أصلية، تسلسل لقطات متعددة، توليد صوت مدمج، ودعم تحويل الصورة إلى فيديو.

Kling 3.0 4K

أنشئ فيديو 4K أصلياً بالذكاء الاصطناعي مع Kling 3.0 — دقة حقيقية 3840×2160 يولّدها النموذج مباشرة، مع صوت متزامن وحركة بمعدل 60 إطاراً في الثانية. دون رفع للدقة ودون تشوهات.

Kling 3.0 Turbo

أنشئ فيديو بالذكاء الاصطناعي مع Kling 3.0 Turbo — النسخة السريعة والأقل تكلفة من Kling 3.0. تسلسل لقطات متعددة وصوت أصلي، وتحويل النص والصورة إلى فيديو بدقة 720p (القياسي) و1080p (الاحترافي).

Kling O3 4K

أنشئ فيديو 4K أصلياً بالذكاء الاصطناعي مع Kling O3 — إخراج حقيقي 3840×2160 مع صوت متزامن، بسعر رصيد 4K نفسه لـ Kling 3.0 لكن بتوليد أسرع. مصمم لأعمال 4K عالية الحجم.

Kling 3.0 Omni

توليد وتحرير مقاطع الفيديو من النص والصور ومراجع الفيديو في نموذج موحد واحد

Kling 3.0 Motion Control

نقل الحركة من أي فيديو مرجعي إلى صورة ثابتة مع الحفاظ على الهوية ورسوم متحركة سلسة

Kling O3

أنشئ مقاطع فيديو سريعة وبأسعار معقولة بتقنية الذكاء الاصطناعي باستخدام Kling O3. تحويل نص إلى فيديو، وصورة إلى فيديو، وتسلسل اللقطات المتعددة، والصوت الأصلي، وإخراج 4K - بتكلفة ائتمانية أقل من Kling 3.0.

Kling O1

تحرير مقاطع الفيديو بلغة طبيعية - صف ما تريد تغييره ويتولى النموذج الباقي

Kling 2.6

النموذج الأمثل لإنشاء فيديو سينمائي بالذكاء الاصطناعي مع صوت أصلي. يقدم Kling 2.6 اتساق حركة رائد في المجال، ومزامنة شفاه واقعية، وتصميم صوتي غني — كل ذلك من وصف نصي واحد.

Kling 2.6 Motion Control

التحكم في كيفية تحرك العناصر في الفيديو - رسم المسارات، نقل الحركة من المقاطع المرجعية، تحريك ما يصل إلى 6 عناصر

Kling 2.5 Turbo

Kling 2.5 Turbo يولد مقاطع 1080p مع صوت أصلي من موجه نصي أو صورة ثابتة. 5 أو 10 ثوانٍ، بدءًا من 70 رصيد.

Kling 2.1

Kling 2.1 يحرك صورة ثابتة إلى حركة سينمائية. ارفع إطارًا، صف الحركة، واحصل على مقطع 5 أو 10 ثوانٍ مقابل 70 credits ثابتة.

Kling O3 Image

قم بإنشاء وتحرير صور AI عالية الجودة باستخدام Kling O3. إنشاء نص إلى صورة وتحرير الصور باستخدام المدخلات المرجعية — دقة 1K إلى 4K، ونسب عرض إلى ارتفاع متعددة، و5 وحدات دراسية لكل صورة.

Nano Banana 2

أنشئ صورًا واقعية فائقة السرعة بتقنية الذكاء الاصطناعي باستخدام Nano Banana 2. إنشاء نص إلى صورة وصورة إلى صورة بدقة 1K أو 2K أو 4K عبر نطاق واسع من نسب العرض إلى الارتفاع.