
أحدث أداة فيديو بالذكاء الاصطناعي تنتشر بسرعة هذا الأسبوع هي Avatar V من HeyGen، التي أُعلن عنها في 8 أبريل وحصدت 472,000 مشاهدة على X، والتي تبني توأمًا رقميًا فائق الواقعية لوجه المستخدم وصوته وإيماءاته من تسجيل واحد مدته 15 ثانية عبر كاميرا الويب، ثم تُنشئ فيديوهات بجودة استوديو غير محدودة دون أي معدات احترافية.
تصف صفحة الإطلاق الرسمية لـ HeyGen أن Avatar V مبني على اعتقاد واحد: يجب أن يكون الناتج جيدًا بما يكفي ليقبل المستخدمون أن يضعوا أسماءهم عليه، ليس جيدًا بالنسبة للذكاء الاصطناعي، بل جيدًا فحسب. تم تدريب النموذج على ما تسميه HeyGen "تضمين الهوية المرتكز زمنيًا" (temporally grounded identity embedding) والمبني من مقطع الـ 15 ثانية، وهو يلتقط الإيماءات المحددة وانتقالات التعبير التي تجعل الشخص معروفًا بذاته عبر سياقات مختلفة. تظل اللقطات الواسعة والإطارات المتوسطة واللقطات المقربة متسقة من تسجيل واحد. لا تتطلب العملية إضاءة استوديو أو فريق عمل؛ هاتف قياسي أو كاميرا ويب يكفيان.
المبدأ التصميمي الأساسي هو فصل الهوية عن المظهر. يحدد مقطع الـ 15 ثانية كيفية تحرك الشخص. تحدد صورة أساسية منفصلة كيف يبدون. يمكن للمستخدمين بعد ذلك تغيير المظهر بحرية بينما تظل الحركة خاصة بهم بشكل لا لبس فيه.
معظم أنظمة صور الأفاتار بالذكاء الاصطناعي تُحسن لأجل لحظة واحدة مثيرة للإعجاب: لقطة الشاشة، المقطع القصير، العرض التجريبي المتحكّم فيه حيث يعمل كل شيء لصالح النموذج. تبدو واضحة في ثانيتين وتنهار في عشرين ثانية مع انجراف الوجه عن المصدر. صُمم Avatar V خصيصًا للحفاظ على الأداء طوال مدة تشغيل الفيديو بالكامل دون هذا الانجراف. تصف HeyGen هذا بأنه اتساق الهوية: نفس الوجه، نفس التعبيرات الدقيقة، نفس الحضور من الإطار الأول إلى الأخير، عبر مقطع مدته 30 ثانية أو وحدة مدتها 10 دقائق.
سير العمل العملي يتكون من ثلاث خطوات: تسجيل فيديو لمدة 15 ثانية، تسجيل نسخة صوتية مستقلة اختياريًا، ثم اختيار صورة أساسية كمرجع للهوية لكل مشهد يتم إنشاؤه بعد ذلك. من هذا الأساس، يكتب المستخدمون مطالبات لإنشاء أزياء وإعدادات وأنماط جديدة، أو يستخدمون مكتبة HeyGen. يمكن تسليم الفيديو النهائي بأي من 175 لغة مع مزامنة الشفاه المتكيفة مع اللغة المستهدفة تلقائيًا. تنصح HeyGen المستخدمين بأن يكونوا معبرين أثناء التسجيل لأن، كما قالت الشركة، “الطاقة التي تضعها هي الطاقة التي تحصل عليها.”
كما أفادت crypto.news، تعمل أدوات الذكاء الاصطناعي التي تقلل من تكلفة ووقت إنتاج المحتوى الاحترافي على إعادة تشكيل قرارات عدد الموظفين في الشركات مباشرة بحلول عام 2026. وكما أشارت crypto.news، فإن انتشار أدوات محتوى الذكاء الاصطناعي هو عامل رئيسي في كيفية تقييم المستثمرين المؤسسيين لمتانة الإنفاق على البنية التحتية للذكاء الاصطناعي. يتوفر Avatar V الآن بالكامل من خلال خطط HeyGen المدفوعة، مع إمكانية الوصول إلى المجموعة الكاملة من قوالب المنصة وأدوات الترجمة والاستوديو.





