أعلنت وحدة الذكاء الاصطناعي والحوسبة السحابية التابعة لمجموعة “علي بابا” القابضة، إطلاق أحدث نماذجها مفتوحة المصدر للذكاء الاصطناعي، Wan2.2-S2V.
وهو أداة مبتكرة قادرة على تحويل صورة ثابتة ومقطع صوتي إلى فيديو سينمائي عالي الجودة لشخصيات معبرة.
في حين يعد ذلك خطوة تعزز مكانة الشركة الصينية في السباق العالمي لتطوير الذكاء الاصطناعي التوليدي.
بينما يعد النموذج الجديد، الذي تم الكشف عنه أمس الأربعاء، جزءًا من عائلة Wan2.2. والتي وصفتها الشركة، الشهر الماضي، بأنها أول نماذج توليد الفيديو الكبيرة ومفتوحة المصدر في الصناعة التي تدمج بنية “مزيج الخبراء” (MoE) المتقدمة. وفقًا لـ”scmp“.
وبحسب بيان “علي بابا كلاود” فإن نموذج Wan2.2-S2V. المدعوم بتقنية الرسوم المتحركة الموجهة بالصوت. “يقدم أداءً واقعيًا للشخصيات. يتراوح بين الحوار الطبيعي والعروض الموسيقية، ويتعامل بسلاسة مع شخصيات متعددة داخل المشهد الواحد”.

أداة احترافية لصناع المحتوى
علاوة على ذلك صمم النموذج الجديد لخدمة منشئي المحتوى المحترفين بشكل خاص. حيث يمكّنهم من “التقاط تمثيلات مرئية دقيقة ومصممة خصيصًا لتلبية متطلبات سرد القصص والتصميم”، حسبما ذكرت الشركة.
وأرجعت “علي بابا” هذا التطور إلى مجموعة البيانات السمعية والبصرية واسعة النطاق التي تم تدريب النموذج عليها. والمصممة خصيصًا لسيناريوهات الإنتاج السينمائي والتلفزيوني.
تقليص الفجوة عبر المصادر المفتوحة
يعكس إطلاق هذا النموذج سعي الشركات الصينية المتواصل لتقليص الفجوة مع نظيراتها الأمريكية في مجال الذكاء الاصطناعي.
وذلك عبر تبني نهج المصدر المفتوح. الذي يتيح كود المصدر لنماذج الذكاء الاصطناعي للمطورين الخارجيين لاستخدامه وتعديله وتوزيعه.

كما أصبح النموذج متاحًا الآن للتنزيل من منصات المطورين الشهيرة. مثل: Hugging Face وGitHub. بالإضافة إلى مجتمع ModelScope مفتوح المصدر التابع لـ”علي بابا كلاود”.
جدير بالذكر أن نموذجي Wan2.1 وWan2.2 السابقة حققت أكثر من 6.9 مليون عملية تنزيل على هذه المنصات. ما يعكس الاهتمام الكبير بتقنيات الشركة.

ولتلبية الاحتياجات المتنوعة لمنشئي المحتوى يوفر النموذج الجديد دقتي عرض مختلفتين: الدقة القياسية (). والدقة العالية ().
في حين هذا يضمن جودة مرئية عالية تناسب كلًا من محتوى وسائل التواصل الاجتماعي والعروض التقديمية الاحترافية.




















