كشفت شركة الذكاء الاصطناعي Midjourney مؤخرا عن خطوتها الرئيسية التالية إلى الأمام. بعد سنوات من عرض الصور الثابتة والتركيز عليها ، تتطلع Midjourney الآن إلى التوسع في عالم إنشاء الفيديو ، وتحديدا التوليد في الوقت الفعلي.
هذا متاح الآن كجزء من Version 1 من Video Model ، والذي يوصف بأنه "شيء ممتع وسهل وجميل وبأسعار معقولة حتى يتمكن الجميع من استكشافه". في الوقت الحالي ، يهدف النظام إلى تحويل الصور إلى فيديو باستخدام ميكانيكي موجه الحركة المتحرك. بشكل أساسي ، يضفي الحياة والحركة على الصورة الثابتة ، والتي يمكن تعديلها اعتمادا على مستوى الحركة الذي يجب توقعه من الصورة المصدر المعنية.
بالمقارنة مع برامج الفيديو الذكاء الاصطناعي المنافسة ، قد يبدو أن Midjourney متأخر قليلا ، لكنه يشير إلى أن هذا مجرد نقطة انطلاق نحو هدف أكبر بكثير. الهدف طويل المدى هو أن تكون قادرا على تقديم محاكاة في العالم المفتوح في الوقت الفعلي ، والوصول إلى هناك يعني أيضا القدرة على التنقل عبر النماذج ثلاثية الأبعاد للفيديو الذي تم إنشاؤه ، ثم أيضا إنشاء كل شيء بسرعة كبيرة. هذه النقاط الأخيرة هي الخطوات التالية نحو جعل هدف Midjourney حقيقة واقعة. في كلمات Midjourney الخاصة:
"ما قد لا تعرفه هو أننا نعتقد أن الوجهة الحتمية لهذه التكنولوجيا هي نماذج قادرة على محاكاة العالم المفتوح في الوقت الفعلي.
"ما هذا؟ اساسا; تخيل نظام الذكاء الاصطناعي الذي يولد صورا في الوقت الفعلي. يمكنك أن تأمر بالتحرك في الفضاء ثلاثي الأبعاد ، وتتحرك البيئات والشخصيات أيضا ، ويمكنك التفاعل مع كل شيء.
"من أجل القيام بذلك ، نحتاج إلى لبنات بناء. نحن بحاجة إلى مرئيات (نماذج الصور الأولى لدينا). نحن بحاجة إلى تحريك هذه الصور (نماذج الفيديو). نحن بحاجة إلى أن نكون قادرين على تحريك أنفسنا عبر الفضاء (نماذج ثلاثية الأبعاد) ونحتاج إلى أن نكون قادرين على القيام بكل هذا بسرعة (نماذج في الوقت الفعلي).
"يتضمن العام المقبل بناء هذه القطع بشكل فردي ، وإطلاقها ، ثم ببطء ، تجميعها معا في نظام واحد موحد. قد يكون مكلفا في البداية ، ولكن في وقت أقرب مما تعتقد ، سيكون الجميع قادرين على استخدامه ".
المشكلة في برنامج الفيديو هذا هي أنه أغلى بكثير في الاستخدام. Midjourney تتقاضى 8 أضعاف ما تتقاضاه مقابل وظيفة الصورة ، والتي تصفها لا تزال "أرخص بأكثر من 25 مرة مما شحنه السوق من قبل".