توليد الفيديو من النص هو أحد أكثر الأشياء إبهارًا التي يمكن للذكاء الاصطناعي فعلها. تصف الشخصيات والمكان والحركة وأسلوب الكاميرا والصوت، وخلال 1-3 دقائق تحصل على مقطع مدته 5-10 ثوانٍ لم يكن موجودًا من قبل.
تعتمد جودة النتيجة على وصفك. الصيغة الجيدة: من في المشهد، وماذا يحدث، وأين وبأي أجواء، وكيف تتحرك الكاميرا، وماذا يُسمع. على سبيل المثال: "قطة برتقالية تمشي في شارع طوكيو المبلل بالمطر ليلاً، لافتات النيون تنعكس في البرك، الكاميرا تتراجع ببطء، وأصوات المطر في الخلفية". يمكنك كتابة الوصف بلغتك الخاصة — يُترجم تلقائيًا.
يتصدر Gemini Omni Flash قوائم تحويل النص إلى فيديو، ويمكنه جعل الشخصيات تنطق جملًا محددة تكتبها أنت. أما MiniMax H3 Turbo فهو خيار سريع واقتصادي بدءًا من 22 رصيد. ويصوّر Kling 3 Pro مباشرة بدقة 1080p مع إضاءة سينمائية، بينما يقدّم Veo 3.1 فيزياء واقعية، وينتج Wan 3.0 مقاطع سردية متعددة اللقطات.