Veo 3.1 هو نموذج فيديو من Google DeepMind، ومن أوائل النماذج التي تنتج الفيديو مع الصوت معًا. يفهم النموذج وصف الصوت مباشرة من النص: مشهد على الشاطئ يُضاف إليه صوت الأمواج وصراخ النوارس، والمطر في المدينة يُرفق بصوت قطرات تتساقط، وشخص يظهر في المشهد ينطق الجملة التي تحددها، متزامنة تمامًا مع حركة فمه.
تقدّم المنصة نموذج Veo 3.1 Fast — أسرع وأقل تكلفة من النسخة الكاملة، مع الحفاظ على واقعيته المميزة. ينجح النموذج في تصوير فيزياء الحركة والإضاءة والخامات بشكل مقنع، ويتعامل بثقة مع الأشخاص والمشاهد المعقدة. يمكن إنشاء الفيديوهات من نص أو من صورة؛ وتتراوح المدة بين 4 أو 6 أو 8 ثوانٍ، بدقة 720p أو 1080p وبنفس السعر.
الصوت اختياري: مع الصوت تكلف اللقطة 66 رصيد مقابل 4 ثوانٍ، وبدونه 44. يُعد Veo 3.1 خيارًا ممتازًا للإعلانات والمقاطع المصوّتة والمشاهد التي يهم فيها الواقع.