Veo 3.1, Google DeepMind का एक वीडियो मॉडल है, जो उन शुरुआती मॉडलों में से एक है जो वीडियो के साथ-साथ आवाज़ भी जनरेट करता है। यह मॉडल प्रॉम्प्ट में दिए गए ऑडियो विवरण को समझता है: समुद्र तट के सीन में लहरों की आवाज़ और सीगल की चीखें जुड़ जाती हैं, शहर में बारिश के सीन में बूंदों की टपटप सुनाई देती है, और फ्रेम में मौजूद प्रेजेंटर आपके दिए गए संवाद को सिंक में बोलता है।
यह सर्विस Veo 3.1 Fast ऑफर करती है — जो फुल वर्जन से तेज़ और सस्ता है, मगर उतनी ही खास रियलिज़्म के साथ। यह मोशन फिजिक्स, लाइटिंग और मटेरियल्स को बेहद विश्वसनीय तरीके से दिखाता है, और लोगों व जटिल सीन को भी बखूबी संभालता है। वीडियो टेक्स्ट या फोटो से जनरेट किए जा सकते हैं; अवधि 4, 6 या 8 सेकंड है, और 720p व 1080p रिज़ॉल्यूशन की कीमत बराबर है।
साउंड ऑप्शनल है: साउंड के साथ, 4 सेकंड के क्लिप की कीमत 66 क्रेडिट है, और बिना साउंड के — 44। Veo 3.1, विज्ञापनों, आवाज़ वाले क्लिप्स और उन सीन्स के लिए एक शानदार विकल्प है जहां रियलिज़्म मायने रखता है।