यह सिस्टम डिफ्यूजन ट्रांसफॉर्मर (DiT) और Asymmetric नॉलेज डिस्टिलेशन तकनीक पर आधारित है, जो आवाज के हिसाब से चेहरे की हरकतों को पूरी तरह सिंक्रोनाइज़ करता है। 1.2 बिलियन पैरामीटर वाले ऑडियो मॉडल की मदद से यह न सिर्फ आवाज, बल्कि साइलेंस और टोन को भी समझकर रिएक्शन देता है।
यह मॉडल लंबी वीडियो क्लिप्स को बिना क्वालिटी खराब किए तैयार कर सकता है और फोटोरियलिस्टिक इंसान, एनिमे कैरेक्टर्स और 3D अवतार जैसे कई स्टाइल्स को सपोर्ट करता है। इसे खासतौर पर रोल-प्ले, स्टोरीटेलिंग और इंटरएक्टिव वर्ल्ड-बिल्डिंग के लिए बनाया गया है, जो AI कैरेक्टर्स को पहले से कहीं ज्यादा मानवीय और जीवंत बना देता है।
Author: JAN TV Editorial Team
DISCLAIMER: इस वेबसाइट पर दी गई जानकारी केवल सामान्य एवं शैक्षणिक उद्देश्यों के लिए है। हमने जानकारी को सटीक रखने का प्रयास किया है, लेकिन इसकी पूर्णता या विश्वसनीयता की गारंटी नहीं दी जाती। तृतीय-पक्ष वेबसाइटों या स्रोतों की सामग्री पर हमारा नियंत्रण नहीं है। इस जानकारी के आधार पर लिया गया कोई भी निर्णय आपके अपने विवेक और जोखिम पर होगा।