[ad_1]
به گزارش خبرخوان
شرکت چینی تنسنت (Tencent) از مدل هوش مصنوعی جدیدی به نام HunyuanWorld-Voyager رونمایی کرده که میتواند یک عکس را به ویدیوهای سهبعدی تبدیل کند.
مطابق گزارشهای انتشار شده، این مدل تازه به کاربران اجازه میدهد مسیر حرکت دوربین را اشکار کرده و در صحنههای مجازی که بر پایه عکس تشکیل میشود، حرکت کنند. این مدل بهطور همزمان ویدیو و دادههای عمق تشکیل میکند و بدون نیاز به ابزارهای مدلسازی سنتی امکان ساخت مدلهای سهبعدی را فراهم میکند.
یقیناً نتایجی که توسط این مدل اراعه خواهد شد دقیقاً مدلهای سهبعدی نیستند، بلکه ویدیوهایی دوبعدی می باشند که با نگه داری سازگاری فضا، حرکت دوربین در یک محیط سهبعدی را همانندسازی میکنند. این چنین مدل هر بار فقط ۴۹ فریم (نزدیک به دو ثانیه ویدیو) را تشکیل میکند، اما میتوان چندین کلیپ را به هم متصل کرد و ویدیوهای چند دقیقهای ساخت.
ورودی این مدل هوش مصنوعی فقط یک عکس و مسیر حرکت دوربین است. حرکتهایی همانند روبهجلو، عقب، چرخش یا حرکت به طرفین نیز توسط رابط آن قابل تنظیم می باشند.
تنسنت میگوید این مدل هوش مصنوعی تازه با بیشتر از ۱۰۰ هزار کلیپ ویدیویی آموزش دیده است که شامل صحنههای واقعی و رندرهای Unreal Engine میشود. این دادهها بهصورت خودکار توسط نرمافزاری پردازش شدهاند که حرکت دوربین و عمق هر فریم را محاسبه میکند.
محدودیتهای مدل هوش مصنوعی تنسنت
بااینحال، محدودیتهای معماری Transformer علتمیشود مدل بتواند فقط الگوهای دیدهشده در دادههای آموزشی را همانندسازی کند و در موقعیتهای کاملاً تازه دچار اشتباه شود. به همین علت، Voyager در تشکیل چرخشهای ۳۶۰ درجهای دچار اختلال میشود.
از نظر کارکرد، در بنچمارک WorldScore متعلق به دانشگاه استنفورد، Voyager بیشترین امتیاز کلی یعنی ۷۷.۶۲ را کسب کرده است. این مدل در کنترل اشیاء، سازگاری سبک و کیفیت خروجی کارکرد فوق الاده داشته است، اما در کنترل حرکت دوربین بعد از WonderWorld در رتبه دوم قرار گرفت.
برای اجرای مدل نیز به توان سختافزاری زیاد بالایی نیاز دارد، چرا که برای خروجی 540p حداقل به ۶۰ گیگابایت حافظه گرافیکی نیاز دارد. تنسنت هماکنون وزنهای گوناگون مدل را در Hugging Face انتشار کرده و کد آن را برای اجرا در دسترس قرار داده است.
دسته بندی مطالب
اخبار کسب وکار
[ad_2]
