هوش مصنوعی اطلس برای درک و شبیه‌سازی جهان سه‌بعدی معرفی شد [تماشا کنید]

Rate this post

شرکت World Labs از Atlas، مدل جدید خود در زمینه هوش فضایی (Spatial Intelligence) رونمایی کرد. این مدل می‌تواند با متن، تصویر، ویدیو و داده‌های سه‌بعدی کار کند و برای تولید، بازسازی و شبیه‌سازی جهان‌های مختلف به کار گرفته شود.

World Labs می‌گوید ورودی‌های مختلف در اطلس در یک «زمینه فضایی» مشترک قرار می‌گیرند و هر تصویر نیز با موقعیت سه‌بعدی مشخصی در فضا مرتبط می‌شود. مدل سپس براساس این زمینه، خروجی تولید می‌کند.

به گفته World Labs، عملکرد Atlas با افزایش توان محاسباتی مورد استفاده برای آموزش بهتر می‌شود و این شرکت انتظار دارد با ادامه مقیاس‌دهی مدل، قابلیت‌های آن نیز افزایش پیدا کند.

هوش مصنوعی اطلس و ساخت جهان سه‌بعدی

اطلس می‌تواند با دریافت یک یا چند تصویر مرجع، نماهای جدیدی را از موقعیت و زاویه دوربین موردنظر تولید کند. مدل محتوای تصاویر ورودی و هندسه صحنه را حفظ می‌کند و می‌تواند بخش‌هایی را که در تصاویر اولیه دیده نشده‌اند، طبق اطلاعات قبلی خود تصور کند.

یکی از ویژگی‌های Atlas، استفاده از هندسه دقیق دوربین به‌عنوان ورودی است. به این ترتیب کاربر می‌تواند موقعیت و حرکت دوربین را با دقت بیشتری کنترل کند، به‌جای اینکه صرفاً حرکت دوربین را با دستور متنی توضیح دهد.

Atlas همچنین می‌تواند با ترکیب حرکت دوربین و مدیریت زمینه فضایی، ویدیوهای طولانی‌تر تولید کند. در نمونه ارائه‌شده توسط شرکت، یک ویدیوی یک‌دقیقه‌ای با وضوح ۱۴۴۰p و استفاده از تعداد محدودی تصویر مرجع تولید شده است. 

این مدل می‌تواند حتی دو تصویر نامرتبط را که در موقعیت‌های مختلفی از فضای سه‌بعدی قرار گرفته‌اند، در یک زمینه مشترک قرار دهد و فضای میان آن‌ها را تولید کند. World Labs می‌گوید مدل در چنین شرایطی می‌تواند عناصر انتقالی مانند درگاه‌ها، راهروها و فضاهای میانی را تصور کند.

مدل جدید World Labs می‌تواند با تعداد متغیری از تصاویر یک صحنه کار کند. اگر بخشی از محیط در تصاویر ورودی دیده نشده باشد، Atlas می‌تواند آن قسمت را براساس اطلاعاتی که از جهان دارد بازسازی کند. در مقابل، با افزایش تعداد تصاویر ورودی، اطلاعات بیشتری از محیط در اختیار مدل قرار می‌گیرد و میزان بخش‌های تخمینی کاهش می‌یابد.

World Labs می‌گوید Atlas معمولاً با تنها دو یا سه تصویر نیز می‌تواند بازسازی‌های درستی ارائه دهد و در ارزیابی‌های این شرکت، از مدل‌های تخصصی بازسازی سه‌بعدی عملکرد بهتری داشته است. Atlas همچنین می‌تواند بیش از ۱۰۰ تصویر را در زمینه فضایی خود دریافت کند تا محیط‌های واقعی را با جزئیات بیشتری بازسازی کند.

Atlas علاوه‌بر تولید تصاویر و ویدیو، می‌تواند خروجی‌های سه‌بعدی نیز ایجاد کند. این مدل به‌صورت بومی با تصاویر دوبعدی و نقشه‌های عمق سه‌بعدی کار می‌کند و می‌تواند جهان‌های بازسازی‌شده را به شکل سه‌بعدی ترسیم کند. اطلس فقط ساختار فضایی محیط را مدل نمی‌کند و قابلیت مدل‌سازی تغییرات جهان در طول زمان را نیز دارد. World Labs از این توانایی با عنوان شبیه‌سازی فضا-زمان یاد می‌کند و آن را برای کاربردهایی در جلوه‌های بصری و رباتیک مطرح کرده است.

هوش مصنوعی اطلس برای درک و شبیه‌سازی جهان سه‌بعدی معرفی شد [تماشا کنید]
هوش مصنوعی اطلس برای درک و شبیه‌سازی جهان سه‌بعدی معرفی شد [تماشا کنید]

World Labs یکی از کاربردهای مهم Atlas را رباتیک می‌داند. این مدل می‌تواند برای مسیریابی و کار با اشیا مفید باشد. در این فرایند، اطلس ابتدا محیط را از روی چند تصویر بازسازی می‌کند. سپس هنگام حرکت ربات در محیط شبیه‌سازی‌شده، مدل می‌تواند داده‌های تصویری و عمق مورد مشاهده دوربین‌های ربات را نیز تولید کند. به این ترتیب، محیط و دید ربات از همان مدل به دست می‌آیند.

تولید تصویر هدف اصلی Atlas نیست، اما World Labs می‌گوید این مدل می‌تواند تصاویر را نیز از روی متن تولید کند. Atlas قادر است دستورهای پیچیده را دنبال کند، متن را در تصاویر نمایش دهد و طیف متنوعی از سبک‌های بصری را بسازد.

World Labs می‌گوید اطلس اکنون به صورت Early Access در اختیار شرکای منتخب قرار گرفته است.

Rate this post

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *