Stanford Üniversitesi araştırmacıları, yapay zekanın fiziksel dönüşüm süreçlerini birinci şahıs bakış açısından anlayabilmesi için yenilikçi bir sistem geliştirdi. EgoIn adlı bu framework, nesnelerin başlangıç ve hedef durumları arasındaki geçiş süreçlerini modelleyebiliyor.
Sistem, 'Egosentrik Talimat Edilmiş Görsel Durum Geçişi' (EIVST) olarak tanımlanan süreci kullanıyor. Bu yaklaşım, kısa bir eylem talimatı altında nesnelerin nasıl dönüştüğünü gösteren ara kareler üretebiliyor. Örneğin, bir elmanın dilimlenme sürecini veya bir kutunun açılmasını adım adım görselleştirebiliyor.
Mevcut üretken modellerin karşılaştığı iki temel zorluk var: İlk olarak, başlangıç ve hedef durumların görsel sahnelerini anlama ve birinci şahıs perspektifinden dönüşüm adımları hakkında akıl yürütme. İkinci olarak, verilen talimata uygun, tutarlı bir ara geçiş üretme ve nesne görünümünü her iki görsel durum boyunca koruma.
EgoIn framework'ü, bu zorluklara çözüm getirmek için çok adımlı geçiş süreçlerini önce çıkarıyor, sonra da ara kareleri üretiyor. Bu teknoloji, robotik sistemlerin insan hareketlerini daha iyi anlaması ve taklit etmesi için kritik bir adım oluşturuyor.