Yapay zeka alanında 3D görsel algılama teknolojilerinde önemli bir adım atıldı. Sürekli video akışlarından gerçek zamanlı 3D sahne analizi yapan Visual Geometry Transformer (VGGT) sistemlerinin en büyük sorunu olan bellek yönetimi için yeni bir çözüm geliştirildi.

StreamVGGT gibi mevcut sistemler güçlü çevrimiçi 3D algılama yetenekleri sunmasına rağmen, uzun video akışları sırasında anahtar-değer (KV) bellek önbellekleri sürekli büyüyerek pratik kullanımı zorlaştırıyordu. Bu durum özellikle uzun süreli gözetleme, otonom araç navigasyonu gibi uygulamalarda ciddi sınırlamalar yaratıyordu.

Yeni geliştirilen FrameVGGT yaklaşımı, geometrik destek perspektifinden soruna yaklaşıyor. Dil modellemeden farklı olarak, geometri tabanlı akıl yürütme süreçlerinin birbirleriyle uyumlu çoklu görüş desteğine ihtiyaç duyduğunu vurgulayan araştırmacılar, token düzeyindeki bellek tutma stratejilerinin geometrik desteği parçaladığını ve uzun vadeli kararlı çıkarımları zorlaştırdığını tespit etti.

FrameVGGT, her video karesinin artımlı KV katkısını tutarlı bir kare düzeyinde segment olarak organize ediyor. Her segment hafif bir anahtar-alan prototipi ile özetleniyor ve sabit kapasiteli bir bellek yapısında tamamlayıcı segmentler korunuyor. Bu yöntem sayesinde sistem, bellek sınırları içinde kalarak daha etkili 3D sahne analizi gerçekleştiriyor.