Robotik alanında önemli bir gelişme yaşanırken, araştırmacılar dokunma ve görme duyularını birleştiren yenilikçi bir yapay zeka modeli olan ViTaPEs'i tanıttı. Bu sistem, robotların çevreyi anlama konusundaki yeteneklerini dramatik şekilde artırma potansiyeli taşıyor.
Geleneksel robotik sistemlerde görme ve dokunma duyuları genellikle ayrı ayrı işlenir, bu da kapsamlı çevresel anlayışı sınırlar. ViTaPEs modeli bu sorunu transformer mimarisini kullanarak çözüyor ve iki duyuyu etkili şekilde harmanlıyor. Model, malzemelerin dokusunu, esnekliğini ve kuvvet özelliklerini görsel bilgilerle birleştirerek zengin bir algısal deneyim yaratıyor.
Sistemin en dikkat çekici özelliği, iki aşamalı konumsal kodlama yaklaşımı kullanması. İlk aşamada her modalite için özel yerel konumsal kodlamalar uygulanırken, ikinci aşamada dikkat mekanizması öncesinde ortak bir global konumsal kodlama sistemi devreye giriyor. Bu yaklaşım, ince ayrıntıları yakalayabilen çok aşamalı uzamsal mantık yürütmeyi mümkün kılıyor.
Mevcut yöntemlerin aksine, ViTaPEs önceden eğitilmiş görme-dil modellerine ağır bağımlılık göstermiyor. Bu özellik, sistemin farklı görevler ve ortamlarda daha esnek kullanımına olanak tanıyor. Araştırmacılar, bu modelin robotların manipülasyon becerilerini önemli ölçüde geliştirebileceğini belirtiyor.