“görsel arama” için sonuçlar
8 sonuç bulundu. Sonuçları kategoriye göre daraltabilirsin.
Beynimiz Ararken Ne Yapar? Foveal ve Periferik Görüşün Gizli İşbirliği
Bir şey ararken gözlerimiz çevreyi tarar, ancak beynin bu süreçte nasıl çalıştığı tam olarak bilinmiyordu. Yeni bir araştırma, aktif görsel arama sırasında beynin hem merkezi (foveal) hem de çevresel (periferik) görme alanlarını eş zamanlı olarak nasıl işlediğini ortaya koydu. Maymunlar üzerinde yürütülen deneylerde, V4 ve IT adlı görsel korteks bölgelerindeki nöronların aktivitesi kaydedildi. Sonuçlar oldukça şaşırtıcıydı: Daha önce dikkat mekanizmalarının ağırlıklı olarak periferik görme alanında devreye girdiği düşünülüyordu; ancak bu çalışma, foveal bölgedeki nöronların da güçlü özellik tabanlı dikkat sinyalleri ürettiğini kanıtladı. Üstelik bu iki bölge birbirinden bağımsız değil, dinamik ve tamamlayıcı bir şekilde çalışıyor. Merkezi görüş, hedefe odaklanmayı ve tekrar bakışı sağlarken; çevresel görüş, hedefin ilk fark edilmesine ve göz hareketlerinin yönlendirilmesine katkıda bulunuyor. Bu bulgular, görsel dikkat araştırmalarında köklü bir paradigma değişimine işaret ediyor ve hem temel nörobilim hem de yapay görme sistemlerinin geliştirilmesi açısından önemli çıkarımlar sunuyor.
Tek Metin CLIP'i Nasıl Yanıltıyor? Yapay Zeka Modellerinde Hub Açığı Keşfedildi
Araştırmacılar, görsel ve metin verilerini birlikte işleyen CLIP gibi yapay zeka modellerinde kritik bir güvenlik açığı keşfetti. 'Hub metinler' olarak adlandırılan bu sorun, yüksek boyutlu embedding uzaylarında ortaya çıkıyor ve tek bir metin parçasının alakasız binlerce görsel ile yanlış şekilde eşleştirilmesine neden oluyor. Bu durum, görsel arama sistemlerinden otomatik değerlendirme metriklerine kadar pek çok uygulamada ciddi sorunlar yaratabilir. MSCOCO ve Flickr30k gibi veri setlerinde yapılan deneyler, bu hub metinlerin görsel-metin benzerlik skorlarını mantıksız şekilde yükselttiğini gösterdi.
Yapay zeka artık görsel ve kodla çalışan çok modlu öğrenme sistemleri geliştirebiliyor
Araştırmacılar, metin, görüntü ve vektör grafiklerini aynı anda anlayabilen yeni bir yapay zeka sistemi geliştirdi. mEOL adlı bu sistem, Scalable Vector Graphics (SVG) dosyalarının hem görsel hem de kod yapısını koruyarak işleyebiliyor. Geleneksel yöntemlerin aksine herhangi bir eğitim gerektirmiyor ve çok modlu büyük dil modellerini kullanarak farklı veri türlerini ortak bir anlam uzayında birleştiriyor. Sistem, her türlü girdiyi tek bir token'a özetleyerek kompakt temsiller oluşturuyor ve görsel arama uygulamalarında yüksek performans gösteriyor. Bu gelişme, yapay zekanın farklı veri türlerini entegre bir şekilde anlama yeteneğinde önemli bir adım teşkil ediyor.
Yapay Zeka Ajanları İçin Yeni 3D Görsel Arama Testi Geliştirildi
Araştırmacılar, yapay zeka ajanlarının 3D ortamlarda görsel arama yeteneklerini değerlendirmek için E3VS-Bench adlı yeni bir test sistemi geliştirdi. Bu sistem, ajanların farklı açılardan bakarak nesneleri incelemesi, kapların içini görmesi ve açıya bağlı özellikleri ayırt etmesi gibi gerçek dünyada karşılaştığımız karmaşık durumları simüle ediyor. Mevcut testlerin aksine, bu yeni sistem ajanların 5 serbestlik derecesinde hareket ederek bakış açılarını değiştirmesine olanak tanıyor. 3D Gaussian Splatting teknolojisi kullanılarak 99 yüksek kaliteli 3D sahne ve 2.014 soru ile oluşturulan bu test, yapay zeka ajanlarının gerçek dünya koşullarında nasıl performans gösterebileceğini daha doğru bir şekilde ölçmeyi hedefliyor.
HABIT: Görsel Arama Sistemlerinde Devrim Yaratacak Yeni Yapay Zeka Modeli
Araştırmacılar, kullanıcıların bir referans görsel ve metin açıklamasıyla istediği görseli bulabileceği yeni nesil arama sistemi geliştirdi. HABIT adlı bu framework, mevcut sistemlerin en büyük sorunu olan 'gürültülü veri' problemini çözmek için tasarlandı. Sistem, karşılıklı bilgi tahmin modülü ve aşamalı öğrenme yaklaşımıyla, kişiselleştirilmiş arama ve öneri sistemlerinde çığır açacak nitelikte. Özellikle e-ticaret, sosyal medya ve dijital arşiv uygulamalarında büyük potansiyele sahip olan teknoloji, yapay zekanın görsel anlama kapasitesini bir üst seviyeye taşıyor.
Yapay Zeka Artık Birden Fazla Görseli Karşılaştırarak Akıl Yürütebiliyor
Araştırmacılar, görsel-dil modellerinin çoklu görsel üzerinde akıl yürütme yeteneklerini geliştiren yenilikçi bir öğrenme sistemi geliştirdi. S2H-DPO adlı bu sistem, yapay zekanın tek görsel analizi yerine birden fazla görseli karşılaştırarak daha karmaşık çıkarımlar yapmasını sağlıyor. Geleneksel yöntemler sadece belirli görsel indekslerle çalışırken, yeni yaklaşım modellerin küresel görsel arama ve özerk görsel karşılaştırma becerilerini kazanmasını hedefliyor. Üç kademeli öğrenme sistemi: tekil görsel analizi, çoklu görsel karşılaştırma ve küresel görsel aramayı kapsıyor.
Görsel belge aramasında devrim: Yeni sistem hızı 10 kat artırıyor
Araştırmacılar, görsel açıdan zengin belgelerde arama yapan sistemlerin performansını dramatik şekilde artıran yeni bir yaklaşım geliştirdi. 'Prune-then-Merge' adı verilen bu iki aşamalı framework, önce gereksiz bilgileri ayıklayıp ardından kalan verileri akıllıca birleştirerek hem hızı artırıyor hem de doğruluğu koruyor. Mevcut sistemler ya çok yavaş çalışıyor ya da doğruluk kaybediyor, ancak bu yeni yöntem her iki sorunu birden çözüyor. Özellikle çok sayıda görsel içerikli belgenin bulunduğu dijital arşivlerde, hukuk firmalarında ve araştırma kurumlarında büyük kolaylık sağlayacak. Sistem, düşük bilgi değeri taşıyan görsel parçaları akıllıca filtreleyerek gürültüyü azaltıyor, ardından kalan değerli bilgileri hiyerarşik bir yaklaşımla sıkıştırarak hem depolama hem de işlem maliyetlerini önemli ölçüde düşürüyor.
Yapay zeka modelleri artık görsel arama motorlarında da ustalaşıyor
Araştırmacılar, dil ve görsel yetenekleri birleştiren yapay zeka modellerinin, görsel arama sistemlerinde beklenmedik başarı gösterdiğini keşfetti. Bu modeller, herhangi bir özel eğitim almadan benzer görselleri bulma konusunda uzman sistemleri geride bırakıyor. Çalışma, çok modlu dil modellerinin sadece metin-görsel işlemlerde değil, salt görsel görevlerde de güçlü olduğunu ortaya koyuyor. Özellikle karmaşık, gürültülü ortamlarda ve küçük nesnelerin bulunduğu görüntülerde daha dayanıklı sonuçlar veriyor.