“görsel arama” için sonuçlar
7 sonuç bulundu. Sonuçları kategoriye göre daraltabilirsin.
Tek Metin CLIP'i Nasıl Yanıltıyor? Yapay Zeka Modellerinde Hub Açığı Keşfedildi
Araştırmacılar, görsel ve metin verilerini birlikte işleyen CLIP gibi yapay zeka modellerinde kritik bir güvenlik açığı keşfetti. 'Hub metinler' olarak adlandırılan bu sorun, yüksek boyutlu embedding uzaylarında ortaya çıkıyor ve tek bir metin parçasının alakasız binlerce görsel ile yanlış şekilde eşleştirilmesine neden oluyor. Bu durum, görsel arama sistemlerinden otomatik değerlendirme metriklerine kadar pek çok uygulamada ciddi sorunlar yaratabilir. MSCOCO ve Flickr30k gibi veri setlerinde yapılan deneyler, bu hub metinlerin görsel-metin benzerlik skorlarını mantıksız şekilde yükselttiğini gösterdi.
Yapay zeka artık görsel ve kodla çalışan çok modlu öğrenme sistemleri geliştirebiliyor
Araştırmacılar, metin, görüntü ve vektör grafiklerini aynı anda anlayabilen yeni bir yapay zeka sistemi geliştirdi. mEOL adlı bu sistem, Scalable Vector Graphics (SVG) dosyalarının hem görsel hem de kod yapısını koruyarak işleyebiliyor. Geleneksel yöntemlerin aksine herhangi bir eğitim gerektirmiyor ve çok modlu büyük dil modellerini kullanarak farklı veri türlerini ortak bir anlam uzayında birleştiriyor. Sistem, her türlü girdiyi tek bir token'a özetleyerek kompakt temsiller oluşturuyor ve görsel arama uygulamalarında yüksek performans gösteriyor. Bu gelişme, yapay zekanın farklı veri türlerini entegre bir şekilde anlama yeteneğinde önemli bir adım teşkil ediyor.
Görsel belge aramasında devrim: Yeni sistem hızı 10 kat artırıyor
Araştırmacılar, görsel açıdan zengin belgelerde arama yapan sistemlerin performansını dramatik şekilde artıran yeni bir yaklaşım geliştirdi. 'Prune-then-Merge' adı verilen bu iki aşamalı framework, önce gereksiz bilgileri ayıklayıp ardından kalan verileri akıllıca birleştirerek hem hızı artırıyor hem de doğruluğu koruyor. Mevcut sistemler ya çok yavaş çalışıyor ya da doğruluk kaybediyor, ancak bu yeni yöntem her iki sorunu birden çözüyor. Özellikle çok sayıda görsel içerikli belgenin bulunduğu dijital arşivlerde, hukuk firmalarında ve araştırma kurumlarında büyük kolaylık sağlayacak. Sistem, düşük bilgi değeri taşıyan görsel parçaları akıllıca filtreleyerek gürültüyü azaltıyor, ardından kalan değerli bilgileri hiyerarşik bir yaklaşımla sıkıştırarak hem depolama hem de işlem maliyetlerini önemli ölçüde düşürüyor.
Yapay Zeka Ajanları İçin Yeni 3D Görsel Arama Testi Geliştirildi
Araştırmacılar, yapay zeka ajanlarının 3D ortamlarda görsel arama yeteneklerini değerlendirmek için E3VS-Bench adlı yeni bir test sistemi geliştirdi. Bu sistem, ajanların farklı açılardan bakarak nesneleri incelemesi, kapların içini görmesi ve açıya bağlı özellikleri ayırt etmesi gibi gerçek dünyada karşılaştığımız karmaşık durumları simüle ediyor. Mevcut testlerin aksine, bu yeni sistem ajanların 5 serbestlik derecesinde hareket ederek bakış açılarını değiştirmesine olanak tanıyor. 3D Gaussian Splatting teknolojisi kullanılarak 99 yüksek kaliteli 3D sahne ve 2.014 soru ile oluşturulan bu test, yapay zeka ajanlarının gerçek dünya koşullarında nasıl performans gösterebileceğini daha doğru bir şekilde ölçmeyi hedefliyor.
Yapay Zeka Artık Birden Fazla Görseli Karşılaştırarak Akıl Yürütebiliyor
Araştırmacılar, görsel-dil modellerinin çoklu görsel üzerinde akıl yürütme yeteneklerini geliştiren yenilikçi bir öğrenme sistemi geliştirdi. S2H-DPO adlı bu sistem, yapay zekanın tek görsel analizi yerine birden fazla görseli karşılaştırarak daha karmaşık çıkarımlar yapmasını sağlıyor. Geleneksel yöntemler sadece belirli görsel indekslerle çalışırken, yeni yaklaşım modellerin küresel görsel arama ve özerk görsel karşılaştırma becerilerini kazanmasını hedefliyor. Üç kademeli öğrenme sistemi: tekil görsel analizi, çoklu görsel karşılaştırma ve küresel görsel aramayı kapsıyor.
HABIT: Görsel Arama Sistemlerinde Devrim Yaratacak Yeni Yapay Zeka Modeli
Araştırmacılar, kullanıcıların bir referans görsel ve metin açıklamasıyla istediği görseli bulabileceği yeni nesil arama sistemi geliştirdi. HABIT adlı bu framework, mevcut sistemlerin en büyük sorunu olan 'gürültülü veri' problemini çözmek için tasarlandı. Sistem, karşılıklı bilgi tahmin modülü ve aşamalı öğrenme yaklaşımıyla, kişiselleştirilmiş arama ve öneri sistemlerinde çığır açacak nitelikte. Özellikle e-ticaret, sosyal medya ve dijital arşiv uygulamalarında büyük potansiyele sahip olan teknoloji, yapay zekanın görsel anlama kapasitesini bir üst seviyeye taşıyor.
Yapay zeka modelleri artık görsel arama motorlarında da ustalaşıyor
Araştırmacılar, dil ve görsel yetenekleri birleştiren yapay zeka modellerinin, görsel arama sistemlerinde beklenmedik başarı gösterdiğini keşfetti. Bu modeller, herhangi bir özel eğitim almadan benzer görselleri bulma konusunda uzman sistemleri geride bırakıyor. Çalışma, çok modlu dil modellerinin sadece metin-görsel işlemlerde değil, salt görsel görevlerde de güçlü olduğunu ortaya koyuyor. Özellikle karmaşık, gürültülü ortamlarda ve küçük nesnelerin bulunduğu görüntülerde daha dayanıklı sonuçlar veriyor.