“mixture of experts” için sonuçlar
4 sonuç bulundu. Sonuçları kategoriye göre daraltabilirsin.
Yapay Zeka Atomik Simülasyonlarında Uzman Karışımı Mimarisi Çığır Açtı
Büyük ölçekli atomik simülasyonlar, malzeme bilimi ve ilaç geliştirmeden katalizöre kadar pek çok alanda kritik öneme sahip. Bu simülasyonların kalbinde yer alan Makine Öğrenmeli Atomik Potansiyeller (MLAP'lar), atom gruplarının birbirleriyle nasıl etkileştiğini yüksek doğrulukla tahmin eder. Ancak bu modellerin ifade kapasitesini artırmak, hesaplama maliyetlerini patlatmadan oldukça zorlu bir iş. Çin merkezli araştırmacılar, DPA3 adlı çerçeve üzerinde 'Uzman Karışımı' (Mixture of Experts - MoE) mimarisini sistematik biçimde test ederek bu denklemi değiştirmeyi başardı. Çalışmada, modelin her seferinde yalnızca belirli 'uzman' alt ağları devreye alan seyrek aktivasyon yaklaşımı, paylaşımlı uzmanlarla birleştirildiğinde ciddi performans artışı sağladı. Ayrıca doğrusal olmayan uzman formülasyonlarının, doğrusal yaklaşımlara kıyasla belirgin şekilde daha iyi sonuç verdiği gösterildi. Özellikle dikkat çekici olan bulgu ise yönlendirme stratejisine ilişkin: Konfigürasyon düzeyinde değil, element düzeyinde yönlendirme yapıldığında model çok daha tutarlı ve kararlı davranıyor. Geliştirilen model, OMol25, OMat24 ve OC20M gibi sektörün önde gelen kıyaslama veri setlerinde tüm DPA3 tabanlı rakip modelleri geride bıraktı.
Yapay Zeka Kod Üretiminde Uzman Yönlendirme Kalıpları Keşfedildi
Araştırmacılar, yapay zeka modellerinin kod üretimi sırasında nasıl çalıştığını daha iyi anlamak için Qwen3.5-35B modelini incelediler. Mixture-of-Experts (MoE) mimarisine sahip bu model, aynı başlangıç kodundan farklı kod örnekleri üretirken hangi uzman modülleri kullandığını analiz ettiler. 851 tamamlanmış kod örneği üzerinde yapılan çalışmada, aynı kodları üreten durumlar ile farklı kodlar üreten durumlar arasında uzman seçimi benzerliğinin nasıl değiştiğini ortaya koydular. Bulgular, AI modellerinin kod üretiminde daha öngörülebilir davrandığını ve bu durumun hesaplama verimliliğini artırmak için kullanılabileceğini gösteriyor.
Yapay Zeka Uzman Karışımları İçin Yeni Yönlendirme Mekanizması Keşfedildi
Araştırmacılar, Mixture-of-Experts (MoE) modellerinde gizli katmanların nasıl çalıştığını açıklayan yenilikçi bir ayrıştırma yöntemi geliştirdi. Bu yöntem, her katmanın gizli durumunu iki bileşene ayırıyor: yönlendirmeyi kontrol eden bir sinyal ve yönlendiricinin göremediği bir içerik kanalı. Altı farklı MoE mimarisinde yapılan testler, modellerin yüzeysel özellikleri içerik kanalında sakladığını, kontrol sinyalinin ise katmanlar arası soyut işlevleri kodladığını gösterdi. Bu keşif, yapay zeka modellerinin iç işleyişini anlamada önemli bir adım.
Yapay Zeka Modelleri için Yeni Sıkıştırma Tekniği: Bellek Tüketimini Azaltan CD-MoE
Araştırmacılar, büyük yapay zeka modellerinin bellek gereksinimlerini dramatik şekilde azaltan yenilikçi bir yöntem geliştirdi. ConDense-MoE (CD-MoE) adlı bu teknik, Mixture-of-Experts modellerindeki katmanları tamamen çıkarmak yerine, bunları daha küçük ve yoğun yapılara dönüştürüyor. Geleneksel budama yöntemleri model performansında önemli kayıplara neden olurken, CD-MoE büyük ve seyrek MoE katmanlarını az sayıda uzmanla çalışan, donanım dostu küçük katmanlara sıkıştırıyor. Bu yaklaşım özellikle paylaşılan uzmanları olan ince taneli MoE modelleri için tasarlanmış durumda. Büyük dil modellerinin yaygınlaştığı dönemde, bu gelişme yapay zeka modellerinin gerçek dünya uygulamalarında daha pratik hale gelmesini sağlayabilir.