Yapay zeka alanında büyük modellerin bellek tüketimi sorunu için umut verici bir çözüm ortaya çıktı. Araştırmacılar, Mixture-of-Experts (MoE) modellerinin bellek gereksinimlerini önemli ölçüde azaltan ConDense-MoE (CD-MoE) adlı yenilikçi bir teknik geliştirdi.
MoE modelleri, aynı veya daha az aktif parametre kullanarak sinir ağlarını büyütme konusunda başarılı olmalarına rağmen, devasa bellek gereksinimleri gerçek dünya uygulamalarında ciddi sınırlamalar yaratıyordu. Özellikle büyük dil modellerinin yaygınlaştığı günümüzde bu sorun daha da kritik hale geldi.
Mevcut yaklaşımlar MoE katmanlarını tamamen kaldırarak belleği azaltmaya çalışıyor, ancak bu yöntem model performansında kayda değer düşüşlere neden oluyor. CD-MoE ise farklı bir strateji benimsiyor: büyük ve seyrek MoE katmanlarını tamamen silmek yerine, bunları küçük ve yoğun katmanlara sıkıştırıyor.
Bu yeni yaklaşım, tüm tokenler için yalnızca birkaç uzmanın aktif olduğu sistemler oluşturarak hem bellek tasarrufu sağlıyor hem de donanım uyumluluğunu koruyor. Teknik, özellikle Feed-Forward ağların küçük uzmanlara bölündüğü ve bazı uzmanların paylaşılan uzman olarak ayrıldığı ince taneli MoE modelleri için optimize edilmiş.
Bu gelişme, büyük yapay zeka modellerinin daha geniş kullanıcı kitleleri tarafından erişilebilir hale gelmesi açısından önemli bir adım olarak değerlendiriliyor.