Yapay sinir ağlarının eğitimi, temelde büyük ölçekli matris optimizasyonu problemidir, ancak parametrelerin matris yapısı uzun süre göz ardı edilmiştir. Son dönemde bu yapısal özellikleri açıkça kullanan Muon optimizatörü, temel model eğitimindeki güçlü performansıyla dikkat çekmiştir.

Araştırmacılar, Muon'un başarısındaki kilit bileşen olan matris ortogonalizasyonunu geliştirerek düşük-rankli ortogonalizasyon yöntemini önerdiler. Bu yenilikçi yaklaşım, sinir ağı eğitimi sırasında gradyanların düşük-rankli doğasından yararlanarak ortogonalizasyon işlemini gerçekleştiriyor.

Geliştirilen yöntem üzerinden araştırmacılar, düşük-rankli matris-işaretli gradyan iniş (MSGD) algoritması ve Muon'un düşük-rankli varyantını tanıttılar. Sayısal deneyler, düşük-rankli ortogonalizasyonun üstün performansını gösterirken, düşük-rankli Muon'un GPT-2 ve LLaMA ön eğitiminde umut verici sonuçlar elde ettiğini ortaya koydu.

Özellikle büyük model boyutlarındaki görevlerde, yeni yöntem dikkatli şekilde ayarlanmış standart Muon'u geçmeyi başardı. Bu gelişme, yapay zeka modellerinin eğitim süreçlerinin daha verimli hale getirilmesi için önemli bir ilerleme kaydediyor.