Yapay zeka alanında önemli bir gelişme yaşandı. Araştırmacılar, büyük dil modellerinin bellek tüketimini önemli ölçüde azaltan yeni bir sıkıştırma tekniği geliştirdi.
Sequential KV Cache Compression olarak adlandırılan bu yöntem, transformer modellerinin çalışma sırasında oluşturdukları key-value (anahtar-değer) önbelleğini çok daha verimli şekilde sıkıştırıyor. Mevcut TurboQuant gibi yöntemler, bu verileri tek tek vektörler halinde işlerken, yeni teknik bunların aslında modelin eğitildiği dilin anlamlı örnekleri olduğunu göz önünde bulunduruyor.
İki katmanlı mimariye sahip sistem, ilk katmanda benzer metin ön eklerini tespit ederek probabilistic prefix deduplication işlemi gerçekleştiriyor. Bu aşamada, Probabilistic Language Tries metriği kullanılarak anlamsal olarak benzer metin parçaları belirleniyor. İkinci katmanda ise predictive delta coding tekniği ile sadece yeni vektörlerin öncekilerden farkları saklanıyor.
Bu yaklaşım, geleneksel Shannon entropi limitinin ötesine geçerek daha yüksek sıkıştırma oranları elde ediyor. Sonuç olarak yapay zeka uygulamaları daha az bellek kullanırken aynı performansı sergileyebiliyor, bu da özellikle mobil cihazlar ve sınırlı kaynaklı sistemler için büyük önem taşıyor.