Yapay zeka destekli kod yazma araçları son yıllarda yazılım geliştirme süreçlerini hızlandırsa da, beklenmedik bir güvenlik açığı barındırdığı ortaya çıktı. Araştırmacılar, bu sistemlerin temelindeki büyük dil modellerinin, API anahtarları ve şifreler gibi hassas bilgileri istemeden sızdırabileceğini keşfetti.

Çalışmanın en çarpıcı bulgusu, Byte-Pair Encoding (BPE) adlı tokenizasyon yönteminin yarattığı 'saçma sapan önyargı' olarak adlandırılan fenomen. Bu durumda, karakter seviyesinde karmaşık görünen gizli bilgiler, token seviyesinde basit yapıda olduğu için modeller tarafından daha kolay ezberleniyor.

Araştırmacılar, bu önyargının kökeninin, modellerin eğitim verisi ile gizli bilgi verisi arasındaki token dağılımı farkından kaynaklandığını belirledi. Model eğitimi sırasında karşılaşılan bu hassas veriler, daha sonra kod üretimi sırasında beklenmedik şekillerde ortaya çıkabiliyor.

Bu keşif, özellikle kelime hazinesi genişletme eğiliminin arttığı günümüzde daha da önem kazanıyor. Araştırma, AI kod asistanlarının güvenlik protokollerinin yeniden gözden geçirilmesi gerektiğine işaret ediyor ve geliştiricilerin bu risklere karşı daha bilinçli olmalarının önemini vurguluyor.