Yapay zeka alanında önemli bir paradoks ortaya çıktı: En gelişmiş dil modelleri standart testlerde mükemmel performans gösterirken, gerçek dünyada hedeflenen etkiyi yaratmakta başarısız oluyor.

Yeni araştırma, büyük dil modellerinin eğitim sektöründeki performansını inceledi ve şaşırtıcı sonuçlar elde etti. Okul çağındaki çocukların öğretimi gibi karmaşık görevlerde, tüm AI modelleri uzman öğretmenlerin davranışlarından ziyade birbirlerine daha çok benziyorlar.

Bu benzerlik tesadüf değil - araştırmacılar, farklı AI modellerinin ortak önyargılar taşıdığını keşfetti. Bu önyargılar, öğretim kalitesini ölçen göstergelerle zayıf bir uyum gösteriyor ve daha da endişe verici olarak, öğrencilerin öğrenme sonuçlarını olumsuz etkiliyor.

Durumu daha da kötüleştiren bulgu, birden fazla modelin bir araya getirilmesinin sorunu çözmediği, aksine daha da derinleştirdiği. Hem oybirliği yöntemi hem de benchmark performansına dayalı ağırlıklandırma, öğrenme süreciyle olan uyumsuzluğu artırıyor.

Bu araştırma, AI'ların benchmark başarılarının gerçek dünya etkinliğini garanti etmediğini gösteren önemli bir uyarı niteliği taşıyor. Eğitim gibi kritik alanlarda AI kullanımında daha dikkatli yaklaşımlar gerektiğini ortaya koyuyor.