Yapay zeka alanında kritik bir gelişme yaşanırken, araştırmacılar büyük dil modellerinin kendi performanslarına olan güvenilirlik tahminlerini değerlendiren kapsamlı bir çalışma yürüttü. Bu araştırma, AI sistemlerinin hangi durumlarda kendilerine güvenebileceklerini belirleme yeteneğini analiz ediyor.

Çalışmada yedi farklı AI ailesinden 20 en gelişmiş model, altı farklı bilişsel kategoride toplam 524 test öğesi üzerinde değerlendirildi. Modeller, güven sinyallerinin doğruluğuna göre üç ana kategoriye ayrıldı: Geçerli, Belirsiz ve Geçersiz. Geçerli kategorisindeki modeller ortalama 0.624 AUROC skoru elde ederken, geçersiz kategoridekiler yalnızca 0.357 puan aldı.

En çarpıcı bulgulardan biri, DeepSeek-R1 modeli ile ilgili. Bu model tam kapsamda %85.3 doğruluk oranına sahipken, seçici tahmin modunda sadece %10 kapsama alanında bu oran %11.3'e kadar düştü. Bu durum, modellerin güven değerlendirmelerindeki kritik önemin altını çiziyor.

Araştırma sonuçları, üç katmanlı sınıflandırma sisteminin AUROC skorlarındaki varyansın %47'sini açıklayabildiğini gösteriyor. Bu bulgular, gelecekte daha güvenilir AI sistemleri geliştirmek için temel oluşturuyor ve modellerin kendi sınırlarını daha iyi tanıması açısından önemli içgörüler sunuyor.