Yapay zeka alanında konuşma tabanlı büyük dil modelleri (SLLM) hızla yaygınlaşırken, bu sistemlerin değerlendirilmesi konusunda önemli bir eksiklik vardı. Çoğu test, yazılı metinlerle yapılıyor ancak kullanıcılar gerçek hayatta bu sistemlerle konuşarak itkileşim kuruyor.

Araştırmacılar bu sorunu çözmek için DoWhatISay (DOWIS) adlı kapsamlı bir veri seti geliştirdi. Bu veri seti, insan sesiyle kaydedilmiş sesli ve yazılı talimatları içeriyor ve mevcut herhangi bir değerlendirme standardıyla kullanılabilecek şekilde tasarlandı.

DOWIS'in kapsamı oldukça geniş: 9 farklı görev türü, 11 dil ve her görev-dil çifti için 10 farklı talim varyantı bulunuyor. Bu varyantlar beş farklı üslup kategorisinde gruplandırılmış durumda.

En güncel konuşma tabanlı AI modellerinin bu veri setiyle yapılan testleri ilginç sonuçlar ortaya çıkardı. Yazılı talimatlar tutarlı bir şekilde sesli talimatlara göre daha iyi performans gösteriyor. Bu fark özellikle az kaynaklı dillerde ve çapraz dil görevlerinde daha belirgin hale geliyor.

Ancak bir istisna var: Çıktısı konuşma olan görevlerde, sesli talimatlar yazılı talimatlara yakın performans sergiliyor. Bu durum, konuşma tabanlı değerlendirmelerin gerekliliğini vurguluyor ve gelecekteki AI sistemlerinin geliştirilmesi için yol haritası çiziyor.