Yapay zeka alanında ses üretim teknolojileri hızla gelişirken, bu sistemlerin performansını ölçecek kapsamlı test yöntemlerine ihtiyaç duyuluyor. Araştırmacılar bu boşluğu doldurmak için MINT-Bench adını verdikleri yenilikçi bir değerlendirme sistemi geliştirdi.
Bu benchmark sistemi, yapay zekanın verilen metni okurken aynı zamanda ses tonu, hız ve stil gibi özel komutları ne kadar başarılı bir şekilde uygulayabildiğini test ediyor. Sistem, hiyerarşik bir değerlendirme yapısı kullanarak içerik tutarlılığı, komut takibi ve algısal kalite olmak üzere üç temel kriterde performans ölçümü yapıyor.
On farklı dilde gerçekleştirilen testlerin sonuçları oldukça çarpıcı. Ticari sistemler genel performansta öne çıkarken, açık kaynak modeller özellikle Çince gibi yerel dillerde beklenmedik başarılar gösteriyor. Hatta bazı durumlarda ticari rakiplerini geride bırakabiliyorlar.
Araştırma ayrıca daha karmaşık komutların sistemler için daha zorlu olduğunu ortaya koyuyor. Bu bulgular, ses üretim teknolojilerinin henüz tam olarak olgunlaşmadığını ve geliştirilmesi gereken alanları net bir şekilde gösteriyor.