Yapay zekâ güvenliği alanında önemli bir gelişme yaşandı. Araştırmacılar, büyük dil modellerinin (LLM) özellikle finans ve sağlık sektörleri gibi kritik alanlardaki güvenlik açıklarını sistematik olarak tespit edebilen StealthGraph adlı yeni bir framework geliştirdi.
Mevcut durumda, alan-specific zararlı istek veri setleri oldukça sınırlı ve büyük ölçüde manuel olarak oluşturuluyor. Hâlihazırdaki kamu veri setleri genellikle açık zararlı isteklere odaklanıyor ve modern LLM savunma sistemleri bu tür istekleri kolayca tespit edip reddedebiliyor.
StealthGraph'ın en önemli özelliği, dolaylı domain bilgisi aracılığıyla ifade edilen örtülü zararlı istekleri üretebilmesi. Bu tür isteklerin tespiti çok daha zor ve gerçek dünya tehditlerini daha iyi yansıtıyor. Sistem, iki temel zorluğu aşmayı hedefliyor: domain bilgisini işlem yapılabilir kısıtlamalara dönüştürmek ve üretilen zararlı isteklerin örtülülük seviyesini artırmak.
Framework, bilgi grafiklerinin rehberliğinde zararlı istek üretimi yaparak domain-relevant istekleri sistematik olarak üretiyor. Ardından, açık zararlı istekleri iki aşamalı gizleme stratejisi ile örtülü varyantlara dönüştürüyor. Bu yaklaşım, yapay zekâ güvenliği testlerinde daha gerçekçi ve etkili bir değerlendirme imkânı sunuyor.