A Harfi 👁 34 görüntülenme

Adversarial Attack

Bir modeli yanıltmak amacıyla girdiye insan gözüyle fark edilmeyecek kadar küçük, kasıtlı değişiklikler ekleme yöntemi.

Karşıt saldırı, bir yapay zeka modelini yanlış bir tahmin yapmaya zorlamak amacıyla, girdiye insan gözüyle fark edilmesi neredeyse imkansız, kasıtlı olarak hesaplanmış küçük değişiklikler (karşıt gürültü) ekleme yöntemidir. Klasik bir örnek, bir dur işareti levhasına eklenen, insan gözüyle basit bir çıkartma gibi görünen küçük bir desenin, bir otonom aracın görüntü tanıma modelini bu işareti tamamen farklı bir trafik levhası olarak sınıflandırmaya itmesidir. Bu tür saldırılar, sinir ağlarının insan algısından çok farklı, kırılgan karar sınırlarına sahip olabileceğini gösteren, güvenlik açısından ciddiye alınması gereken bir zafiyeti ortaya koyar. Model sağlamlığını artırmaya yönelik araştırmalar (karşıt eğitim gibi), bu tür saldırılara karşı direnç kazandırmayı hedefler.