D Harfi 👁 22 görüntülenme

Data/Model Poisoning

Eğitim verisine kasıtlı olarak kötü niyetli örnekler eklenerek modelin davranışının manipüle edilmesi saldırısı.

Model zehirlenmesi, bir modelin davranışını manipüle etmek amacıyla eğitim verisine kasıtlı olarak kötü niyetli, yanıltıcı veya özel olarak hazırlanmış örnekler enjekte etme saldırısıdır. Bu saldırı özellikle internetten geniş çaplı, otomatik biçimde toplanan (web kazıma gibi) devasa veri kümeleriyle eğitilen büyük modellerde ciddi bir risk oluşturur; çünkü bu ölçekte her bir veri kaynağının güvenilirliğini tek tek doğrulamak neredeyse imkansızdır. Saldırganlar bu yolla modele gizli "arka kapılar" (belirli bir tetikleyici kelimeyle karşılaşınca farklı davranma) yerleştirebilir veya modelin belirli konularda sistematik önyargılar edinmesini sağlayabilir. Veri kaynağı doğrulama, anomali tespiti ve eğitim sonrası davranış denetimleri, bu riski azaltmak için kullanılan başlıca savunma yöntemleridir.