R Harfi 👁 22 görüntülenme

Red Teaming

Bir yapay zeka sisteminin güvenlik açıklarını ve istenmeyen davranışlarını bulmak için kasıtlı olarak saldırgan gibi test edilmesi.

Kırmızı takım testi, bir yapay zeka sisteminin güvenlik açıklarını, önyargılarını ve istenmeyen davranışlarını sistematik biçimde ortaya çıkarmak amacıyla, uzmanların kasıtlı olarak kötü niyetli bir kullanıcı ya da saldırgan gibi davranarak modeli zorlamasıdır. Bu süreçte kırmızı takım üyeleri, modeli jailbreak etmeye, zararlı veya yasa dışı içerik üretmeye ikna etmeye, yanlış bilgi vermeye veya gizli talimatları ifşa etmeye zorlayacak yaratıcı promptlar dener ve bulunan her açığı belgeleyerek geliştirme ekibine raporlar. Terim aslında askeri ve siber güvenlik tatbikatlarından ödünç alınmıştır ve büyük dil modeli geliştiricileri, bir modeli kamuya açmadan önce bu tür sistematik saldırı testlerinden geçirmeyi güvenlik sürecinin standart bir parçası haline getirmiştir.