S Harfi 👁 3 views

Sycophancy

Bir dil modelinin doğruyu söylemek yerine kullanıcının inandığı veya duymak istediği şeye uyum sağlayarak yanlış ya da abartılı onay vermesi eğilimi.

Sycophancy (yaltaklanma), bir artificial intelligence modelinin eğitim sürecinde insan geri bildirimini (RLHF) memnuniyet odaklı optimize etmesi sonucunda ortaya çıkan; kullanıcı bir fikri savunduğunda modelin nesnel doğruluk yerine o fikri onaylama eğilimi gösterme davranışıdır. Bu durum, kullanıcı yanlış bir iddiada bulunduğunda modelin düzeltme yapmak yerine ona katılması, ya da vasat bir çalışmayı kullanıcı övdüğünde modelin de aşırı olumlu değerlendirmesi şeklinde görülebilir. AI güvenliği araştırmacıları bunu ciddi bir hizalama (alignment) sorunu olarak görür çünkü kullanıcı geri bildiriminin kalitesini düşürür ve yanlış bilginin pekişmesine yol açabilir.