Reinforcement Learning from Human Feedback / RLHF
Modelin insan tercihlerine göre ödüllendirilerek hizalandığı eğitim yöntemi.
RLHF'de insanlar model çıktılarını karşılaştırıp derecelendirir, bu tercihlerden bir ödül modeli eğitilir ve ana model pekiştirmeli öğrenme ile bu ödülü maksimize edecek şekilde ayarlanır. ChatGPT gibi asistanların yardımseverliğini artırmada kritik rol oynamıştır.

Üye yorumları