R Harfi 👁 22 görüntülenme Güncel ve doğrulandıSon doğrulama: 26.07.2026

Reinforcement Learning from Human Feedback / RLHF

Modelin insan tercihlerine göre ödüllendirilerek hizalandığı eğitim yöntemi.

RLHF'de insanlar model çıktılarını karşılaştırıp derecelendirir, bu tercihlerden bir ödül modeli eğitilir ve ana model pekiştirmeli öğrenme ile bu ödülü maksimize edecek şekilde ayarlanır. ChatGPT gibi asistanların yardımseverliğini artırmada kritik rol oynamıştır.