Direct Preference Optimization
Tercih edilen ve edilmeyen yanıt çiftleriyle modeli ayrı bir ödül modeli kurmadan hizalayan eğitim yöntemi.
Doğrudan tercih optimizasyonu, insan veya sentetik tercih çiftlerini kullanarak model olasılıklarını seçilen yanıt lehine günceller. Uygulaması görece basittir; veri kalitesi, referans model seçimi ve tercih çeşitliliği sonucu güçlü biçimde etkiler.

Member comments