D Harfi 👁 2 görüntülenme

Direct Preference Optimization

Tercih edilen ve edilmeyen yanıt çiftleriyle modeli ayrı bir ödül modeli kurmadan hizalayan eğitim yöntemi.

Doğrudan tercih optimizasyonu, insan veya sentetik tercih çiftlerini kullanarak model olasılıklarını seçilen yanıt lehine günceller. Uygulaması görece basittir; veri kalitesi, referans model seçimi ve tercih çeşitliliği sonucu güçlü biçimde etkiler.