G Harfi 👁 24 görüntülenme

Gradient Descent

Kayıp fonksiyonunu en aza indirmek için model parametrelerini adım adım güncelleyen optimizasyon algoritması.

Gradyan inişi (gradient descent), bir modelin kayıp fonksiyonunu -yani tahminlerin gerçek değerlerden ne kadar saptığını ölçen fonksiyonu- en aza indirmek amacıyla model parametrelerini adım adım güncelleyen temel bir optimizasyon algoritmasıdır. Kayıp fonksiyonu, parametre uzayında bir "yüzey" gibi düşünülebilir; algoritma bu yüzeyde bulunulan noktadaki eğimi (gradyanı) hesaplayarak, eğimin en dik azaldığı yöne doğru küçük adımlar atar. Bu adımların büyüklüğünü "öğrenme oranı" (learning rate) belirler: çok büyük bir öğrenme oranı optimum noktayı atlayarak eğitimi kararsızlaştırabilir, çok küçük bir öğrenme oranı ise eğitimi gereksiz yere yavaşlatır.

Klasik gradyan inişi tüm veri kümesi üzerinden gradyan hesaplarken, pratikte bu hesaplama açısından maliyetli olduğundan mini-batch stokastik gradyan inişi (SGD) tercih edilir; her adımda verinin küçük bir alt kümesi kullanılır. Zamanla momentum, RMSprop ve özellikle günümüz derin öğrenmesinde standart haline gelen Adam gibi daha gelişmiş varyantlar geliştirilmiştir; bunlar öğrenme oranını adaptif biçimde ayarlayarak yakınsamayı hızlandırır ve yerel minimumlara takılma riskini azaltır. Geri yayılımın hesapladığı gradyanları kullanan bu algoritma, sinir ağlarından lojistik regresyona kadar hemen hemen tüm modern makine öğrenmesi modellerinin eğitiminin motorudur.